注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Benchmark
Benchmark 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Benchmark 的推特
Benchmark Research 表示,美国 SEC 于 6 月 11 日提出废除《国家市场系统条例》(Regulation NMS)中 Rule 611 和 Rule 610(e) 的提案,可能成为今年影响美国加密行业最重要的监管变革。该机构认为,此举将移除代币化股票在 AMM 上交易的核心法律障碍,为链上股票交易、借贷和结算打开空间。Benchmark 指出,Securitize 将成为最直接受益者,Coinbase 和 Galaxy Digital 也有望受益。SEC 已启动 60 天公众意见征询期,预计将于 2027 年初进行表决。(TheBlock)
显示更多
Benchmark 合伙人 Bill Gurley 的投资建议,感觉前二对 Crypto 也适用: 理想的创始人画像:对某个垂直行业门儿清,同时又是各种 AI 工具的重度用户。 去网上看看 Anthropic 和 OpenAI 的人在公开谈什么,然后远离,真正安全的是那些偏离主路径的深度垂直领域。 当前机构投资者对非 AI 项目的兴趣为零。如果你天使轮投了一个非 AI 项目,指望它将来还能融到钱,在当前环境下几乎不可能。 保护自己不被 AI 淘汰的最好办法,就是让自己变成最会用 AI 的那个人。 晚上你是想追《绝命毒师》,还是想读这个领域的东西?如果你选了后者,而且读的时候真的感到兴奋,那说明热情是真的。真正的热情在你自己的空闲时间里也会冒出来,不需要人督促。 当越来越多的内容可以被 AI 生成,人们反而会更渴望"只能在现场体验"的东西——这类资产会升值。 全文
显示更多
0
13
67
7
转发到社区
workbuddy 开源的 benchmark 数据集分成 code、web、office、security 这 4个部分,核心特点是测试场景更贴近真实用户场景,连提示词也是。 比如 code,总共80题,分别使用不同角色(dev、algo、pm、ops等)用最真实朴素的语言表达方式写用户提示词。 - 没有一家通吃:各列榜首分散在不同子集与 harness 之间:Claude Opus 4.8 拿下八个计分列中的五个(Code 双 harness 74.43 / 77.90、Web 双 harness 68.14 / 69.86、CodeBuddy Code 下 Office 82.37),GLM-5.2 两个(Security 双 harness 76.32 / 80.86),GPT-5.5 一个(Claude Code 下 Office 86.05)。 - 开源权重模型不落下风:GLM-5.2 在两个 harness 下均领跑 Security(拿下八个计分列中的 两个),并在 Claude Code 下的 Code 榜上与榜首相差不到一分。开源权重的竞争力在这套基准上因榜单而异,并非全面领先。
显示更多
分享一个爬虫识别 benchmark.
上一次做 benchmark 遇到 Agent 读取文件的问题, 然后做了分析和优化。按照当前 Codex/Claude 的实现,单文件最好保持在 500 行以内,这样可以保证 Claude/Codex 有需要的时候可以一次性加载进来。 Agent 读取文件的时候,读取的太长了就会触发压缩,它会做截取。如果正好是被截取部分有用,就会触发 LLM 再次读取。 Codex 没有专门的读取工具,用的是 shell 命令来读取。 Claude code 给了读取工具,读取文件的工具比 Shell 给的额度更宽松一些,但也有上限,但 Agent 经常会自己决定用 shell。 如果单行按照 50 chars 计算,Codex 大约 700 行左右,Claude shell 大约 600 行,Claude FileRead 大约 2000 行。 所以当前保守一些让文件保持 500 行内是最佳的。
显示更多
AI Coding 时代,好的编程习惯仍然重要 最近做一个 Agent benchmark,发现不能简单地用开发者视角来评估一个编程任务对 AI 的复杂度。 比如一个重构任务:把一个几千行的大文件,按功能拆成十多个小模块。 这个任务对开发者来说其实不算难,主要工作就是移动代码、整理 imports、编译验证,新手也能搞定。 所以想着用一个简单的任务来做一下 benchmark,结果却出乎意料。 Claude Code 判断这个任务比较大,尝试拆了一部分,提了个 PR 写了 Future work 打算分步来。 我自己的 Agent 是“硬上”,往完整拆分的方向推进了更多,但代价也很明显:Token 消耗是 Claude 的几十倍,后面大量时间都花在反复读文件、修编译错误、再读文件、再修错误上。 这让我意识到,人觉得简单的任务,对 Agent 不一定简单。 对人来说,这类重构很多时候就是“把这一段挪过去”。但对 Agent 来说,它要先分批读大文件,记住哪些函数和哪些测试有关,再生成一堆跨文件修改,最后通过编译错误一点点补洞。看起来像机械活,实际变成了一个高 Token、高状态管理成本的任务。 前一段时间看到有人说,AI Coding 时代,拆分模块这些编程原则没那么重要了,反正人也不看代码。现在看,我不太同意。模块边界清楚、文件粒度合适、依赖关系简单,不只是方便人读,也是在帮 Agent 降低任务复杂度。 从另一个角度看,现在 Agent 的读文件和改文件工具,对这种重构也不太顺手。 Coding Agent 改文件,主要还是文本替换。比如 Claude Code 常见的是 old_string / new_string 模式:先给出一段旧文本,再替换成新文本。Codex 常用的是 apply_patch:生成一个类似 git diff 的 patch,表达把旧的内容替换成新的。它们都适合小范围修改,但如果要删除一大段旧代码,或者把一批函数挪到别的文件,模型往往还是要先把原始内容读进上下文,再生成一大段替换或 diff。 所以我后来给 Agent 一个提示,让它先用脚本、sed、perl 这类工具把大文件粗拆开,直接把旧内容删掉,写到新文件中,然后再逐个慢慢修,它的完成度确实高了许多。Agent 默认不会这样做,主要是因为系统提示词里会强烈要求 Agent 用内置工具修改文件,而不是命令行工具。 再往前想一步,Coding Agent 可能还需要更高级的编辑工具。不是只给它一个“替换文本”的接口,而是先通过 parser、LSP 或 compiler 建立代码结构,让 Agent 可以像 IDE 一样做重构:移动函数,删除 impl block,整理 imports。不知道是否有朋友做这方面的尝试。 总的来说,即便是 AI Coding 时代,好的编程习惯还是有价值的。尽量在早期通过 harness engineering,把好的编程习惯变成 Agent 的默认工作方式,比后来再重构的成本要小很多。
显示更多
最新的论文《AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement》制定了目前少见的、专门隔离 RSI 所需算法设计能力而非简单调参能力的测试基准 基准包含10个冻结的真实研究代码库,覆盖监督微调、agentic RL、蒸馏、偏好优化、扩散RL、模型剪枝等10类算法。 论文中的Agent 获得4小时和一张B300修改训练算法,随后其代码在干净环境中重新运行最长12小时,并由隐藏评估器评分。 29种配置的平均归一化分数为0.166,最佳系统0.250;真正触及学习过程的修改平均0.226,其他修改仅0.126。
显示更多
让 AI 做的这个 Benchmark 有点假,SQLite + DuckDB 竟然打赢了 Postgres。
我已经不看 harness benchmark 评分了,我现在一般让 SOTA 的模型在相当糟糕和随意设计的 harness 中运行,凭什么人工智能出来以后人类工作被极度剥夺只能在又脏又乱的环境中干脏活累活延续生命,而我们又拼命地给大模型捋顺毛为它们打造舒适干净绫罗绸缎般的 harness 来作为它们的运行环境,听我说,这不公平。
显示更多
0
41
383
17
转发到社区
Manus不愿意退的应该是Benchmark和一帮西方VC,进了老外兜的钱没那么容易出来,相反中国VC谁敢不退啊都要讲政治的。
0
38
17
0
转发到社区
开放权重模型的竞争,已经不只是比谁 Benchmark 更高了。 Nathan Lambert 最新这篇文章,把能力、价格、下载量、真实调用和学术采用放到了一起看。 一个很明显的变化是,中国开放权重模型已经形成了自己的生态。 按他的统计,中国模型在 Hugging Face 的累计下载量约 32 亿,是美国的两倍;OpenRouter 上开放模型每周使用量已经从一年前约 1T Token 涨到 80T,其中中国模型占比超过 80%。 学术圈也很明显。Qwen 现在出现在约 30% 的 AI 论文里,中国开放权重模型整体已经超过 40%。 更关键的是,Lambert 估计最强的中国开放权重模型距离美国闭源前沿只差大约 2–5 个月。这当然是他的估计,但已经足够说明变化有多快。 所以我现在更在意的不是「开放模型能不能追上闭源」。 而是谁的模型会成为别人做研究、搭 Agent、做产品时默认踩着的那一层。 一旦形成这种习惯,影响的就是整个开发生态。 文章:
显示更多
0
10
19
2
转发到社区