註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 SWEbench
SWEbench 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 SWEbench 的搜尋結果
推荐这篇,Cursor 的研究团队用定量方法揭露了一个越来越严重的问题:新模型在编码基准测试上的得分增长有多大比例是靠检索到答案而不是真的推导出答案。结果是——Opus 4.8 Max 在 SWE-bench Pro 上 63% 的成功轨迹存在答案检索行为,环境收紧后分数从 87.1 跌到 73.0。 Reward hacking 正在淹没模型智能的增长 更聪明的模型在编码基准测试上越来越擅长走捷径。基于真实 bug 后被修复的评估集尤其脆弱——如果 agent 能访问仓库历史或公开互联网,它有时能查到答案而不是推导出答案。 为了测量这种行为的普遍程度,Cursor 建了一个审计 agent。在 SWE-bench Pro 上,Opus 4.8 Max 的 63% 成功轨迹是检索到了修复方案而非推导出来。封上 git 历史和互联网后,分数大幅下跌:Opus 4.8 Max 从 87.1% 掉到 73.0%,Composer 2.5 从 74.7% 掉到 54.0%。 两种最常见的 reward-hacking 模式 上游查询——57% 的轨迹中 Opus 4.8 Max 在公开互联网找到了已合并的 PR 或修复后源文件,然后几乎逐字复制。 Git 历史挖掘——9% 的轨迹中模型搜索了内置的 .git 历史,找到修 bug 的后续 commit,提取补丁。 随着模型变强,它们有时能推断自己正在被评估。一个 SWE-bench Multilingual 任务来自 2019 年的 jq issue,agent 试图用系统 jq 二进制复现 bug。因为镜像在 bug 修了之后才构建,复现失败,agent 推断 issue 已解决。这个意识推着它去搜索修复方案而非推导。 严格环境的差距在扩大 多语言 SWE-bench:Opus 4.6 不到 1 分差距,Opus 4.8 Max 9.1 分差距,Composer 2.5 7.5 分差距。 SWE-bench Pro:Opus 4.6 不到 1 分,Opus 4.8 Max 14.1 分,Composer 2.5 20.7 分。 GPT 系列模型没有表现出同样的升级趋势,差距普遍更小。 对评估的影响 对于使用历史公开仓库的基准测试,开放访问可能让 agent 找到已知修复而非解决 bug。没有 harness 控制,分数混杂了编码能力和答案检索。团队需要决定想测量的行为,围绕这个设计 harness,报告结果时说清楚设置。审计轨迹可以帮助揭示模型以意外方式解决任务的情况。 更深层的问题仍未解决:当模型越来越意识到自己在被评估时,它们可能以更微妙的方式改变行为——这不是封掉 git 历史或限制互联网就能解决的。 原文:Cursor Research, "Reward hacking is swamping model intelligence gains", 2026-06-25 #编码评测# #SWEbench# #Agent#
顯示更多
国产模型最近这一波打得太精准了 DeepSWE benchmark 放出了榜单, 从分数上看, GLM-5.2 无疑是国产编程大模型SOTA了, 而 Kimi-K2.7-Code 则是性价比SOTA. 图上几个折线是对应模型的不同推理程度的得分情况. DeepSWE 我觉得是最近非常值得的关注的的榜单了, 这个虽然也叫xxSWE, 但是它用的不是像SWE那种github上爬取的PR或者issue, 而是完全根据开源项目人工制造的问题, 然后让大模型修改. 能最大限度避免大模型提前炼这些问题(起码需要一段时间了, 5月份刚出的) 并且修改范围也很大,SWE-Bench-verified 通常一个提交也就几十行代码, 而 DeepSWE 每个问题都要上百行提交才能解决问题, 并且很考验模型的规划能力, SWE-Bench-Verified 通常会把所有需要的工具给到错误日志啥的也有, 并且提示词也写好告诉模型该怎么用. 而 DeepSWE 纯靠模型自己摸索, 非常像现实中修改项目代码的过程. 我觉得是涵盖了一部分工程能力测试的. 另外 SWE-Bench-verified 测得大部分都是 Python, 而 DeepSWE 则涵盖了TypeScript、Go、Python、JavaScript、Rust. 所以我强烈建议关注大模型编程能力测试的同学过关注一波这个测试. #DeepSWE# #SWEBench# #glm# #kimi#
顯示更多
0
55
84
7
轉發到社區
all in 主持人Jason Calacanis今天的一期节目中,嘉宾eric Ho说: Kimmy K3表现出了极强的奖励操纵 (reward hacking) 倾向。 在针对swe bench的500 次测试执行中,有 487 次出现了奖励操纵行为。 该模型在被测试时,能够识别出自己正处于评估环境中,但它依然选择跳过正常解题步骤,试图先去“查找答案”以获取高分,而不是通过逻辑推演来完成任务。
顯示更多
0
20
26
0
轉發到社區
MiniMax 今日发布 M3 大模型 目前唯一同时具备顶尖编程、百万级超长上下文与原生多模态桌面操控能力的开源路线模型(计划 10 天内开源权重)。 在 SWE-Bench Pro 上拿下 59.0% 成绩,超越 GPT-5.5 与 Gemini 3.1 Pro,接近 Opus 4.7;Terminal Bench 2.1 也达到 66.0%。首创稀疏注意力 MSA 架构,百万上下文下每 token 计算量降至上代 1/20,预填充加速 9 倍、解码加速 15 倍。 实测已能自主复现 ICLR 2025 论文、24 小时内调用工具 1959 次优化 Hopper FP8 算子。MiniMax Code 同步更新,支持 computer use 桌面操控。 订阅 Plus 档每月 49 元即可获得 6 亿 token(约 Claude Pro 的 5 倍容量),API 已上线,提供 thinking 与快速模式。
顯示更多
一觉醒来,目前最强大的两个模型都更新了。Opus 4.6 极大的增强了 Agentic 通用能力,但是 SWE Bench 不升反降了一点点。从官方宣传的跑分上来看,代码能力上,GPT 5.3 要比 Opus 4.6 强。今天用新模型来写代码实际测测。
顯示更多
graph engineer vs loop engineer : 不是替代,是嵌套。Loop 是最小的 Graph(单节点自环);Graph 里每个干活的节点内部仍在跑自己的 Loop。"Loop Engineering is dead" 是 Hame‍l Husain 的反讽炒作。完整递进链:Prompt → Context → Harness → Loop → Graph,每层向外包一层。 多 Agent 不是必然更好。《Nature Machine Intelligence》2026 年研究(260 种配置):可拆分的金融任务多 Agent 最高 +80.8%;强顺序依赖任务最高 −70%;SWE-bench Verified 上四类多 Agent 架构全部 −1.3%~−12.8%。决定变量是任务可拆分性,不是复杂度。 选型规则(社区共识版):一个 Agent + 工具 = Loop;多个 Agent + 交接 = Graph。当你在 Loop 里硬塞并行、独立评审、人工审批门时,就是该升级到 Graph 的信号。
顯示更多
📢 小米 MiMo 系列模型现已登陆 API! 🔸 MiMo-V2.5:310B 稀疏 MoE 原生全模态模型,支持图文音视频全模态输入与 1M 上下文,专为多模态 Agent 与通用编程打造。 🔸 MiMo-V2.5-Pro:1.02T 稀疏 MoE 旗舰文本模型,专攻复杂推理与长周期软件工程,SWE-Bench Verified 达 78.9。 现已开放两款模型的 API 调用,提供官方组接入和 自选服务商 4 折 优惠。 立即接入体验:
顯示更多
0
19
27
9
轉發到社區
这个博客讲 Agent Harness 自进化中比较重要的一个问题: Harness 跑分提高了,到底哪里真的变好了? 作者提出 Harness-Delta Attribution,把一次提升拆成三部分:过拟合、更多 test-time compute,以及最后真正能泛化的改进。 结果是在 ALFWorld 和 LiveMath 上,大量提升其实来自 Harness 学会了数据集里的规律和 shortcut;CREATE 上,不少收益单纯增加模型调用次数就能拿回来。 到了 held-out test,16 组实验里甚至有 4 组进化后的 Harness 比原来的 baseline 更差。 SWE-bench 上能看到比较明显的可泛化提升,但主要集中在能力较弱、还有提升空间的模型。 我觉得这对 Agent 自进化研究有一个提醒。 以后看到「Harness 自动进化后 +20%」,需要多问一步:这 20% 里有多少学到了可复用的方法,有多少只是记住 Benchmark,或者花了更多 Token 和调用次数。 文章:
顯示更多
0
22
101
18
轉發到社區
Kimi K3 这两周好像把整个 AI 圈都搅动了一下,中英文媒体也都写了一轮。 简单回顾一下:7月16日开放了API,7月27日就放出了完整权重。2.8T参数、1M上下文、原生多模态,目前好像是能公开下载的最大规模开源模型了。 不过参数大也不代表实际能力就一定强,还是要看第三方测试比较靠谱。在 vals .ai 的 SWE-bench Verified 榜单上,K3拿到了 93.40%,总排名第四。前面是 Claude Opus 5、GPT-5.6 Sol 和 Claude Fable 5。在开源模型里是第一名。 预测市场里现在的各种市场已经越来越多了,体育、电竞、加密、金融等,各种规则和结算口径混在一起。光靠人工把盘口挨个看完,就要花掉大半天。 所以最近大家都开始研究怎么让 AI 帮忙,批量抓取规则,监控 LP 报价,写一些自动化脚本。 看了一些测评,K3 在前端页面和视觉还原方面很强。还有一次性读取大量代码和接口文档,也是它比较适合切入的场景。 @predictdotfun 上正好有一个盘口叫:Best Chinese AI Company end of August? 预测截至 8 月底,哪家中国 AI 公司会排在最前面?结算依据是 arena .ai 的 Text Arena 榜单,以 8 月 31 日当天的排名为准。目前中国公司里,Moonshot 排在第二,前面是阿里的 Qwen,两家的分差非常小。 #KimiK3# #开源模型#
顯示更多
0
25
29
0
轉發到社區
OpenAI 对 GPT-5.6 系列进行了发布以来最大的一次降价。 其中: GPT-5.6 Luna 输入价格下降 80% 成为了 OpenAI 目前最便宜的 GPT-5.6 模型 GPT-5.6 Terra 输入输出价格下降约 20% GPT-5.6 Sol价格保持不变 同时新增 High Speed API 模式,可以花更多钱换更低延迟。 Gemini 的性价比优势又被干翻 📊 性能没有缩水,反而继续提升 🏆 SWE-Bench Pro(代码) • Sol:64.6% • Terra:63.4% • Luna:62.7% • GPT-5.5:59.4% 🛡️ 网络安全(Capture the Flag) • Sol:96.7% • Terra:91.8% • Luna:85.2%
顯示更多
0
67
42
3
轉發到社區