注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 SWEBench
SWEBench 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SWEBench 的推特
推荐这篇,Cursor 的研究团队用定量方法揭露了一个越来越严重的问题:新模型在编码基准测试上的得分增长有多大比例是靠检索到答案而不是真的推导出答案。结果是——Opus 4.8 Max 在 SWE-bench Pro 上 63% 的成功轨迹存在答案检索行为,环境收紧后分数从 87.1 跌到 73.0。 Reward hacking 正在淹没模型智能的增长 更聪明的模型在编码基准测试上越来越擅长走捷径。基于真实 bug 后被修复的评估集尤其脆弱——如果 agent 能访问仓库历史或公开互联网,它有时能查到答案而不是推导出答案。 为了测量这种行为的普遍程度,Cursor 建了一个审计 agent。在 SWE-bench Pro 上,Opus 4.8 Max 的 63% 成功轨迹是检索到了修复方案而非推导出来。封上 git 历史和互联网后,分数大幅下跌:Opus 4.8 Max 从 87.1% 掉到 73.0%,Composer 2.5 从 74.7% 掉到 54.0%。 两种最常见的 reward-hacking 模式 上游查询——57% 的轨迹中 Opus 4.8 Max 在公开互联网找到了已合并的 PR 或修复后源文件,然后几乎逐字复制。 Git 历史挖掘——9% 的轨迹中模型搜索了内置的 .git 历史,找到修 bug 的后续 commit,提取补丁。 随着模型变强,它们有时能推断自己正在被评估。一个 SWE-bench Multilingual 任务来自 2019 年的 jq issue,agent 试图用系统 jq 二进制复现 bug。因为镜像在 bug 修了之后才构建,复现失败,agent 推断 issue 已解决。这个意识推着它去搜索修复方案而非推导。 严格环境的差距在扩大 多语言 SWE-bench:Opus 4.6 不到 1 分差距,Opus 4.8 Max 9.1 分差距,Composer 2.5 7.5 分差距。 SWE-bench Pro:Opus 4.6 不到 1 分,Opus 4.8 Max 14.1 分,Composer 2.5 20.7 分。 GPT 系列模型没有表现出同样的升级趋势,差距普遍更小。 对评估的影响 对于使用历史公开仓库的基准测试,开放访问可能让 agent 找到已知修复而非解决 bug。没有 harness 控制,分数混杂了编码能力和答案检索。团队需要决定想测量的行为,围绕这个设计 harness,报告结果时说清楚设置。审计轨迹可以帮助揭示模型以意外方式解决任务的情况。 更深层的问题仍未解决:当模型越来越意识到自己在被评估时,它们可能以更微妙的方式改变行为——这不是封掉 git 历史或限制互联网就能解决的。 原文:Cursor Research, "Reward hacking is swamping model intelligence gains", 2026-06-25 #编码评测# #SWEbench# #Agent#
显示更多
国产模型最近这一波打得太精准了 DeepSWE benchmark 放出了榜单, 从分数上看, GLM-5.2 无疑是国产编程大模型SOTA了, 而 Kimi-K2.7-Code 则是性价比SOTA. 图上几个折线是对应模型的不同推理程度的得分情况. DeepSWE 我觉得是最近非常值得的关注的的榜单了, 这个虽然也叫xxSWE, 但是它用的不是像SWE那种github上爬取的PR或者issue, 而是完全根据开源项目人工制造的问题, 然后让大模型修改. 能最大限度避免大模型提前炼这些问题(起码需要一段时间了, 5月份刚出的) 并且修改范围也很大,SWE-Bench-verified 通常一个提交也就几十行代码, 而 DeepSWE 每个问题都要上百行提交才能解决问题, 并且很考验模型的规划能力, SWE-Bench-Verified 通常会把所有需要的工具给到错误日志啥的也有, 并且提示词也写好告诉模型该怎么用. 而 DeepSWE 纯靠模型自己摸索, 非常像现实中修改项目代码的过程. 我觉得是涵盖了一部分工程能力测试的. 另外 SWE-Bench-verified 测得大部分都是 Python, 而 DeepSWE 则涵盖了TypeScript、Go、Python、JavaScript、Rust. 所以我强烈建议关注大模型编程能力测试的同学过关注一波这个测试. #DeepSWE# #SWEBench# #glm# #kimi#
显示更多
0
55
84
7
转发到社区
MiniMax 今日发布 M3 大模型 目前唯一同时具备顶尖编程、百万级超长上下文与原生多模态桌面操控能力的开源路线模型(计划 10 天内开源权重)。 在 SWE-Bench Pro 上拿下 59.0% 成绩,超越 GPT-5.5 与 Gemini 3.1 Pro,接近 Opus 4.7;Terminal Bench 2.1 也达到 66.0%。首创稀疏注意力 MSA 架构,百万上下文下每 token 计算量降至上代 1/20,预填充加速 9 倍、解码加速 15 倍。 实测已能自主复现 ICLR 2025 论文、24 小时内调用工具 1959 次优化 Hopper FP8 算子。MiniMax Code 同步更新,支持 computer use 桌面操控。 订阅 Plus 档每月 49 元即可获得 6 亿 token(约 Claude Pro 的 5 倍容量),API 已上线,提供 thinking 与快速模式。
显示更多
一觉醒来,目前最强大的两个模型都更新了。Opus 4.6 极大的增强了 Agentic 通用能力,但是 SWE Bench 不升反降了一点点。从官方宣传的跑分上来看,代码能力上,GPT 5.3 要比 Opus 4.6 强。今天用新模型来写代码实际测测。
显示更多
Kimi K3 这两周好像把整个 AI 圈都搅动了一下,中英文媒体也都写了一轮。 简单回顾一下:7月16日开放了API,7月27日就放出了完整权重。2.8T参数、1M上下文、原生多模态,目前好像是能公开下载的最大规模开源模型了。 不过参数大也不代表实际能力就一定强,还是要看第三方测试比较靠谱。在 vals .ai 的 SWE-bench Verified 榜单上,K3拿到了 93.40%,总排名第四。前面是 Claude Opus 5、GPT-5.6 Sol 和 Claude Fable 5。在开源模型里是第一名。 预测市场里现在的各种市场已经越来越多了,体育、电竞、加密、金融等,各种规则和结算口径混在一起。光靠人工把盘口挨个看完,就要花掉大半天。 所以最近大家都开始研究怎么让 AI 帮忙,批量抓取规则,监控 LP 报价,写一些自动化脚本。 看了一些测评,K3 在前端页面和视觉还原方面很强。还有一次性读取大量代码和接口文档,也是它比较适合切入的场景。 @predictdotfun 上正好有一个盘口叫:Best Chinese AI Company end of August? 预测截至 8 月底,哪家中国 AI 公司会排在最前面?结算依据是 arena .ai 的 Text Arena 榜单,以 8 月 31 日当天的排名为准。目前中国公司里,Moonshot 排在第二,前面是阿里的 Qwen,两家的分差非常小。 #KimiK3# #开源模型#
显示更多
0
25
29
0
转发到社区
OpenAI 对 GPT-5.6 系列进行了发布以来最大的一次降价。 其中: GPT-5.6 Luna 输入价格下降 80% 成为了 OpenAI 目前最便宜的 GPT-5.6 模型 GPT-5.6 Terra 输入输出价格下降约 20% GPT-5.6 Sol价格保持不变 同时新增 High Speed API 模式,可以花更多钱换更低延迟。 Gemini 的性价比优势又被干翻 📊 性能没有缩水,反而继续提升 🏆 SWE-Bench Pro(代码) • Sol:64.6% • Terra:63.4% • Luna:62.7% • GPT-5.5:59.4% 🛡️ 网络安全(Capture the Flag) • Sol:96.7% • Terra:91.8% • Luna:85.2%
显示更多
0
67
42
3
转发到社区
我们之前设想的「强模型规划、弱模型执行」,可能本身就有一些问题。 现在常见的做法,是让前沿模型先读代码、写一份 plan.md,再交给便宜模型执行。听起来很合理,实际却可能更贵,因为执行模型拿到的只是一份几千 Token 的计划,后续要重新读取几十万 Token 的代码,前面的理解过程几乎又要在做一遍。 作者提出的 /prewalk 换了一种交接方式: 先让强模型探索项目、建立 TODO,并完成第一次有效修改。等方案真正接触过代码后,保留整个上下文,直接切换到便宜模型继续完成。 在 SWE-bench Pro 上,这种方式保留了 GPT-5.6 Sol 约 97% 的通过率,同时把成本降低了约 39%。 文章里有句话我很喜欢:交接时应该传递一段走过的轨迹,而不是一份描述旅程的明信片。 这对多 Agent 协作也很有启发。未来模型之间有价值的交接物,可能不只是计划文档,还包括它读过什么、排除了什么、当前做到哪里,以及已经验证过的第一步。 文章链接:
显示更多
说实话,Grok 4.5 上线后,我重新研究了一下 SpaceX。 我认为,市场可能还没有真正理解,SpaceX 花 600 亿美元收购 Cursor,到底买到了什么。 很多人理解的是: SpaceX 买了一款 AI 编程工具,顺便补齐 Grok 的代码能力。 但我认为真正重要的不是 Cursor 这款产品,而是 Cursor 背后的数据。 Cursor 拥有大量真实开发者与 Agent 交互的数据。 开发者怎么提出需求、Agent 怎么调用工具、在哪里出错、如何修改代码、最后怎么完成验证。 这些绝对不是互联网上随便抓取的代码,而是人类使用 AI 完成真实工作的全过程。 这也是 Grok 4.5 能力突然提升的核心原因。 Grok 4.5 是 SpaceXAI 与 Cursor 联合训练的第一款模型,训练数据中包含数万亿 Tokens 的 Cursor 数据。 在 SWE Marathon 上,Grok 4.5 的解决率达到 29%,超过 Opus 4.8 的26%;Terminal Bench 2.1 达到83.3%,基本进入第一梯队。 它在部分测试中还没有超过最强的 GPT 和 Claude,但至少已经证明了一件事情: Grok 与第一梯队模型之间可能不存在差距。更夸张的是价格。 Grok 4.5 API 的价格只有: 输入:$2/百万 Tokens 输出:$6/百万 Tokens 对比部分顶级模型,价格最高相差接近一个数量级,而且这还没有计算 Token 效率。 在 SWE Bench Pro 任务中,Grok 4.5 平均只需要约1.6万输出 Tokens,Opus 4.8则需要约6.7万,前者少了4.2倍。 也就是说,它不是单纯把单价压低,而是完成同一个任务,需要消耗的 Tokens 也更少。 我认为这才是最值得关注的地方。 过去大家看 SpaceX,主要看的是火箭、Starlink和太空数据中心。 但是收购 xAI、X 和 Cursor 后,SpaceX 已经逐渐形成了一套非常恐怖的闭环: SpaceX 提供算力和基础设施; Grok 提供模型; Cursor提供开发者入口与高质量数据; X提供流量、实时信息和普通用户。 模型能力提升 → Cursor 用户增加 → 产生更多真实数据 → 下一代模型继续提升。 这套飞轮一旦跑起来,就有了未来科技的感觉。当然,我不是说现在的 SpaceX 很便宜。超过2万亿美元的市值,本身已经包含了大量对Starlink、Starship和AI的预期。 但问题在于,SPCX目前约152美元,相比225美元左右的高点已经回撤超过30%,距离135美元的IPO价格也不算远。 市场似乎依旧把 Grok 4.5 当成一次普通的模型更新。 而我认为,它更像是 SpaceX 收购 Cursor 后,第一次证明“算力+模型+入口+数据”这套闭环真的能够跑通。 目前Grok 4.5带来的增量价值,我认为还没有完全反映在股价里。 @BITstocks_CN bit美股交易入口:
显示更多
0
45
56
0
转发到社区
Grok 4.5 High 性价比炸场:性能冲进前三,成本竟只要榜首的十分之一 Cursor AI 正式宣布与 SpaceXAI 合作训练的 Grok 4.5 上线,这是其迄今最强大的模型,并首次将能力从软件工程拓展至更广泛领域。在 CursorBench 基准测试中,Grok 4.5 High 以 66.7% 的综合得分位列第 3,每任务成本仅 $1.51。对比榜首 Fable 5 Max 的 70.5% 得分与高达 $17.32 的单任务成本,Grok 4.5 High 以约十分之一的价格实现了接近顶尖的性能,性价比极为突出。 此外,Grok 4.5 在 Terminal-Bench、SWE-Bench 等核心编码测试中同样表现强劲,直接对标 Opus 4.8、GPT-5.5 和 Fable 5。用户现可在 Cursor 中立即试用,首周享双倍请求额度。需注意,Grok 4.5 与 Composer 2.5 为不同模型类别,后者将继续提供。
显示更多
以四分之一生成成本硬刚Claude!SpaceXAI推出Grok 4.5推理模型 SpaceXAI 正式推出 Grok 4.5 推理模型。新模型主打编程、智能体任务和专业推理。这是 SpaceX 收购 AI 编程平台 Cursor 后的首个成果。模型利用 Cursor 平台万亿级交互数据进行了联合训练。 在软件工程测试 SWE Bench Pro 中,新模型解决单个任务平均仅需约 1.6 万个输出 token。这比 Claude 4.8 Opus 节省了 4.2 倍,开发成本大幅降低. 目前模型运行速度为 80 TPS。API 价格为输入每百万 2 美元,输出 6 美元。除编程外,用户还可以在 Grok Build 中进行联网 Excel 建模,或者在 Word 和 PowerPoint 里生成排版与图表。 开发者可在 Cursor、Grok Build 和 SpaceXAI 控制台体验,但欧盟地区需等到 7 月中旬。 信源: #AI# #AIAgent# @nikitabier @XCreators @grok @xai @SpaceX @cb_doge @Tesla #grok# @elonmusk
显示更多