註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DeepSWE
DeepSWE 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DeepSWE 的搜尋結果
看DeepSWE评测,Gemini是真的惨。 谷歌到底出了啥问题。
0
51
42
2
轉發到社區
Claude Fable 5 是 DeepSWE 记分板上最贵的模型。Together AI 拿它跟全场最便宜的模型各跑了 452 次,给出的用法建议是反过来:贵的当后手。 《DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码与路由》 DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码和路由 要点 • 先跑 DeepSeek V4 Pro 0813,只有它失败时才升级到 Claude Fable 5。这条级联链解决 82.7% 的 DeepSWE 任务,每个任务 8.28 美元。单用 Fable 是 69.7%、每个任务 21.63 美元。高 13 个百分点,便宜 62%。 • Fable 赢第一发。pass@1 69.7% 对 62.8%,领先 7 个点。 • Pro 赢之后每一发。pass@2 打平(78.5% 对 77.1%),pass@4 领先(88.5% 对 84.1%)。 • 价格差 90 倍。每次 rollout 0.24 美元对 21.63 美元。每花 100 美元,Pro 解决 260 个任务,Fable 解决 3 个。 • 它们栽在不同的任务上。逐任务相关性只有 0.39,是我们测过的分歧最大的一对。两者合计覆盖 113 个任务中的 107 个。分歧正是路由能成立的全部理由。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 在我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 的 DeepSWE 对比中——DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准——这两个模型坐在价格表的两端。Claude Fable 5 的每次 rollout 是 DeepSWE 全榜最贵。DeepSeek V4 Pro 0813 是最便宜的之一。Fable 首发的准确率高 7 个百分点,单次 rollout 却贵 90 倍,所以真正的问题不是哪个模型更好,而是这 90 倍的溢价到底买到了什么、什么时候值得付。 DeepSWE · 正面对决 DeepSeek V4 Pro 0813 vs Claude Fable 5 一览 • claude-fable-5 [max]:pass@1 69.7% ± 2.3%,平均成本 21.63 美元,每 100 美元解决 3 个任务,输出 token 115k,79 步 • deepseek-v4-pro-0813 [max]:pass@1 62.8% ± 3.1%,平均成本 0.24 美元,每 100 美元解决 260 个任务,输出 token 101k,146 步 我们在全部 113 个 DeepSWE 任务上,用 DeepSeek V4 Pro 0813(max)对 Claude Fable 5(max)各跑四次 trial,取自已发布的逐 trial 记录:总计 904 次 rollout(各 452 次)。Fable 是贵价的手艺人;Pro 是性价比上的异类。这两个模型的分歧也大于这套数据里的任何其他组合——结果这成了它们最有趣的地方。下文的每个数字都来自本次运行,所以可能与其他公开的 DeepSeek V4 Pro 0813 vs Claude Fable 5 记分卡有出入。 DeepSWE 记分板:pass@1 与 pass@k 单发,Fable 领先:pass@1 69.7% 对 Pro 的 62.8%(官方计分)。但这个领先很脆弱。两次尝试时 Pro 追平(78.5 对 77.1),四次尝试时 Pro 的 pass@4 88.5% 比 Fable 的 84.1% 高出 4 个多百分点。对一个贵 90 倍的模型来说,Fable 既没有守住天花板,也没有在重试下保住首发优势。更便宜的模型覆盖更广,best-of-k 也更高。 成本对比:DeepSeek V4 Pro 0813 vs Claude Fable 5 的价格 每次 rollout 0.24 美元,DeepSeek V4 Pro 0813 比 Fable(21.63 美元)便宜 90 倍:每 100 美元解决 260 个任务,Fable 只有 3 个。这是我们测过的所有组合里最宽的成本差距,Fable 也是榜单上最贵的单个配置。而且与直觉相反,低价格没有带来速度惩罚:Fable 的中位 rollout 31 分钟,Pro 35 分钟,基本持平——因为 Fable 是榜单上话最多的模型(115k 输出 token),尽管它的步数更少(79 对 146)。Pro 走的步数多;Fable 每步写得多。两个模型谁也没有明显更快。 失败模式:两个模型分别怎么错 两者在「不破坏东西」上都算自律:DeepSeek V4 Pro 0813 和 Fable 各自只在 11% 的失败里回归了现有测试套件,远低于 GPT 家族的 20%。差别在另一个方向:Fable 的大偏差失误占比是这里最高的(18% 对 Pro 的 10%),也就是说 Fable 一旦错,更常是错得离谱——给出离题很远的方案,而不是差一个边界用例。Pro 更多时候倒在离正确答案不远的地方(66% 的近似失手,对 Fable 的 57%)。所以两者都可以不加重度回归门禁就放心接入,但 Fable 的失手是调试成本更高的那种。 按任务类型,各自赢在哪 Fable 的手艺体现在推理重、契约精确的领域:8 个领域里它赢 6 个,领头的是数据建模与序列化(88%,比 Pro 高 24 个点)和语言内部机制(78)。但 DeepSeek V4 Pro 0813 拿下两个,两个都分量不轻:有状态响应式(66 对 64),以及——更有说服力的——并发与持久化(58 对 45):在恰恰是 Fable 最弱的领域里领先 13 个点。Fable 在并发上的 45% 是它最弱的格子,也是唯一一个便宜模型不只是更便宜、而是工程师水平更高的领域。 按编程语言 Fable 赢下五种语言里的四种,但真正对得起它价格的是 Rust:85% 对 Pro 的 65%,20 个点的差距,也是这场对决里最大的一处差距。Fable 显然是序列化和 Rust 专家。其他语言都比价格暗示的接近(Python 70 对 60,Go 71 对 67,JavaScript 75 对 65),DeepSeek V4 Pro 0813 则实际拿下 TypeScript(61 对 57)。Rust 和序列化之外,付 90 倍价格的理由很难成立。 这两个模型到底有多不一样? 亮点在这里。逐任务相关性只有 0.39,是我们测过的 DeepSeek-Pro 组合里最低的——这两个模型是真心意见不合。它们各自解决了 88 个任务;Pro 单独拿下 12 个,Fable 单独拿下 7 个,只有 6 个任务两边都栽。两者的并集覆盖 113 个任务中的 107 个(94.7%),而且分歧是双向的:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四发四中,Fable 一次没成;Fable 在四个 Pro 全挂的任务上四发四中(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补,不是冗余。 在两者之间路由:组合打法 多样性加上价格差,让级联变得很划算。先跑 DeepSeek V4 Pro 0813,只有测试套件否决答案时才升级到 Fable:82.7% 的解决率,每个任务 8.28 美元。比单用 Fable(69.7%)高 13 个百分点,价格不到 Fable 单任务价格(21.63 美元)的一半。廉价的第一阶段清掉大部分队列,Fable 的溢价只花在难啃的剩余任务上,而且那些任务在上面还多获得一次独立的尝试。级联甚至赢过完美的一次性 oracle 路由(78.8%)。顺序不是可选项:Pro 先行每个任务 8.28 美元,Fable 先行 21.71 美元,准确率一样。 这意味着什么 Fable 5 是这张榜单上最难被当作默认模型的:最贵的一次 rollout 遥遥领先,首发优势被重试抹平,四发也没有天花板优势。只为两件事买它:Rust(85%)和序列化密集的工作(88%)——只有在这里它的质量才真正对得起价格。 DeepSeek V4 Pro 0813 是相反的画像:首发准确率接近 Fable,天花板更高,失败画像持平或更好,便宜 90 倍——尽管它在 Rust 和契约精确的领域让位。而因为两者是我们测过最多样的一对,Fable 最好的用法不是当默认,而是躲在低成本的 Pro 第一阶段后面做选择性升级,只在那少数真需要 Rust 或序列化专家的任务上付费。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 数据表:DeepSeek V4 Pro 0813 vs Claude Fable 5 完整结果 DeepSWE · 完整结果 • Pass@1(官方计分):Pro 62.8%,Fable 69.7% • Pass@1(错误计为失败):62.8%,67.3% • Pass@2 / pass@4:78.5 / 88.5%,77.1 / 84.1% • 覆盖率 / 可靠性:88.5 / 71.0%,84.1 / 82.0% • 四发四中 / 全挂:35 / 13,56 / 18 • 每次 rollout 成本 / 总成本:0.24 美元 / 109 美元,21.63 美元 / 9,346 美元 • 每 100 美元解决数:261,3 • 中位分钟 / 步数:35 / 146,31 / 79 • 中位峰值上下文 / 输出 token:232k / 101k,202k / 115k • 失败构成(近似 / 大偏差 / 回归):66% / 10% / 11%,57% / 18% / 11% • 赢下的领域(共 8 个):2(有状态、并发),6 • 赢下的语言:1(TypeScript),4(Rust 大胜) • 逐任务相关性 / 并集(两模型合计):0.39 / 113 中的 107(94.7%) • Pro → Fable 级联(准确率 / 成本):82.7% / 8.28 美元(单用 Fable 69.7% / 21.63 美元) • 单发 oracle 路由:78.8% • 基础设施错误:0,16 FAQ DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗? 看指标。Claude Fable 5 赢 DeepSWE 上的单次尝试质量(pass@1 69.7% 对 62.8%),四发四中的任务也更多(56 对 35)。DeepSeek V4 Pro 0813 在 pass@2 追平、pass@4 反超(88.5% 对 84.1%),且每次 rollout 便宜 90 倍,所以在大批量或容忍重试的 agent 工作里,它是更强的性价比之选。 DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少? 在我们的运行里,DeepSeek V4 Pro 0813 每次 rollout 0.24 美元,Claude Fable 5 满血档 21.63 美元,约便宜 90 倍。按解决的任务算,Pro 每 100 美元解决 260 个,Fable 是 3 个——每美元的产出大约差 80 倍。 编码该用 DeepSeek V4 Pro 0813 还是 Claude Fable 5? 大多数编码工作,两者的差距比价格暗示的小。Claude Fable 5 领先 Rust(85 对 65)、Python、Go 和 JavaScript,赢下 8 个领域中的 6 个,领头的是数据建模与序列化。DeepSeek V4 Pro 0813 拿下 TypeScript(61 对 57)、有状态响应式,以及并发与持久化(58 对 45)——那正是 Fable 最弱的领域。 要不要在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间做路由? 要,前提是你能验证结果。两者是我们测过的所有组合里逐任务相关性最低的(0.39),合计覆盖 113 个任务中的 107 个。先跑 DeepSeek V4 Pro 0813,当测试套件否决输出时升级到 Claude Fable 5,能达到 82.7%、每个任务 8.28 美元——赢过单用 Fable,也赢过完美的一次性 oracle 路由。 DeepSWE 的 pass@k 是什么? pass@k 衡量一个任务在 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励一次做对;更高的 k 奖励能在多次尝试后最终到达方案的模型。DeepSeek V4 Pro 0813 的优势随 k 增大而扩大。 原文: #DeepSWE# #AI编程# #LLM评测#
顯示更多
卧槽,Gemini 3.8-Flash在DeepSWE上获得了第一!? 他击败了Fable5.1和 GPT-5.6 Sol🔥 这不可能☠️
CodeX最具性价比的使用方式出现了 根据DeepSWE 排行榜最新数据:GPT-5.6 Luna Max 以 67% 得分,平均成本只要 $0.61 登顶最具性价比的模型,兼顾了性能和成本 所以现在最高效的玩法是: 主线程用 GPT-5.6 Sol 做整体规划和拆解,把边界清晰的子任务全部丢给 GPT-5.6 Luna Max 并行执行 直接把下面这段提示词复制给 Codex: ─── 请在 ~/.codex/agents/luna-worker.toml 创建一个名为 luna_worker 的自定义代理。 使用以下设置: model = "gpt-5.6-luna" model_reasoning_effort = "max" 为它写一个清晰的 description 和 instructions,专门用于处理边界明确、可独立完成的委派任务。保留我现有的其他配置不要动。根据我当前安装的 Codex 版本校验配置是否兼容,展示修改的 diff,然后后续子代理任务优先使用 luna_worker。 ─── 设置完之后,Sol 负责思考和决策,Luna Max 负责大批量落地执行。一个长 goal 下来,额度消耗会明显下降,速度却更快 也可以不建自定义文件,直接让 Sol 在主线程里为每个子任务单独开 Luna Max 线程,结果会自动汇总回来
顯示更多
0
17
39
7
轉發到社區
国产模型最近这一波打得太精准了 DeepSWE benchmark 放出了榜单, 从分数上看, GLM-5.2 无疑是国产编程大模型SOTA了, 而 Kimi-K2.7-Code 则是性价比SOTA. 图上几个折线是对应模型的不同推理程度的得分情况. DeepSWE 我觉得是最近非常值得的关注的的榜单了, 这个虽然也叫xxSWE, 但是它用的不是像SWE那种github上爬取的PR或者issue, 而是完全根据开源项目人工制造的问题, 然后让大模型修改. 能最大限度避免大模型提前炼这些问题(起码需要一段时间了, 5月份刚出的) 并且修改范围也很大,SWE-Bench-verified 通常一个提交也就几十行代码, 而 DeepSWE 每个问题都要上百行提交才能解决问题, 并且很考验模型的规划能力, SWE-Bench-Verified 通常会把所有需要的工具给到错误日志啥的也有, 并且提示词也写好告诉模型该怎么用. 而 DeepSWE 纯靠模型自己摸索, 非常像现实中修改项目代码的过程. 我觉得是涵盖了一部分工程能力测试的. 另外 SWE-Bench-verified 测得大部分都是 Python, 而 DeepSWE 则涵盖了TypeScript、Go、Python、JavaScript、Rust. 所以我强烈建议关注大模型编程能力测试的同学过关注一波这个测试. #DeepSWE# #SWEBench# #glm# #kimi#
顯示更多
0
55
84
7
轉發到社區
浓眉大眼的谷歌也开始Benchmaxxing了,Gemini 3.8 Flash在DeepSWE上都给刷到第2了,实际是那么回事吗?上下文一长就完全不可靠,看看这排行榜里的执行步骤数,都干到166了,比爱思考的DeepSeek V4 Pro还要高(但还是好过瞎思考的Sonnet 5)。 还我Gemini 3.7 Flash,我能接受Flash模型笨一点,简单任务能干好,写作能写好就行。
顯示更多
这很奇怪,你不觉得吗? 关于DeepSWE,Gemini3.8Flash的文档里分数是71% 而在DeepSWE网站里的结果是74%💀
在我睡觉之前,我觉得还是得记录一下这么疯狂的一夜。 首先是 Gemini 3.8 Flash 发布了。 它用一个非常夸张的低成本,拿到了非常高的 DeepSWE 分数,短暂地拿到了世界第一。 当时我就在想,这个模型太离谱了,似乎 @GeminiApp 回来了。 结果就过了几个小时, @AIatMeta 又发布了新的 Muse Spark 1.3,然后它又把 Gemini 反超了过去。 但我觉得今晚真正有意思的,其实还不是这两个模型谁第一谁第二。 我印象最深的,反而是 @mostik_ai 那个团队做的事情。 这个东西我觉得才是真正有意义的地方。 因为它其实揭示了一种可能性,就是以后大模型之间,也许根本不需要通过自然语言去通信。 它们可以直接通过潜空间交换信息。 这个项目现在肯定还非常早期,我也不知道最后能不能真的跑通,但如果这个方向是对的,我觉得它可能会把大模型的推理成本再往下降一个非常夸张的级别。 甚至我在想,未来有没有可能是这样: 你的手机上其实只需要跑一个 0.xB 的模型。 平时很多事情它自己处理,遇到复杂问题的时候,它再去和远程的大模型通信。 但这个通信不是像现在这样,传一大堆自然语言、一大堆 token。 而是直接在潜空间里传一些压缩过的信息。 如果最后真的能做到,那可能只需要今天几分之一,甚至更低的成本,就能完成现在同样的推理。 所以我觉得今晚挺有意思的。 表面上看,是 Gemini 和 Meta 又在抢世界第一。 但我现在反而越来越觉得,真正会改变未来几年 AI 成本结构的东西,可能根本不是谁的模型又高了几分。 而是我们会不会找到一种方式,让模型之间根本不用“说人话”。 晚安。 PS:该死的,居然被Alex嘲讽回来了。
顯示更多
0
13
62
3
轉發到社區
GLM-5.2 刚涨价,DeepSeek 转头就把桌子掀了。 V4-Flash 正式版 API 上线公测,Terminal Bench 2.1 跑到 82.7,NL2Repo 54.2,DeepSWE 54.4。拿 GLM-5.2 的常规口径对一下:81.0、48.9、46.2。表面看,三项都压了过去,而且出手的还只是 Flash,不是后面的 Pro。 这就有意思了。 GLM-5.2 前脚刚把价格抬上去,DeepSeek 后脚就拿原本负责性价比的 Flash 过来抢 Agent 的位置。更狠的是,这版模型结构和尺寸没变,只靠后训练,把进终端、读仓库、调工具、跑长任务重新练了一遍。 它还原生支持 Responses API,专门适配 Codex。什么意思?DeepSeek 不只是来刷榜,它是准备直接抢 Code Agent 的开发者入口。 当然,不同 Harness 不能简单判死刑,榜单也不等于真实项目。但 GLM-5.2 这波涨价多少有点尴尬:你前脚说自己值更多钱,DeepSeek 后脚就拿 Flash 过来问——凭什么? 接下来别看谁嗓门大。拿同一个真实仓库、同一套任务、同一笔预算跑一遍,谁先把活干完,谁才有涨价的底气。
顯示更多
匿名 AI 模型杀疯了:Ox Alpha 背后可能藏着智谱下一代 GLM🫰 一个没有公司、没有发布会、甚至不敢公开身份的 AI 模型,突然把 GPT-5.6、Claude、Grok 拉出来同台测试。 它叫 Ox Alpha。 8 月 20 日登陆 OpenRouter 后,这个“幽灵模型”迅速引爆开发者社区。 100 万 token 上下文,支持图片和视频输入,128K 输出,默认开启高强度推理,最关键的是: 免费。 但真正让圈内震动的,不是配置,而是它在真实 Coding 任务里的表现。 有人拿 DeepSWE 真实软件工程任务测试: Ox Alpha:80% Fable 5 Max:65% GLM-5.3:62% Grok 4.6 xhigh:62% GPT-5.6 Sol Max:52% 10 个任务,完成 8 个。 虽然样本量不大,不能直接宣布“击败所有模型”,但这个结果足够让开发者开始疯狂拆解它。 然后问题来了: Ox Alpha 到底是谁? 社区没有找到官网,却找到了大量技术指纹。 Tokenizer 测试中,Ox Alpha 与 GLM-5.3 高度一致; 视频输入 token 消耗模式接近 GLM-5V 系列; API 参数和推理行为也出现大量相似之处。 目前最主流猜测: 它可能就是智谱 正在测试中的下一代 GLM 多模态模型。
顯示更多