注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 TerminalBench
TerminalBench 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 TerminalBench 的推特
OpenAI 今天上线了 GPT-5.6 系列,三个模型一起发: - ​​Sol(旗舰)​​: TerminalBench 代码测试 91.9%,定价 30,性价比不错。 - ​​Terra(均衡)​​:性能接近上代旗舰,价格砍半。 - ​​Luna(经济)​​:$1 起步,适合日常轻量用。 新增两个功能:​​max 深度推理​​(复杂问题慢慢想)和 ​​ultra 多智能体模式​​(多任务并行)。7 月还会接 Cerebras 加速,速度 750 tokens/秒。 跟 Claude Fable 5 比,代码工作流 Sol 略胜(88.8% vs 88.0%),但智能代码理解 Claude 更强(80.3% vs 58.6%)。目前限量预览中,普通用户预计几周内开放。
显示更多
GPT-5.6 已在 Codex 应用中出现,虽暂不可用,但部署已就绪。 爆料称下周发布“极有可能”。 继 TerminalBench 91.9% 跑分后,OpenAI 准备亮出真家伙了。
显示更多
模型没改一个字,Harness 却让它长了本事 DeepSeek V4-Flash 这次发的"正式版",本质不是新模型。 架构没动,参数没加——Flash 还是 2840 亿总参、130 亿激活;Pro 是 1.6 万亿 / 490 亿,差一个数量级。官方原话就一句:"仅重新进行了后训练"。 没换发动机,只重调了变速箱和驾驶策略。 结果 Agent 能力一下子跳到接近 Pro:TerminalBench 82.7、DeepSWE 54.4、Cybergym 76.7。 这事儿值得盯,是因为它恰好验证了崔添翼进 DeepSeek 要干的那件事。 崔添翼是谁?浙大加六枚 ACM 金牌,Jane Street 量化九年,今年三月被梁文锋挖来组建 Agent 团队。 他给的公式很直白:Model + Harness = Agent。 Harness 是啥? 说白了,就是套在模型外面、让它能真正接任务、调工具、自己跑起来干活的那套系统。模型是发动机,Harness 是方向盘、刹车。没有它,模型再聪明也是个裸 API,跑不了真实任务。 他的切入点妙在:量化交易和 Agent 底层逻辑同源——都是上下文管理、工具调用、终端执行、权限控制。 量化不堆算力,是在噪音里筛信号、精准路由。这套"信号过滤 + 路由执行",被他搬到了模型框架上。 一句话:Harness 不是让模型更聪明,是让便宜的 token 变有用。小模型配好 Harness,能打赢大模型加糙 Harness。 为什么这能替代堆参数? 预训练是灌知识(多聪明),后训练是岗位带教(教怎么把事办完)。 这次证明:130 亿激活的小 Flash,靠重训加自家 Harness 环境,Agent 成绩逼近 490 亿的 Pro。 → 模型规模不再是 Agent 能力的唯一决定因素,训练方法、数据质量、Harness 的权重在上升。 但要泼盆冷水:Harness 和内部测试集没公开,第三方还没复现,暂时不能断言"后训练已可替代扩容"。 这条路线直接打 Agent 应用层的"毛利危机"——Cursor、Devin 这类产品,被 OpenAI、Anthropic 的旗舰账单吸走大半订阅费,沦为"算力劳务派遣"。 DeepSeek 的逻辑:用便宜 token 加自家 Harness,把成本压下来、可控性提上去,切 OpenAI 后院。 → 看 AI 应用公司,同一个模型换 Harness 结果天差地别。未来估值要看"模型 × Harness"复合能力,不是单看参数。 所以下一仗,是模型还是 Harness?
显示更多
0
17
25
3
转发到社区
DeepSeek 今天下午发大招:V4-Flash 正式版 API 公测开启! ✅ Terminal Bench 2.1:82.7(Pro Preview 才 72.1,GLM-5.2 81.0) ✅ 9 项 Agent 基准全面碾压自家 Pro 预览版 ✅ 284B/13B MoE + 1M 上下文,规格不变,只靠后训练硬拉 ✅ 原生适配 Codex,Responses API 直接切 ✅ 价格还是白菜价:输入 1 元、输出 2 元/百万 token 注意只更新了 Flash API,App/Web 端没动。Pro 正式版 8 月初。 性价比杀疯了,开发者可以冲!
显示更多
啊?这一段原来都用的是beta版么? DeepSeek-V4-Flash 正式版 API 今天上线公测,Agent 能力提升明显。 Terminal Bench 2.1 得分 82.7,Cybergym 76.7,多项基准超过 V4-Pro-Preview。 模型结构和尺寸没变,这次只重新做了后训练。 它原生支持 Responses API,还针对 Codex 做了适配。 官方表示 V4-Pro 正式版会尽快发布。
显示更多
GLM-5.2 刚涨价,DeepSeek 转头就把桌子掀了。 V4-Flash 正式版 API 上线公测,Terminal Bench 2.1 跑到 82.7,NL2Repo 54.2,DeepSWE 54.4。拿 GLM-5.2 的常规口径对一下:81.0、48.9、46.2。表面看,三项都压了过去,而且出手的还只是 Flash,不是后面的 Pro。 这就有意思了。 GLM-5.2 前脚刚把价格抬上去,DeepSeek 后脚就拿原本负责性价比的 Flash 过来抢 Agent 的位置。更狠的是,这版模型结构和尺寸没变,只靠后训练,把进终端、读仓库、调工具、跑长任务重新练了一遍。 它还原生支持 Responses API,专门适配 Codex。什么意思?DeepSeek 不只是来刷榜,它是准备直接抢 Code Agent 的开发者入口。 当然,不同 Harness 不能简单判死刑,榜单也不等于真实项目。但 GLM-5.2 这波涨价多少有点尴尬:你前脚说自己值更多钱,DeepSeek 后脚就拿 Flash 过来问——凭什么? 接下来别看谁嗓门大。拿同一个真实仓库、同一套任务、同一笔预算跑一遍,谁先把活干完,谁才有涨价的底气。
显示更多
2. Google I/O 2026:Gemini 变成 Agent 平台 - 优先级: 9 | 影响力: 6 | 信息差: 3 - 来源: Forbes (25小时前) - 核心: - 发布 Gemini 3.5 Flash,首个3.5系列模型 - Terminal-Bench 2.1得分 76.2%,MCP Atlas得分 83.6% - 比Gemini 3.1 Pro快4倍 - 将Gemini定位为Agent引擎,集成到所有Google产品 - 影响: Google正式将Agent作为核心战略,对标OpenAI和Anthropic - 中国讨论度: Google I/O有部分报道,但Agent平台定位的深层含义讨论不足
显示更多
OpenAI 今天凌晨公布了全新架构的 GPT-6 Astra 群星 但最让人欣慰的是,人类终于不再卷 coding,去瞄准科学的星辰大海了 OpenAI 内部将其视为第一个 AGI 时代的模型 这个模型在科学研究和抽象推理方面大幅提升 而且这个模型的智力模式非常特别 相比其他模型,可以大幅减少推理步骤,以更少 Token 获得更高智能 但这个模型在 coding 方面却进步很小,不如 Fable 价格方面 10in 50out,也对齐 Fable/Mythos 也许从外界看来,Mythos 可能是第一个 AGI 时代的模型吧,不过我们没资格用 Mythos,无法评价了 科学 Terminal-Bench Science 0.1(科研终端与管线自主操作):从上一代 Sol 的22.4% 暴涨至 64.6%(大幅领先 Fable 5.1 的 52.6%)。 FrontierMath Tier 4 (v2)(前沿科研级数学):达到97.6%。 真实数学发现:协助数学家 Julia Stadlmann 将素数间隔(prime number gaps)上界从 240 推进到 186;推动了一项维持 80 多年未动的数学界限。 智能与效能 动作与步数效率(ARC-AGI-3):在96% 的关卡中,摸索并解出未知机制所用的动作步骤比人类中位数还要少,平均动作数减少 51.7%。它不再靠暴力穷举,而是在上下文里现场发明代数简记法(DSL)压缩状态。 任务级能效比(Cost-per-task):虽然每百万 token 单价更贵,但在 OSWorld 2.0 等长流程复杂任务上,单任务耗时从 75 分钟压到了 40 分钟左右,总消耗 token 显著减少。 工程 专业工业软件(BenchCAD):达到95.9%(领先 Fable 5.1 的 84.3%),直接落地 KiCad(PCB 电路设计)、Unity 3D 排布和金融建模(Financial Modeling World Cup)。 编程 DeepSWE v1.1(真实软件工程能力):Astra 得分为74.1%,对标 Claude Opus 5 的 74.0%、Gemini 3.8 Flash 的 73.7%,甚至低于 Meta Muse Spark 1.3 的 75.4%。基本和大家挤在同一个平台期,完全没有拉开代际差距。 Artificial Analysis (AA) 综合智能与智能体指数:Astra 仅拿到了61.2 分,几乎与上一代 GPT-5.6 Sol(61分左右)持平,在 Coding Agent 指数上未见断层提升。 完整模型介绍在官网,写的非常专业,直接看一首信息,不需要看三方解读,可以在此详细阅读
显示更多
同一个模型不改权重,只让 Harness 像物种一样竞争、遗传和重组,Agent 还能继续变强。 Salesforce 团队这篇 DarwinX,把 Harness 自进化做成了一场「进化搜索」。 很多系统只保留一条修改路线,早期方向一旦走偏,后面很容易困在局部最优。 DarwinX 会同时保留多个 Harness 分支。每次修改后,既看它有没有解决新问题,也看它有没有破坏已经学会的能力。 即使某个版本整体表现一般,只要它解决了独特问题,也会被保留下来,后面再和其他优秀分支组合。 整个过程中模型参数完全冻结,真正进化的是 Prompt、Skill、Tool 和执行流程。 结果也很明显:四类评测平均提升约 17 个点。Terminal-Bench 2.1 上,GPT-5.5 提升到 83.2%;WebArena-Infinity 从 43.5% 提升到 93.0%。 这篇工作有意思的地方在于它把 Agent 自进化变成了「搜索更好的系统」。 有些失败版本也值得留下,因为它们可能保留了一块以后还能重新组合的能力。 📎 arxiv:
显示更多
🔎0.1分的差距,57倍的价格,DeepSeek V4 Pro正式版诠释“性价比之王” 凌晨突袭,DeepSeek V4 Pro正式版把性价比玩明白了。 8月12日深夜,DeepSeek官网API文档悄然更新,旗舰模型V4 Pro从预览阶段正式转正,版本号定格为DeepSeek-V4-Pro-0813。没有发布会,没有倒计时,连更新日志都没来得及写。但数据不会说谎,这款模型用一张成绩单,把“比我强的没我便宜,比我便宜的没我强”这句话,刻在了大模型竞赛的牌桌上。 性能:距离全球第一,只差0.1分 先说硬指标。V4 Pro正式版沿用了预览版的MoE架构,1.6万亿总参数、每个Token激活490亿参数,支持100万Token上下文窗口和384K最大输出。架构没变,但后训练下了狠功夫。 最惊艳的来自Agent相关评测。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分。全球第一的Anthropic Fable 5,为88.0分,差距仅0.1分。相比预览版72.1分,三个月跃升了15.8分。 再看其他维度。AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分。软件工程能力测试DeepSWE从预览版的12.8分飙升至62.7分,涨了近五倍,超越了Anthropic上一代旗舰Opus 4.8,为58.0分。DSBench-Hard翻了一倍多达到67.2。 这些测试有个共同点,都涉及长链路的代码修改、环境操作和工具调用,恰好是预览版最容易翻车的地方。换句话说,V4 Pro这次补上的正是大模型从“聊天玩具”走向“生产工具”最关键的Agent能力。 价格:对手的六十分之一 性能逼近Fable 5,价格呢?V4 Pro每百万Token输入(缓存未命中)3元、输出6元,缓存命中输入低至0.025元。 对比海外顶级模型,Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元。而DeepSeek V4 Pro仅为0.87美元。6元人民币的输出价格,是Fable 5的六十分之一、Opus 5的三十分之一。 0.1分的跑分差距背后,是五十七倍的价格鸿沟。在部分智能体任务中,V4 Pro与Claude、Fable等顶级模型的性能差距已缩小到约5%,但后者的价格最高却是它的45倍。 格局:大模型竞赛进入性价比时代 这次更新恰逢Grok 4.6同夜发布、Qwen 3.8-Max宣布开源。模型之争已从单一的参数比拼,转向性能、成本与商业化应用的综合较量。 DeepSeek走的是一条清晰的路,用顶级模型的性能、地板价的价格,倒逼整个行业重新思考“什么才是好的大模型”。V4 Pro与Flash版形成“高频轻量走Flash、复杂推理走Pro”的产品分层,开发者可以按需选择,丰俭由人。 当然,V4 Pro并非没有短板。在无工具调用的Humanity's Last Exam上,它跟Claude Opus 5仍有明显差距。部分开发者反馈长时间连续执行时仍会出现提前停止、任务质量不稳定等问题。此外,DeepSeek已预告将整体上调API定价,目前的低价窗口能持续多久仍是未知数。 但无论如何,V4 Pro正式版已经用实力证明了一件事:性能可以逼近全球第一,价格却可以只有对手的六十分之一。大模型的“奢侈品”时代正在被瓦解,这对所有开发者来说,都是好消息。 #AI# #DeepSeek#
显示更多
0
114
9
0
转发到社区