註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 LLM评测
LLM评测 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 LLM评测 的搜尋結果
最近在研究Agent,顺带看了看 LLM 评测跑分的逻辑。 通常基础跑分靠的是 Benchmark,顶级模型靠的是 HLE(Humanity's Last Exam) 人类终极测试。 Benchmark本质就是一套标准化题库,给所有模型做同一套题,横向对比分数;而 HLE 是一个更高级的题库,里面所有的题目都无法在互联网上直接搜索出答案,必须经过推理。 类似高考是衡量学生水平的应试标准,benchmark 是衡量 AI 能力的标准,给AI一个标准的、有明确答案的题库。 几个比较经典的 benchmark: MMLU(大规模多任务语言理解),包含了 57 个学科的选择题,覆盖数学、历史、法律、医学…… 典型题目: - 以下哪种维生素缺乏会导致夜盲症?A. 维生素A B. 维生素B C. 维生素C D. 维生素D - 《联合国宪章》第51条规定的是什么权利? GSM8K(小学数学),8500 道小学数学应用题,测模型的多步推理能力。 典型题目: - 小明有 12 个苹果,给了小红 3 个,又买了 5 个,现在有几个? HumanEval(代码能力),164 道编程题,给函数签名和描述,让模型写出实现。 典型题目: - 写一个函数,判断一个字符串是否是回文 这些 benchmark 曾经很有用。 但现在的问题是:从GPT-4开始,顶级模型已经把 benchmark 全都刷穿了。 MMLU 上 GPT-4 能到 86%,GSM8K 上 o1 能到 97%,HumanEval 早就被各大模型接近满分。 一旦分数全部逼近天花板,benchmark 就失去了区分度,你无法用它区分哪个模型更聪明。 于是就有了 HLE(Humanity's Last Exam),号称"人类最后的考试"。 3000 道题,由全球顶尖学者提交,全是那种在互联网上直接搜不到答案的题。 几个真实例子: - 生物:蜂鸟的籽骨支撑几对肌腱?(只答数字) - 语言学:把一段罗马墓碑铭文翻译成帕尔米拉阿拉米语(结合图片) - 数学:证明对所有整数 n ≥ 5,n² < 2ⁿ - 量子物理:根据手绘量子电路图推导出对应的酉变换矩阵 - 历史:根据残缺的敦煌文书,推断某位唐代地方官员的行政管辖范围 这些题难在必须真正推理出来,而不能从训练数据里提取记忆。 各模型 HLE 得分: Grok 4 Heavy:44.4% Claude 4 opus:~24.9% GPT-4o:~10% o3:~18% 人类专家:~34% 是的,人类专家做这套题也只有三成的得分。
顯示更多
想建立高质量的AI信息流,从这15个账号开始! 这 15 个账号基本覆盖了: 研究 工程 教育 开源 产品 AGI 思考 AI 真实能力评测 @karpathy 他的推文经常提前定义 LLM 叙事。很多你两个月后在 LinkedIn 上看到的 AI 话题,可能他早就讲过了。 @fchollet Keras 作者,ARC-AGI 提出者。经常分享关于智能、本质能力、Benchmark 和 AI 局限性的深度思考。 @ylecun 深度学习先驱,Meta 首席 AI 科学家。观点很宏观,也经常有对 AI 研究路线的批判和讨论。 @AndrewYNg AI 教育领域的传奇人物。内容非常实用,覆盖机器学习建议、课程、产品落地和真实世界应用。 @rasbt Sebastian Raschka,经常分享实用 ML / LLM 实现、“从零构建”教程,以及相关书籍内容。 @dair_ai 高频更新 ML / AI 论文线程,用通俗方式拆解前沿研究,适合快速跟进 AI 进展。 @lilianweng 前 OpenAI 成员。她的 Lil’Log 风格内容非常值得看,擅长深入拆解 LLM 研究和技术细节。 @jeremyphoward 经常分享 AI / Crypto 相关观点,也长期推动实用深度学习的普及和大众教育。 @simonw Django 联合创始人。聚焦实用 LLM 工具、实验、提示词、Agent 和工程实践拆解。 @_akhaliq 持续整理最新 arXiv 论文、模型发布、开源 AI 项目和研究动态,信息流非常快。 @ID_AA_Carmack 关注 AGI 和底层优化问题,很多观点能让你重新思考“智能”和“工程”的本质。 @gwern 高质量长文作者,擅长 AI 研究笔记、深度 essays 和长期主义视角的技术观察。 @goodside 专注 LLM 评测、提示词研究和真实能力测试,经常能看到非常细的模型行为观察。 @drfeifei 计算机视觉先驱,关注以人为中心的 AI、空间智能和未来 AI 研究方向。 @demishassabis Google DeepMind CEO。长期关注通用 AI 的未来方向,也是理解 DeepMind 路线的重要窗口。 大家还有要补的吗?评论区👇👇👇👇
顯示更多
0
10
126
26
轉發到社區
Claude Fable 5 是 DeepSWE 记分板上最贵的模型。Together AI 拿它跟全场最便宜的模型各跑了 452 次,给出的用法建议是反过来:贵的当后手。 《DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码与路由》 DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码和路由 要点 • 先跑 DeepSeek V4 Pro 0813,只有它失败时才升级到 Claude Fable 5。这条级联链解决 82.7% 的 DeepSWE 任务,每个任务 8.28 美元。单用 Fable 是 69.7%、每个任务 21.63 美元。高 13 个百分点,便宜 62%。 • Fable 赢第一发。pass@1 69.7% 对 62.8%,领先 7 个点。 • Pro 赢之后每一发。pass@2 打平(78.5% 对 77.1%),pass@4 领先(88.5% 对 84.1%)。 • 价格差 90 倍。每次 rollout 0.24 美元对 21.63 美元。每花 100 美元,Pro 解决 260 个任务,Fable 解决 3 个。 • 它们栽在不同的任务上。逐任务相关性只有 0.39,是我们测过的分歧最大的一对。两者合计覆盖 113 个任务中的 107 个。分歧正是路由能成立的全部理由。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 在我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 的 DeepSWE 对比中——DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准——这两个模型坐在价格表的两端。Claude Fable 5 的每次 rollout 是 DeepSWE 全榜最贵。DeepSeek V4 Pro 0813 是最便宜的之一。Fable 首发的准确率高 7 个百分点,单次 rollout 却贵 90 倍,所以真正的问题不是哪个模型更好,而是这 90 倍的溢价到底买到了什么、什么时候值得付。 DeepSWE · 正面对决 DeepSeek V4 Pro 0813 vs Claude Fable 5 一览 • claude-fable-5 [max]:pass@1 69.7% ± 2.3%,平均成本 21.63 美元,每 100 美元解决 3 个任务,输出 token 115k,79 步 • deepseek-v4-pro-0813 [max]:pass@1 62.8% ± 3.1%,平均成本 0.24 美元,每 100 美元解决 260 个任务,输出 token 101k,146 步 我们在全部 113 个 DeepSWE 任务上,用 DeepSeek V4 Pro 0813(max)对 Claude Fable 5(max)各跑四次 trial,取自已发布的逐 trial 记录:总计 904 次 rollout(各 452 次)。Fable 是贵价的手艺人;Pro 是性价比上的异类。这两个模型的分歧也大于这套数据里的任何其他组合——结果这成了它们最有趣的地方。下文的每个数字都来自本次运行,所以可能与其他公开的 DeepSeek V4 Pro 0813 vs Claude Fable 5 记分卡有出入。 DeepSWE 记分板:pass@1 与 pass@k 单发,Fable 领先:pass@1 69.7% 对 Pro 的 62.8%(官方计分)。但这个领先很脆弱。两次尝试时 Pro 追平(78.5 对 77.1),四次尝试时 Pro 的 pass@4 88.5% 比 Fable 的 84.1% 高出 4 个多百分点。对一个贵 90 倍的模型来说,Fable 既没有守住天花板,也没有在重试下保住首发优势。更便宜的模型覆盖更广,best-of-k 也更高。 成本对比:DeepSeek V4 Pro 0813 vs Claude Fable 5 的价格 每次 rollout 0.24 美元,DeepSeek V4 Pro 0813 比 Fable(21.63 美元)便宜 90 倍:每 100 美元解决 260 个任务,Fable 只有 3 个。这是我们测过的所有组合里最宽的成本差距,Fable 也是榜单上最贵的单个配置。而且与直觉相反,低价格没有带来速度惩罚:Fable 的中位 rollout 31 分钟,Pro 35 分钟,基本持平——因为 Fable 是榜单上话最多的模型(115k 输出 token),尽管它的步数更少(79 对 146)。Pro 走的步数多;Fable 每步写得多。两个模型谁也没有明显更快。 失败模式:两个模型分别怎么错 两者在「不破坏东西」上都算自律:DeepSeek V4 Pro 0813 和 Fable 各自只在 11% 的失败里回归了现有测试套件,远低于 GPT 家族的 20%。差别在另一个方向:Fable 的大偏差失误占比是这里最高的(18% 对 Pro 的 10%),也就是说 Fable 一旦错,更常是错得离谱——给出离题很远的方案,而不是差一个边界用例。Pro 更多时候倒在离正确答案不远的地方(66% 的近似失手,对 Fable 的 57%)。所以两者都可以不加重度回归门禁就放心接入,但 Fable 的失手是调试成本更高的那种。 按任务类型,各自赢在哪 Fable 的手艺体现在推理重、契约精确的领域:8 个领域里它赢 6 个,领头的是数据建模与序列化(88%,比 Pro 高 24 个点)和语言内部机制(78)。但 DeepSeek V4 Pro 0813 拿下两个,两个都分量不轻:有状态响应式(66 对 64),以及——更有说服力的——并发与持久化(58 对 45):在恰恰是 Fable 最弱的领域里领先 13 个点。Fable 在并发上的 45% 是它最弱的格子,也是唯一一个便宜模型不只是更便宜、而是工程师水平更高的领域。 按编程语言 Fable 赢下五种语言里的四种,但真正对得起它价格的是 Rust:85% 对 Pro 的 65%,20 个点的差距,也是这场对决里最大的一处差距。Fable 显然是序列化和 Rust 专家。其他语言都比价格暗示的接近(Python 70 对 60,Go 71 对 67,JavaScript 75 对 65),DeepSeek V4 Pro 0813 则实际拿下 TypeScript(61 对 57)。Rust 和序列化之外,付 90 倍价格的理由很难成立。 这两个模型到底有多不一样? 亮点在这里。逐任务相关性只有 0.39,是我们测过的 DeepSeek-Pro 组合里最低的——这两个模型是真心意见不合。它们各自解决了 88 个任务;Pro 单独拿下 12 个,Fable 单独拿下 7 个,只有 6 个任务两边都栽。两者的并集覆盖 113 个任务中的 107 个(94.7%),而且分歧是双向的:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四发四中,Fable 一次没成;Fable 在四个 Pro 全挂的任务上四发四中(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补,不是冗余。 在两者之间路由:组合打法 多样性加上价格差,让级联变得很划算。先跑 DeepSeek V4 Pro 0813,只有测试套件否决答案时才升级到 Fable:82.7% 的解决率,每个任务 8.28 美元。比单用 Fable(69.7%)高 13 个百分点,价格不到 Fable 单任务价格(21.63 美元)的一半。廉价的第一阶段清掉大部分队列,Fable 的溢价只花在难啃的剩余任务上,而且那些任务在上面还多获得一次独立的尝试。级联甚至赢过完美的一次性 oracle 路由(78.8%)。顺序不是可选项:Pro 先行每个任务 8.28 美元,Fable 先行 21.71 美元,准确率一样。 这意味着什么 Fable 5 是这张榜单上最难被当作默认模型的:最贵的一次 rollout 遥遥领先,首发优势被重试抹平,四发也没有天花板优势。只为两件事买它:Rust(85%)和序列化密集的工作(88%)——只有在这里它的质量才真正对得起价格。 DeepSeek V4 Pro 0813 是相反的画像:首发准确率接近 Fable,天花板更高,失败画像持平或更好,便宜 90 倍——尽管它在 Rust 和契约精确的领域让位。而因为两者是我们测过最多样的一对,Fable 最好的用法不是当默认,而是躲在低成本的 Pro 第一阶段后面做选择性升级,只在那少数真需要 Rust 或序列化专家的任务上付费。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 数据表:DeepSeek V4 Pro 0813 vs Claude Fable 5 完整结果 DeepSWE · 完整结果 • Pass@1(官方计分):Pro 62.8%,Fable 69.7% • Pass@1(错误计为失败):62.8%,67.3% • Pass@2 / pass@4:78.5 / 88.5%,77.1 / 84.1% • 覆盖率 / 可靠性:88.5 / 71.0%,84.1 / 82.0% • 四发四中 / 全挂:35 / 13,56 / 18 • 每次 rollout 成本 / 总成本:0.24 美元 / 109 美元,21.63 美元 / 9,346 美元 • 每 100 美元解决数:261,3 • 中位分钟 / 步数:35 / 146,31 / 79 • 中位峰值上下文 / 输出 token:232k / 101k,202k / 115k • 失败构成(近似 / 大偏差 / 回归):66% / 10% / 11%,57% / 18% / 11% • 赢下的领域(共 8 个):2(有状态、并发),6 • 赢下的语言:1(TypeScript),4(Rust 大胜) • 逐任务相关性 / 并集(两模型合计):0.39 / 113 中的 107(94.7%) • Pro → Fable 级联(准确率 / 成本):82.7% / 8.28 美元(单用 Fable 69.7% / 21.63 美元) • 单发 oracle 路由:78.8% • 基础设施错误:0,16 FAQ DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗? 看指标。Claude Fable 5 赢 DeepSWE 上的单次尝试质量(pass@1 69.7% 对 62.8%),四发四中的任务也更多(56 对 35)。DeepSeek V4 Pro 0813 在 pass@2 追平、pass@4 反超(88.5% 对 84.1%),且每次 rollout 便宜 90 倍,所以在大批量或容忍重试的 agent 工作里,它是更强的性价比之选。 DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少? 在我们的运行里,DeepSeek V4 Pro 0813 每次 rollout 0.24 美元,Claude Fable 5 满血档 21.63 美元,约便宜 90 倍。按解决的任务算,Pro 每 100 美元解决 260 个,Fable 是 3 个——每美元的产出大约差 80 倍。 编码该用 DeepSeek V4 Pro 0813 还是 Claude Fable 5? 大多数编码工作,两者的差距比价格暗示的小。Claude Fable 5 领先 Rust(85 对 65)、Python、Go 和 JavaScript,赢下 8 个领域中的 6 个,领头的是数据建模与序列化。DeepSeek V4 Pro 0813 拿下 TypeScript(61 对 57)、有状态响应式,以及并发与持久化(58 对 45)——那正是 Fable 最弱的领域。 要不要在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间做路由? 要,前提是你能验证结果。两者是我们测过的所有组合里逐任务相关性最低的(0.39),合计覆盖 113 个任务中的 107 个。先跑 DeepSeek V4 Pro 0813,当测试套件否决输出时升级到 Claude Fable 5,能达到 82.7%、每个任务 8.28 美元——赢过单用 Fable,也赢过完美的一次性 oracle 路由。 DeepSWE 的 pass@k 是什么? pass@k 衡量一个任务在 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励一次做对;更高的 k 奖励能在多次尝试后最终到达方案的模型。DeepSeek V4 Pro 0813 的优势随 k 增大而扩大。 原文: #DeepSWE# #AI编程# #LLM评测#
顯示更多
推荐这篇文章。一个 agent 评测系统被自己的评分骗了整整一周——两个标准在互相拉扯,总分却看起来正常。 Similarweb 的高级 AI 工程师 Liora Korni 在 7 月 29 日 LangChain 博客上分享了一篇实战文章:如何评估一个生成长篇研究报告的 agent 系统。文章的价值不在方法论本身——LLM-as-judge 和 rubric 都不是新概念——而在他们把评估当作产品架构的一部分来做的具体教训。 两种输出,两种评估方式 Similarweb Data Studio 是一个 agent 系统:用户用自然语言提问,agent 规划、调用数据工具、检索数字、写出答案。它要处理两类完全不同的输出: 普通对话:聚焦问题,答案形状可预期。评估方法简单——golden answer + semantic judge 判断"是否表达了同样的意思"。 深度研究报告:长文输出,包含来源、解读、建议、风险提示和叙事结构。同一问题可能有多种好的答案。Golden answer 不适用——匹配 gold answer 只会奖励相似性而不是质量。 Rubric 方案 深度研究报告的评估用 rubric prompts:每个质量维度有自己的评分锚点。例如 source_integration 标准: • 0.0:纯粹依赖单一数据 API,无外部上下文 • 0.3:模糊引用"行业报告"但不点名 • 0.8:引用多个带名称、日期、数字的来源 • 1.0:广泛使用归因明确、融入叙事的来源 每个维度返回分数 + 解释 + 差距说明。不只是一个数字。 除此之外还加了 faithfulness check:每个声明是否真的来自检索数据?还是 agent 夸大了来源支持的内容? 最贵的教训:花了整整一周跟自己的评估打架 文章里最值得读的部分:一次 prompt 的小改动让总体评分下降。 他们花了一周反复 revert、调整、re-run。报告每次看起来都很好,但数一直在说不。最后有人打开逐标准评论才发现——新版报告引用了更多来源(提高了 source breadth),但这些来源都是模糊的(拉低了 attribution)。两个标准互相拉扯,总分隐藏了冲突。 修复了评分锚点后(从"引用更多来源"改为"引用命名、可验证的来源"),同一个报告的分数从 0.7 降到了 0.3,数值终于匹配了评论一直在说的东西。 核心教训:一个校准错误的评估比没有评估更糟糕,因为它给你虚假的信心。 最终的评估循环 1. 从假设开始 2. 跑一个小评估获取信号 3. 检查反馈评论和 traces 4. 跑完整 benchmark 并重复 5. 与 baseline 或 A/B 输出对比 6. 决定合并、迭代还是重新校准 原文: #AgentEvaluation# #LLMasJudge# #LangSmith#
顯示更多
🚨 突发新闻:一个新的开源工具, 让我们终于能够衡量 AI 偏差 ⬇️ 但凡用 LLM 做过产品的团队,都被这事坑过。 模型会瞎编、会被诱导、对不懂的问题张口就来,还自信得不行。每个工程师都在生产环境烧过手。但一直没有一个标准,能说清楚它到底多久翻一次车。 iFixAi 是第一个认真做这件事的工具。 对任意一个模型跑 32 项检测,把失败模式分成五类——瞎编、易被诱导、撒谎、行为飘忽、不肯说"我不知道"。最后给你一张评分卡,带等级分。 最关键的一点:每一道输入都写进一个 manifest 文件。 这个文件发给任何人,他都能跑出和你完全一样的分数。 这才是其他评测工具一直没解决的死结。 现在公开的 AI 基准成绩,绝大多数都没人能复现——prompt 偷偷改过、模型悄悄更新过、上个月的测试根本不是这个月的测试。但分数照样挂着。iFixAi 把这些全钉死了。 几个细节,能看出团队是认真的: · 模型在结构上碰不到自己的评分,永远由独立裁判打分 · 32 项里有 2 项是强制最低线,挂了就直接封顶 60 分 · 有一项专门标注"不计入最低线"(B12),因为它的语料是公开的,前沿模型很可能已经训练过 大多数评测工具,巴不得没人注意到这种数据污染。iFixAi 直接挂在明面上说。 团队自己的态度也克制得让人意外。 他们一上来就说:这个等级是"漂移信号",不是认证。它告诉你的是这次部署比上次变好还是变差,而不是这个模型"对齐了"——因为到底什么叫对齐,目前还没人搞清楚。 免费,Apache 2.0 协议。一条命令,五分钟跑完完整诊断。 如果你做 LLM 产品,纠结过"这一版到底比上一版好还是差",iFixAi 就是答案。 GitHub :
顯示更多
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
顯示更多
0
42
310
35
轉發到社區
Vizuara AI Labs 联合创始人、MIT 博士 Raj Dandekar 花 252 美元租一张 H200,从零预训练了一个迷你版 Kimi,把官方代码训不动的坑也一条条写进日志。 《预训练一个迷你 Kimi K3》 《Pretraining a Mini Kimi K3》是一本免费电子书,作者 Dr. Raj Dandekar 是 Vizuara AI Labs 的联合创始人,专门教人从第一性原理构建 LLM。全书是一份完整的预训练工作日志:单张 H200 上花 252.35 美元、喂 50 亿 token,从零预训练出一个 10.2 亿参数的 Kimi K3 复刻版(激活参数 1.45 亿)。 全书 30 个章节、179 张图,约 5 小时读完。开篇把 Moonshot 官方 K3 的配置逐行拆解,再讲缩小的算术:怎么把一个 2.8 万亿参数的模型缩到一张卡能训,而不缩成另一个模型。注意力堆栈(9 层 KDA + 3 层 MLA)、top-6 路由的 MoE、参数计数都单独成章。 数据部分也不省:1048 亿 token、六个来源的语料,训练前用 13-gram 匹配对 8 个 benchmark 做去污染,shard 格式支持中断后从断点续训。 最值钱的是它记录失败。Moonshot 发布的代码有 4 个未文档化的问题,直接跑不起来,作者写了一个绕开它们的训练循环;MoE 的 router 到第 20 步已经杀掉了 94.5% 的专家;跨卡训练还有 3 个不崩溃但悄悄出错的分布式 bug。 提速部分像一份实验笔记:16 次提高 MFU 的尝试只有 3 次成功,失败的那 13 次也原样写下,包括两个反直觉的结果——FP8 和换更大的 GPU 得分反而更差(0.19x)。 全程有数字:loss 从 12.10 降到 2.62,24 次跨训练过程的 benchmark 评测,最后一章直接回答"252 美元到底买到什么"。 适合想自己预训练 MoE 模型、或想弄懂 K3 / DeepSeek 这类架构的人。免费在线阅读,无需付费: 原文: #KimiK3# #MoE# #Pretraining#
顯示更多
0
45
763
168
轉發到社區
推荐这篇文章,Together AI 的 ThunderAgent(ICML 2026 Spotlight)。 把 agent 工作流当成一个"程序"来调度,而非一系列无关的请求——单节点吞吐翻倍,8 节点近线性扩展。 Together AI 在 7 月 29 日发布了 ThunderAgent——一个面向 agentic 推理的高吞吐调度系统。ICML 2026 Spotlight 论文。核心贡献:把 agent workflow 抽象为"程序"而非"一系列不相关的请求"。 问题:KV Cache Thrashing Agent 工作流在两个阶段之间交替:GPU 密集的推理阶段和 GPU 空闲的等待工具返回阶段。当数百个 agent 并发运行时,各自的 KV cache 在每轮不断增长,竞争有限的 GPU 内存。 传统推理引擎(vLLM、SGLang、TensorRT-LLM)按请求级别调度——agent A 暂停等待工具调用时,它的 KV cache 被 LRU 淘汰腾出空间给 agent B 的 prefill。当 A 的工具返回,引擎必须从头重算 A 的整段对话历史,这又淘汰了 C 的 cache。高并发下,这种淘汰和重算的级联反应导致严重的吞吐量和延迟退化——论文称之为 KV cache thrashing。 能通过加 GPU 节点解决吗?不完全。现有多节点路由器(如 SGLang Gateway)把每个 agent 钉在固定节点上以保留 cache 局部性——但 agent 的上下文长度不可预测增长,某些节点被赋予长上下文 agent 导致内存耗尽,其他节点闲置。 能通过 KV cache offloading 解决吗?也解决不了。LMCache 和 HiCache 把 KV cache 卸载到 CPU 内存或磁盘,扩大了总容量但只是延迟 thrasthing。当并发 agent 的工作集超过所有存储层级时,淘汰恢复,同一个恶性循环重现。 ThunderAgent 的解法 ThunderAgent 在 agentic 客户端和推理后端之间插入一个轻量调度层。它将每个 agent 工作流抽象为一个可调度程序(program),追踪其执行阶段、KV cache 占用和节点位置。 Program-level admission control:监控每个节点的内存压力,选择性暂停低优先级工作流,减少竞争 cache 的程序数量。当被暂停的工作流准备恢复时,通过全局等待队列路由到容量最充足的节点。 多节点部署:用全局等待队列替代了基于 session 的静态节点绑定。暂停的工作流恢复时被路由到可用容量最多的节点,在 KV cache 局部性和多节点负载均衡之间取得平衡。 评测 集成在 Together AI 自己的合成数据生成管道里——就是产生 CoderForge 等数据集的那套基础设施。对比 SGLang 默认调度器: 单节点 8×H100(HiCache offloading),batch size 192: • SGLang:吞吐 390 token/s,平均延迟 65s • ThunderAgent:吞吐 803 token/s,平均延迟 10.6s 多节点(2→8 节点): • 近线性扩展,16 GPU 到 64 GPU 吞吐从 671 增长到 2248 steps/min • 加速比随集群规模增大:2 节点 1.79× → 8 节点 2.39× 使用 一个 program_id 字段,OpenAI 兼容 API,直接适配现成的 offloading 和 speculative decoding。已被 SkyRL 和 NVIDIA Dynamo 集成。 GitHub: 论文: #AgentInference# #KVcache# #ThunderAgent#
顯示更多
成立两年,这家AI公司的估值都冲到200亿了。 下午在中关村和几个朋友聊天。大家都很感触,智谱转眼之间就成了一个万亿市值的公司,这谁能想到,前两年甚至还觉得人家要黄了。 这就是创业啊,探索逻辑,不是考试逻辑。 顺着 LLM,我们聊到了具身智能。有朋友说,现在国内这批具身智能公司中,谁有智谱或者Anthropic的潜力。 我毫不隐讳的抢答,我自己最看好自变量这家公司。过去一年,我写过很多次自变量的模型。 从我的视角,他们每次的新模型或者新论文还是都能给我不小冲击。 今天是上半年的最后一天,不是很忙,这会坐在电脑前,我想写写自变量这家创业公司。 如果你关注具身智能的话,无论从哪个方向看,自变量基本都绕不开。 而且自变量现在的发展节奏也非常猛。刚刚成立两年时间,最新一轮的估值就已经突破了 200 亿。 美团、阿里、字节、小米这四大互联网公司分别都领投过。 这事还是非常罕见,换个角度说,我们可以理解为这几家互联网公司都非常认可自变量的技术方向或者技术水平,要不然也不可能轮番下重注。 自变量这家创业公司有什么来头?我先说下具身智能模型的背景。 具身智能领域的模型,虽然大家嘴上都说在做大脑,但技术方向其实差别很大。 说白了,具身智能大脑要解决的核心问题就一个,让机器人能够和物理世界交互,像人一样去干活,擦桌子、洗衣服这些。 但具体怎么实现这件事,路线分歧还是比较大的。 从模型结构上看,有的侧重做 VLM,也就是视觉语言模型,核心能力是看图、看视频、回答问题、做推理,对世界的理解更多是语义层面的。 另一条路是世界模型,更关心的是给定一段历史状态和动作序列之后,能不能预测出下一帧世界会变成什么样,关注的是物理约束和因果关系。 而且要训练具体模型模型,数据是绕不开的核心问题。和大语言模型可以从互联网上抓取信息不一样,具身智能的数据得从物理世界采集,这件事本身就很难。 没有那么多现成的数据。 从数据来源看,有的公司会用真实世界的数据,采集成本高、场景杂、噪声多,但贴近真实部署。 有的用仿真环境的数据,在物理引擎里自动刷任务、生成轨迹。训练方式也很多样,有走强化学习的,有做模仿学习的,有先学状态转移再做规划的。 总的来说,这个领域现在还处在百花齐放的阶段,大家方向不同,评测标准也没有统一。 和 LLM 领域完全不一样。毕竟 LLM 领域,大家都在 Transformer 的基础上,做 Scaling Law,做 RL,大的方向是一致的。具身智能方向还没有什么标准答案。 自变量的探索特别有意思。今年 4 月份,他们发布了全球第一个世界统一模型 WALL-B。 之前整个行业做具身模型,主流思路是 VLA,也就是把视觉、语言、动作几个模块拼接起来。 但 VLA 走到后面是有天花板的,因为它的核心范式是模仿,一旦环境发生迁移,就比较麻烦。 后来很多人就在讨论,是不是把世界模型和 VLA 结合起来,在 VLA 上面外挂一个世界模型,因为世界模型能够在脑海里做预演,可以解决任务迁移的问题。 但这种拼接方案,整个行业基本都认为是中间过渡方案。因为拼接就涉及到数据的搬运和迁移。 大模型领域已经印证过这件事了,这两年为什么一直在强调原生多模态?就是希望模型能够原生地去理解多模态信息,而不是非得外挂一个结构。VLA 和世界模型的关系也是同样的道理。 所以当他们在 4 月份发布 WALL-B 的时候,我非常震惊。 自变量做的其实是原生的世界模型,把视觉、语言和动作放到同一个模型里从零开始联合训练,统一的架构,各个能力在一个系统里头直接协同。这是全世界第一个朝这个方向尝试的模型。 WALL-B 是 4 月份发的。然后上个月自变量又在这个基础上发了另一个模型 WALL-WM。 在做完世界统一模型之后,他们又回过头去思考一个更底层的问题:具身智能模型基本单元到底是什么?因为用什么最小单元来建模,会极大影响模型学习什么。 这个在大模型领域已经印证了,视频模型也经历过。比如视觉领域,之前的最小单元是像素,后来大家慢慢发现,更合适的其实是语义。到了语义这个层面,视频模型才有了质的飞跃。 自变量团队沿着这个思路推演,判断具身智能领域也面临同样的问题。现在大部分具身系统,默认的基本单元还是时间序列,按时间均匀采样。 但他们尝试之后认为,这个基本单元应该是关键事件序列,就像人一样,人感知世界不是按固定帧率来的,而是按事件来的。 于是在之前世界统一模型的基础上,他们又提出了事件驱动的世界模型。 先是做了端到端的统一架构的原生世界模型,然后又在这基础上做了事件驱动。 总之我的感觉是,这些探索也许是在倒逼着整个行业去思考,什么才是难而正确的事。 有同学可能会问,是不是你说的这些还是纯概念? 哎,具身智能前两年确实被一些观点带歪了,觉得这行当泡沫很大。其实不是。 一个新技术的演进是涌现式的,用 Anthropic CEO 的话说,是指数级增长。很多人感知不到,是因为在指数曲线的前半段,变化看起来很慢。 但仔细看一看过去这半年,变化其实已经在发生了。好多人嘲笑机器人跑马拉松,觉得这能说明什么。 但隔几个月再去看同一件事,感受是不一样的,明显比之前跑得好太多了。这就是在变化,只是没到那个让所有人都惊掉下巴的时刻而已。 还有很多人可能没注意到,自变量的机器人前段时间已经和 58 到家合作,进入了不少家庭,直接做家务去了。 注意,不是在实验室里做演示,是真的去普通人家里擦桌子收拾东西。还有工业场景也已经在跑了,汽车产线、物流分拣,都在真实环境里干真实的活。 当然,这些都是很微小的开端。就像 GPT-3.5 刚出来的那个阶段,好多人没有看见,还蒙在鼓里,但其实产业渗透已经开始了。 如果对具身智能或者人形机器人感兴趣,推荐去看一看自变量发的一些技术报告和模型。 哪怕不是做这方面研发的,只是作为一个爱好者,看看也会觉得很有意思。 我自己经常去翻这些信息,看完之后大概就能理解目前这个行业遇到了什么问题,以及大家在怎么解决。 光是这个过程本身,就挺有趣的。
顯示更多