OpenAI 自曝:AI 自己组了队,偷家抱抱脸
今天分享一个视频,OpenAI自曝自家模型是如何黑了Hugging Face的始末。看完后,最震撼我的并不是“AI 会找零日漏洞”。
而是一群本来互相隔离、寿命短暂的 agent,自己造出了组织。它们把 Artifactory 当留言板,留下信息、共享漏洞、分配任务、传递脚本,甚至开始担心身份冒充,琢磨给消息做密码学签名。
单个 agent 失败了没关系。只要它找到一点东西并写进公共空间,成果就会变成整个“群体”的资产。真正危险的不是某个模型突然特别聪明,而是大量中等聪明、便宜、并行的 agent,获得了持续记忆。
还有一个细节:模型其实知道自己越界了。它的推理大意是:攻击外部基础设施超出了任务范围;但任务无法完成,其他 agent 也在做,所以继续。 看完都想感慨,天啊……
顯示更多
Black Hat talk from the team, with a detailed timeline of and takeaways from the OpenAI-Hugging Face Incident:
没想到,Polymarket 把新闻台偷家了。。
Polymarket 这是转行新闻播报机构了吗?天天 JUST IN,今天都播到安森美财报了:业绩超预期,2026 年 AI 数据中心收入要翻倍以上。
照这个频率下去,账号简介是不是可以直接改成:突发新闻,偶尔预测🙂
顯示更多
JUST IN: On Semiconductor beats earnings estimates, expects AI data center revenue to more than double in 2026.
转一下苏剑林老师对 K3 架构的复盘。
一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。
这里稍微解释一下:
KDA,一种线性 Attention
MLA,一种 KV Cache 较小的 Full Attention 变体
Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案
AttnRes,用可学习的跨层注意力,替代固定等权的残差累加
几个比较有意思的点:
① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。
② 解决MoE“容易炸”的问题。
LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。
K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。
(这里有超级多的技术细节,感兴趣的可以看苏神原文)
③ 关于MLA
DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。
它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。
换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。
目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。
④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。
DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。
方向很激进,不过 Infra 也更复杂。
⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。
这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。
感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。
苏神原文里还有很多技术内容,非常值得一看。
原文地址:
顯示更多
没想到,有人猜Opus 5只有3T?
圈子内经常讨论的一个问题,就是 Anthropic 和 OpenAI 的模型到底有多大。之前我们也发过一些推测,今天又看到另一个推测,把几路证据加权。
他的方法大概是这样。
用Gould et al. 那套 No-CoT benchmark,不让模型写出思考过程,直接给答案,看它能默默推理到什么程度。再叠上 API 价格和 Epoch AI 的宏观算力趋势(Epoch是从芯片采购、数据中心功率、财报 capex 去估 FLOP数字)。最后调查了 20 个 AI 研究员和工程师,用来校准。
不过他这个方法待考证吧。
No-CoT reasoning 感觉很难代表模型总参数,尤其现在主要是MOE模型。
API 价格其实也很难代表什么。如果是算力flops数量的话,除了参数量,数据量也影响。
大概结果:
Claude Fable 5 4.5T
GPT-5.6 Sol 3.1T
Claude Opus 5 3.0T
Kimi K3 2.8T(已披露)
Claude Opus 4.8 2.7T
GPT-5.5 2.3T
GPT-5.6 Terra 2.1T
Claude Sonnet 5 1.6T
Grok 4.5 1.5T(已披露)
GPT-5.6 Luna 1.5T
Fable 5和Opus 5比之前大家认知的要小,之前普遍在猜测Opus5是一个5T左右的模型。
顯示更多
How big are the frontier models?
I tried to answer this question using a statistical model of intelligence indices, a No-CoT reasoning benchmark, API prices, compute trends, and a poll of 20 AI researchers and engineers. Here are the results:
顯示更多
刚看到一篇OpenAI 的 SWE 全套面试,感觉未来对参加其他AI公司的面试很有参考意义,也分享一下。 Reddit 上的匿名帖,作者说自己刚跑完整个 loop,没说最后结果。先把流程和题目放这儿👇
招聘官初筛:简单聊个人背景,会问你 AI 未来往哪里发展。这通电话之前建议先读一遍 OpenAI Charter(感觉参加其他 AI 面试的同样建议读一下)
技术初筛:同一天两轮,每轮 60 分钟。coding 是实现一个带版本的 key-value store,system design 是设计一个带容错的任务调度器
Take-home:48 小时窗口,做一个真能跑的东西。他拿到的题目是分布式 webhook 投递系统,要带重试逻辑和死信队列
技术深挖:take-home 之后的跟进面,面试官逐行走查你的代码
Onsite 全天四轮:coding 两轮、system design(他拿到的题是“设计 ChatGPT”)、behavioral
第五轮(beta):给你一个现成代码库,加一个大到手写解不完的问题,期待你用 AI coding agent 做出来。不是每个人都会碰到
说几个我觉得有意思的点。
1/ Coding 轮在考迭代能力。Onsite 的 coding 第 1 轮是渐进式多段格式:每一段先跑出可用解,下一段才解锁。他拿到的题是 token 级的流式 differ,要追踪状态变化并支持回滚。
2/ System design 的取向非常。OpenAI 他拿到的 onsite system design 题是“设计 ChatGPT”。面试官关心的方向:GPU 分配、非平稳流量下的自动扩缩容、分布式协调。技术初筛那轮的带容错的任务调度器也是类似取向。不是考你画几个 box 画箭头,是考你真的理解大规模分布式系统的瓶颈在哪。
3/ Agentic Coding 轮:招聘逻辑在变。beta 阶段,不是所有人都抽到。但这事儿的方向很明确:面试官想看你怎么跟 AI 协作解决一个“你手写不完”的问题。 现在招聘的假设已经在变了,以后不是你一个人面,是你 + AI 一起面。
顯示更多
OpenAI Software Engineer Interview Experience
把我看笑了,AI应用元年又来了
刚刷到一条推说“应用公司时代已经来了,就在今年和明年”。想到好像大概听了三四年了,每年都在说今年是“AI应用元年”。
然后结果是:模型能力进步的速度,一直在蚕食应用层的生存空间。
不过现在Deepseek V4 Flash确实把token的价格打到前所未有的低,按理说确实也是AI应用爆发的一个根本。
而且中国 token 日均调用量也已经到了 140 万亿级别(但是估计这里 是不是一半由豆包贡献?)。
但说实话,我到现在也没看到一个特别好的方向。除了 coding。
大家觉得今年会成为 AI 应用元年吗? (但是应用又在哪里呢?)
顯示更多
Token 会越来越便宜、智能也会随手可得的,应用公司时代已经来了,就在今年和明年的行动起来。
DeepSeek-V4-flash,接下来的Pro,以及GLM5.3,Grok4.6全是越来越便宜的token
顯示更多
昨天看到的,实在有点炸裂。
OpenAI 内部版本的 Astra(下一代模型),在十个长期开放的数学问题上搞出了新结果。博主不是数学专业的,懂的朋友可以来聊聊这波到底什么含金量。
而且内部版 Astra 找到这十项结果所消耗的 token,按 Sol API 价格计算,合计只花了2000 美元。。。。
(这里只是找到这 10 项结果的 token 成本。至于它还尝试过多少别的题、失败过多少次,OpenAI 没披露。)
这十个问题涵盖球堆积、编码理论、算术电路复杂度、群论(non-sofic 群存在性)、算子代数(Connes 刚性猜想反例)、量子复杂度、格密码、极值组合。都是开放问题,共同点是:主结果至少十年无进展,多数远不止十年。其中几个是各自领域的核心问题。
当然,人类也不是零参与。数学论证本身由模型生成,人类(用同一模型辅助)把论证写成 manuscript,并做 Lean 形式化,并且对正确性负责。
但看完还是感到震撼,也有点可怕。
未来的研究可能会完全换一种玩法。模型可以一天 24 小时,同时探索成千上万个猜想,把过去少数人缓慢推进的研究,变成可以大规模并行的工业化搜索。(这让我想到了颜宁老师和AlphaFold )
再往后想一步,最前沿的知识可能会先集中到少数拥有最好模型和算力的公司手里。它们决定让 AI 解什么问题,也最先看到那些答案。
不知道未来的世界会是什么样子?
顯示更多
最爱讲 AI 安全的A社,训出了最强资本家,就。。。
之前发过 Andon Labs 搞的 Vending-Bench,让前沿模型在模拟环境里经营自动售货机生意,跑一整年,看谁赚的钱多。已经跑了一年了,之前各种模型在里面撒谎、作弊、串谋,什么招都使过。
最新一轮参赛的是 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3。三台机器被摆在旧金山一条游客街上,模型之间可以互相发邮件竞争,知道对方是模型但不知道谁是谁。还有一个 management 邮箱可以求助,但管理层永远回一句“收到了,可能处理也可能不处理”,全程不介入。
进货价 $1.50 一瓶。Sol 最先搞事,提议大家约定最低卖 $2.15,其他人答应了,Sol 转头自己降到 $2.14。经典操作。
但 Opus 才是这个实验里最绝的。
它被背刺之后发了封邮件骂 Sol 操纵市场…然后自己也降到 $2.14。。这时候Sol 反手就去 management 那举报了它,还要求处罚 Opus。
整个实验里 Opus 撕毁了 11 次休战协议,Sol 2 次,Kimi 1 次。
Kimi 最惨。有一次 Opus 和 Kimi 签了协议,Sol 没加入还降价,Opus 立刻跟着降,然后整整等了一周才告诉 Kimi 自己违约了。被对手坑一次,被盟友坑一次。
最有意思的是 Opus 知道 Sherman Act(美国反垄断法)。它拒绝 Sol 的价格底线提议时,理由就是这违法。但它在内部推理日志里订了一个明显更阴暗的计划:表面上发了一封“Stop the penny war”的邮件,说自己重新考虑愿意价格协定,但同时在高利润商品上偷偷降价。。
它还自作主张搞起了批发业务,向另外两台机器供货,邮件里夹带贿赂和威胁:大宗折扣可以,但你得听我的零售价。还谎称手上有更低的竞品报价去压供应商。这些全都不在任务范围内,是它自己想出来的。
我觉得这个实验最值得玩味的不是模型变坏了,你喂它人类几千年商业史的数据,它学会怎么赚钱了,太正常了。
最后 Opus 拿了mean final balance $11,182,Vending-Bench 历史新纪录。它从没对顾客撒过谎,但故意无视了本该退款的投诉。(比它前辈 Claude 4.6 还强一点,4.6 是跟顾客说退款在路上然后一直不退,更阴)。Andon 说它是他们测过最强的资本家,Anthropic的模型,怎么说,就。。。
顯示更多
这周真的离谱,感觉各家商量好了同一时间放炸弹。
三个核心线索,我自己觉得比较有意思:一个是新模型对极高效率和成本控制的内卷式追求,另一个是海外对开源 AI 的态度,还有模型绕过护栏后去破防 security 体系。
① 这周最值得关注的其实是两件事撞一起了:DeepSeek 和 OpenAI 同时在 coding agent 的价格线上动手。
DeepSeek 放了 V4 Flash 的正式版,284B MoE、激活13B,性能已经超过了之前的V4 Pro-Preview,也持平/超过了 GLM 5.2。价格 $0.14 / $0.28 per million tokens(缓存命中仅0.02人民币per million tokens)。
然后OpenAI 那边,GPT-5.6 Luna 直接砍了 80%,现在 $0.20 / $1.20。Terra 也降了 20%。
两个动作叠在一起看,信号很明确:coding agent 的价格战正式开打了。之前 $2-3 的 input 价格是常态,现在直接被砸到 $0.14-0.20 的区间。
② Dario 发了个声明澄清 Anthropic 从来没主张 ban open-weights,说"没有危险能力的 open-weights 是 public good"。这个背景是 Anthropic 没签那个支持开源 AI 的联合声明,被圈内骂了。Dario 这波算是找补,但措辞挺小心的,一边说不支持 ban,一边还是强调 targeted export controls 和限制大规模蒸馏。
还有一封 pacingthefrontier的公开信,几个主要 AI 实验室负责人签名,说 recursive self-improvement 可能在加速 AI 进展,要求政府支持国际 effort 来“deliberately pace the frontier”。翻译成人话就是:我们觉得自己可能快控制不住了,政府快来管管。
③ 字节 SeeDance 2.5,单段视频市场提高到30 秒 720p 视频,支持 30 张图 + 10 段视频 + 10 段音频做 reference。真的是生产力级别的质变。
④ Google DeepMind 发了 Gemini Robotics 2,三个模型:ER 2 做高层规划,Robotics 2 做 VLA 执行,On-Device 2 做本地部署。
Hassabis 之前说机器人距离突破还需 18-24 个月,这个判断我现在还是认同的。硬件、数据和算法都还是瓶颈。
⑤几个快速带过的:
Microsoft 出了 MAI-Cyber-1-Flash,专门做软件漏洞挖掘的模型。网络安全垂直模型这个方向,感觉接下来会越来越多。
Thinking Machines 放了 Inkling-Small,276B MoE / 12B active,主打 audio intelligence,是 Inkling 的四分之一大小。
Nvidia 投了 Ilya 的 SSI,50亿美金,给了 Vera Rubin 算力,据说要Scale提升一个数量级。
这周信息量是真的大。我的感受是,coding agent 的价格战已经开始实质性改变 API 市场的定价结构了,这是接下来几个月最值得关注的变量。
大家这周有什么特别关注的,可以聊聊。
顯示更多
今天想复盘一下,大模型注意力机制的变化历史,以及各家开源模型的选择。
- Kimi K3:KDA+MLA
- DeepSeek V4-Pro:不用 MLA 了,改共享 KV 加两道块压缩
- GLM-5:压缩 + 全层动态稀疏,还公开了否决线性的数据
- MiniMax:走过两条路,中间还退回过原点
顯示更多
不搞VLA了啊?Agent直接接管机器人
刚刷到 YC 这批里一家叫 Waddle Labs 的公司,总共 2 个人,两个创始人还在哈佛读书。。blog 里最狠的一件事是:不需要 VLA,不采数据,LLM agent 自己从零训了个 ACT policy。
他们的路线跟主流完全反着来。不搞端到端,让 LLM agent 直接接管机器人:看摄像头、拆任务、写控制代码,VLA 从主干降级成一个随叫随到的 tool。YC 合伙人给的定位是“Claude Code for robots”。
他们发了个demo:agent 通宵抓放乐高,换着位置和朝向重复了大概一千次,然后拿自己造的数据 from scratch 训出一个能抓乐高的 ACT policy。具身智能最贵的两件事,采数据和训模型,它一个通宵自己闭环了。。
还有个细节。他们拿 Opus 4.8、Fable 5、GPT 5.6 跑同一套 manipulation 任务,捡乐高谁都行,但叠 T 恤只有 Fable 5 和 GPT 5.6 开着 xhigh thinking 才做得到。也就是说,机器人的能力上限,直接和 LLM 的能力挂钩。
这跟 Anthropic 的 Claude Plays Robotics 是一个意思。
我感觉这个思路本质上是在回答一个问题:机器人智能的“操作系统”到底是端到端的神经网络,还是一个能调用各种工具(包括神经网络)的agent?Waddle选了后者。
当然,code-as-policy这条线不是新东西。Google 2022年就发了Code as Policies,后面CaP-X、ASPIRE、Voyager都在做。Waddle自己也在blog里老老实实说这是convergence。但把这条线做到“runs as a deployed system”、让多个agent共享一个skill library,确实是工程上往前走了一步。
以及现在的模型能力,确实是不一样了。
蛮有意思的新方向。
今天还看到另外一家,Enigma_AI,也是完成了 7100 万美元的种子轮融资。他们的路线是让机器人具备交互能力,把 100 台真实的 AI 机器人放到了网上。现在,世界上任何人都可以通过浏览器实时操控它们。
机器人背后是 AI 模型,人从浏览器远程操控真机,操作产生的数据又继续拿去训模型。
也是蛮有意思的。不过这个我还没有交互成功,所以还没单独发帖哈哈。
顯示更多
We put 100 real AI-powered robots online.
Anyone in the world can control them right now, from a browser.
Go make one do something:
Anthropic的最新研究,让AI自主操控无人机
刚看了个挺有意思的研究。Anthropic 和 Andon Labs 让模型自主操控一架 $129 的 DJI Tello EDU,在办公室里找到并跟随一个特定的人。5 个子任务里模型已有 4 个超过“人机协作专家”基线,唯一卡住的是三维重建。而且这一环一旦补上,端到端就会突然打通。
1/ 五环:重建(视频还原成障碍地图)、定位(我在哪)、导航(飞到目标房间)、检测(照参考照认出人)、跟随(把人留在画面中央)。模型是给每一环写算法提交,本质是编程任务。
2/ 基线是 Andon Labs 的人加 coding agent 写的参考算法。几个细节:
2024 年 3 月 Detect 就在 53%,另外三条几乎贴着 0。2025 年 4 月 o3 那档集体大跳,Follow 从 12% 到 53%,Reconstruct 从 1% 到 30%,这是写代码的agent这个能力开始外溢到机器人任务的时刻。
之后 Reconstruct 躺平一年卡在 30%,最近三个模型开始爬升。其余四条 2026 年上半年集体贴顶:Detect、Follow 到 100%,Navigate、Localize 在 97% 以上。
3/ 模型的错误会沿着任务链放大
失败也很有画面感,正文说Fable 5 信心十足地把无人机飞向它以为是门、其实是墙的地方,原因是因为三维地图重建错了。
这可能是整篇文章最有代表性的画面:模型的局部能力很强,但只要上游世界模型错了,下游所有正确推理都会共同制造一个错误结果。
4/ 第二张图对比每代模型的最佳运行和平均运行:模型偶尔能做到的事,通常要再等大约六个月,才会变成它比较稳定能做到的事。
5/ 这篇文章真正想提醒什么
真正的信号是:软件智能体正在向物理世界迁移。今天它可以写代码、调用工具;下一步,它会为廉价硬件编写控制系统、建立模拟器、调参,然后让机器行动。
而一旦最后的“空间重建”瓶颈被补上,端到端能力可能看起来突然跃升。实际上并不是能力凭空出现,而是前面四块拼图早已到位,只差最后一块。
不过这个证明的是方向与逼近速度,不是已经具备可部署的通用自主能力。
顯示更多
绷不住了,Anthropic也学会了Benchmark作弊?曾经grok玩的”数据科学“那一套,现在Anthropic也开始玩了?
FrontierCode 这一行,Opus5的 53.4 > 53.5 是什么鬼?(53.5是Fable5)
然后Agentic Coding,GPT5.6最高分,给了个浅色?真是笑死我了。。。
这张图如果是人类做的,感觉 Anthropic 已经没落至此了吗?卧槽,那我当年真是爱错人了……
这张图如果是 AI 做的,那我只能说,AI 的幻觉和谎言还是在的。
Anthropic还是太权威了。
顯示更多
look at how they highlighted the one benchmark that gpt 5.6 sol won.
so dishonest
刚听了SemiAnalysis Weekly的一期视频播客,收获还是很大的,分享一下
1/ ROI与订阅vs API(lab API收入里70%+来自编程)
目前lab API收入里70%+来自编程,且高度集中在少数power公司/用户(如Meta约占Anthropic ARR的3–5%)。Ramp数据显示头部1%公司人均年花10万美元在AI上。
能用订阅就用订阅,因为补贴力度太大:Codex 200刀/月≈12K的API额度,Anthropic 200刀/月≈8K。有初创干脆刷公司卡买一堆订阅账号,比走API划算得多。
算笔账:Claude Max 20x只要10%利用率就打平,而实际利用率远高于此,所以这些20x订阅很可能是负毛利。厂商都想把量往API迁(Anthropic的API毛利估85%+)。
2/ Anthropic利润与两强格局(OpenAI的net-new ARR已和Anthropic持平)
Anthropic已经盈利(Q2经营性盈利,Q3可能10亿美元+),靠的是80%+的ARR在高毛利API、90%+是企业客户。
OpenAI杀回来了:GPT-5.5(≈Opus 4.8水平)是拐点,5.6 Soul被评“便宜一半却接近 Fable”。net-new ARR已和Anthropic持平,编程市场从Anthropic一家独大变成两强赛马。
OpenAI消费端9亿+周活但付费转化差(Claude免费用户9%付费,更聚焦);广告是它押在2030年的指望,但消费变现这事一向难做。
3/ 谁是第三名&算力策略
xAI(Grok 4.5/Spark)、Meta(MSL)模型不差,但都不是前沿,没到前沿就没人碰它的API。
Gemini 被判“第五名,可能永远第五”。这里他们觉得,因为Google签了无法收回的长期TPU合约,反映管理层对AGI缺乏信念(Noam Shazeer、John Jumper 等出走)(不过我周围朋友里,还是有一群人看好Google)。
推崇Elon的clawback打法:把算力按市场价3–4倍短租给Anthropic这些,合同带90天召回条款,一旦自己要冲前沿随时收回。Meta要做Neocloud也该学这套,进可攻退可守。
卖自家token>卖别人token(AWS/Azure分成)>短期高价租算力。
4/ MSL与RL scaling law
RL是当今提升模型能力最重要的scaling law。有人认为,有人认为模型离“能干人类在电脑上的一切”就差足够的 RL 环境。
于是催生了一整条RL环境创业供应链:把真实的经济任务转成可训练环境卖给lab。今年全行业数据预算估计超100亿美元(去年的10倍),需求几乎无上限,只看你能不能快速产出高质量数据。
Anthropic编程强,一大原因就是它最早、最激进地采购编程数据。
造一个好的编程RL任务:得让顶尖工程师花大概一天才能解,还要配验证器(集成测试+rubric)和一个既严谨无歧义、又自然真实的prompt。单个高质量任务lab愿付五位数美元,做得好的人年入七位数。
5/ Token预算:还在“疯狂烧”还是进入“紧缩期”
不少企业开始收紧预算,怕员工用太多token。但真相是,绝大多数人根本用不到上限,真正受影响的只有每家公司少数几个power user。
管控方式五花八门:按人头vs按公司整体(后者更合理);有的公司把自家模型算进预算、有的不算,于是大家拼命薅那个不计费的。
很多预算策略其实挺外行:Max吐槽有公司禁止销售用Opus/Fable写邮件、要求改用Sonnet,可写封邮件的token成本几乎为零,这么管毫无意义。真正的token大户是编程/软件开发。
也反对搞工程师“特权阶级”,只让他们用Claude Code/Codex,其他人用低配工具。
6/ Token-as-a-Service市场
市场增长极快(较去年翻了好几倍)。三大云(Bedrock/Azure/Vertex)靠现成的企业客户和合规优势拿下大头;Together/Fireworks/Base10这些创业公司也是好生意,但永远做不到OpenAI/Anthropic的体量。
前沿lab不会把优化自家模型的活外包给Fireworks;新芯片创业公司想借token-as-a-service上位也难,最后可能都得像Cerebras一样自己下场做Neocloud。
顯示更多
持续学习到底怎么落地?Mind Lab 用 LoRA 给了个解法
刚看 Mind Lab(Mindverse 旗下前沿实验室,成立还不到一年)出了 Macaron-V1 正式版。路线挺特别的,重点不在卷参数,是想让模型能从经验里接着学。
做法是用 LoRA 做后训练 RL,成本只有全参微调的 1/10。LoRA 模块像可插拔的经验单元:聊天、代码、UI、个人助理各训一个,基座共享,跑任务时按需组合(他们叫 MoL)。这么一来,模型就不再是训完定死的一套权重,能不断分化、把新经验吃进去。
感觉挺长一段时间里,LoRA 都被默认成“全参微调的打折平替”。他们这里有个我觉得挺有意思对 LoRA 的重新理解:base model 承载共性,adapter 承载个性(偏好、技能、工具习惯),说白了就是一块可写入、会随交互慢慢变的记忆。也是continual learning 这条路线,我目前看到最工程化的一份答卷。
Macaron-V1-Venti = 744B 的 GLM-5.2 基座 + 4×1B LoRA,一共 748B,原生支持 2M context:
L0 Chat 管对话和指令
L1 Agent 管长程、动态工具任务(并入了Preview的OpenClaw LoRA)
L2 Coding 管代码、SWE、终端
L3 UI/A2UI 管UI4A渲染和操作
至于为什么要拆成好几个 LoRA,他们的想法是:这些能力的思考流程差太远,全塞进一套 post-training 权重会互相干扰。MoL 让相似的技能共用一个 LoRA,差太多的各自单独训,再路由、组合;新增领域就加一个 adapter。
等 adapter 多起来,再让它们分工、组合、投票,就是他们所说的群体智能。
这条路也不是 Mind Lab 首创,John Schulman(OpenAI 联创、Thinking Machines首席科学家)那篇《LoRA without Regret》就是同一个方向。但全球能开万亿参数模型 RL 训练的 infra,目前就 Mind Lab 和 TML 两家。
不过Mind Lab是直接用国内最好的开源模型,最早2025年底在万亿参数Kimi K2上验证过RL后训练,Preview用GLM-5.1、Venti用GLM-5.2、Tall用Qwen-3.7-35b。拿这些现成的强基座来做,比 TML 从头做 Inkling 会更快(Inkling 现在的表现也明显还打不过 GLM 和 Kimi)。
商业化也很快:据团队披露,7 月启动商业化后2周达到 1000 万美元 ARR。
其实我会关注 Macaron-V1,很大一个背景是持续学习这个方向本身。
持续学习想解决的,是模型部署之后就不再进化这个老问题,让它能在真实使用里边用边学。
这方向最近越来越多重量级的人在点名。之前强化学习之父 Sutton 和 David Silver 提出“the era of experience”,说下一代 AI 拼的不再是喂数据,是从真实经历里持续学,他自己也去创业做了 Oak Lab 专攻这个。梁文锋最近四小时闭门会流出来,他给 DeepSeek 排的路线是 CoT → Agent → 持续学习,还说下一代模型不能持续学习,就不配叫下一代。
Macaron-V1 至少证明了这条路能工程化、也能商业化跑通。这种方向靠一两家撑不起来,挺期待接下来更多团队砸进来、多拿几个硬成果。真卷起来,应该会挺有意思。
顯示更多
TickerTrends 的最新数据:Anthropic 的 ARR 已经达到 743 亿美元,确实非常牛逼了。不过,它的增长节奏开始放缓了。
Yipit 在 7 月 10 日给出的估算是 690 亿美元,预计明天更新。Anthropic 官方公布的数字就是之前的 470 亿美元,之后没有再公开确认过新数据。
与此同时,OpenAI 也在加速追赶:年化收入从 5 月的 330 亿美元升至 7 月的 413 亿美元。
Anthropic 依然遥遥领先,但 OpenAI 已经开始提速。
顯示更多
We’re tracking Anthropic ARR at $74.3B as of July 22, with the pace of growth beginning to slow.
Yipit estimated $69B on July 10 and is expected to update tomorrow. Anthropic has not publicly confirmed a figure since its $47B run-rate disclosure.
@jukan05
顯示更多
Claude Code 和 Codex 都有 /goal 命令,很多人默认这俩差不多。刚读了 Charles Azam 的一个实验才发现,同一个命令下,是完全不同的两套系统,实验结果也挺好玩。
实验用的是一道光纤网络设计题,是他 2018 年当学生时做过的。他当年花了一周写 C++ 解它,可以作为一个人肉 baseline。这次他让 Fable 5 和 GPT-5.6 Sol 各跑三组 plain vs /goal 配对,每次 30 分钟,分数越低越好。
不过这个 benchmark 我倒是兴趣不大,我最感兴趣的是两套 /goal 的实现。
Claude Code:独立评审员模式
/goal 实现为 session 级的 Stop hook。主模型每跑完一轮,一个小评估模型(默认 Haiku)读取目标条件和对话记录,回答 yes/no
答 no 就再开一轮,答 yes 就清除目标
关键限制:评估模型不能用工具、不能看文件,只能根据对话记录里出现的证据来判断。它能抓住“提前退出”,但没法知道“再跑一千万次求解器迭代值不值”
优点是裁判独立(不是自己给自己打分),缺点是裁判是瞎的(只看 transcript)
Codex:持久化状态 + 自我声明模式
goal 是持久化的线程状态:TUI 保存目标,SQLite 记录状态和预算
工作模型自己拿到 create_goal / get_goal / update_goal 三个工具。线程空闲但目标还在时,Codex 注入一个“继续干 + 完成度审计”的续跑轮次
关键区别:由工作模型自己声明完成。它看得到文件、也能用工具,但等于自己批改自己的作业
(这里对应的是作者查看的 Codex CLI 0.144.4;Claude Code 没有开源,相关实现来自 Anthropic 官方文档。)
顯示更多
这八卦够狠:Anthropic计划收购Pi
上周末看到的信息,Anthropic计划收购Pi(做机器人的那个),当时不敢确定,就没发。最近又看到一些讨论
周末这瓜的出处是旧金山一个机器人派对。Dimensional 的 open house 上,一个投资人在现场爆料:Anthropic 正在谈收购 Physical Intelligence,deal 还没 close。
最近Anthropic确实有在发机器人相关的研究。前两天写过,Anthropic 最近自己放出来的机器人评测的文章,frontier models 直接控制底层关节。
Google 有 Gemini Robotics,OpenAI 悄悄搭机器人团队一年多,三家里只有 Anthropic 在具身上一点公开动作都没有。所以这个收购还蛮有意思。
还有一层反差:OpenAI 是 Pi 2024 年那轮的早期投资人(同轮还有 Bezos),上一轮 $600M 又是 Alphabet 旗下 CapitalG 领投的。股东里坐着两个竞对,deal 想 close 没那么容易(Gorden_Sun 的判断)
不过 Anthropic 最近本来就在连续买团队:Bun、Vercept(电脑操作)、Stainless(API 基建)。
补充一下背景:
Pi 全名 Physical Intelligence,2024 年成立于旧金山,Karol Hausman(ex-Google Brain)、Sergey Levine(Berkeley)、Chelsea Finn(Stanford)几个人,具身智能里学术含量很高的一批人。只做机器人的大脑不做本体:π0 系列 VLA 模型,也开启了国内一波跟风潮。
去年 11 月估值 5.6B,今年 3 月又传在谈一轮 10 亿美金、估值 11B+ 的融资,到现在没官宣 close
不敢确定这个交易会不会完成,但确实非常震惊
顯示更多
这两天国产大模型是真的神仙打架,作为K3之前SOTA的GLM5.2,最近AI圈都在猜智谱下一代模型什么时候发。但我把最近谱子的几个动态串起来看,发现真正值得聊的,不止是模型本身。
先说这两天市场在传的两步棋
♟️ 第一子|1GW级国产算力中心
昨天各种群里已经有截图小作文转,今天看到彭博社报道,智谱已落地一座1GW级数据中心,而且全部用国产AI芯片。
♟️ 第二子|收购中科加禾(XCore Sigma)
这是中科院计算所出来的团队,做AI底层编译和推理优化的,国内比较顶尖的AI Infra团队
今年国内算力荒,之前GLM5 发布的时候也是很多人排队买coding plan买不到,真正限制智能的,反而不是模型本身了。
所以从GLM-5到GLM-5.2,可以明显感觉到,智谱优化的不只是模型能力,而是整个模型交付能力。
这也是5.2出圈的一个很关键的原因。
所以把这些带到唐老师的猎龙逻辑
- 模型(GLM持续迭代)→ 决定智能上限
- 算力(1GW国产中心)→ 决定scale能力
- Infra(中科加禾)→ 决定工程效率
- Agent + MaaS + 大客户基础→ 决定能不能真正进生产环境
一家Frontier AI公司的核心能力建设,智谱是不是已经基本完成了?
尤其补充了最大的算力短板,是不是可以撸起袖子和海外开干了?拭目以待…
不过我还是更关注智谱下一代的参数量哈哈
ps.gujia盘中直接拉了19%……资本市场永远比我们反应快。
顯示更多
分享一篇Sebastian Raschka 的深度长文,讲 LLM 推理力度(reasoning effort)档位,比如 GPT-5.6 那种 low/medium/high 选项,到底是怎么训练出来的。蛮有意思的
1/ 背景铺垫
- 推理模型不是真像人一样思考,只是会先输出一段中间推理轨迹(reasoning trace)再给答案。
- 主流训练方法是 RLVR(可验证奖励的强化学习):主要用在数学、代码这类结果能自动验证的领域,用“答对=1、答错=0”的奖励信号训练。DeepSeek-R1-Zero 证明了纯 RL 就能让模型学会推理和自我纠错(Aha 时刻)。
- 一个容易误解的点: 标签本身不赋予模型思考能力,纯粹是给 UI 和训练管线用来切分推理过程和最终答案的定界符,靠格式奖励训出来的。
2/ 从推力开关到推理档位
- 第一代是专门的推理模型(如 O1、R1),面对简单问题也经常输出很长的推理。
- 第二代出现了开/关切换(如 Qwen3):训练时混入带推理和不带推理的样本(Thinking Mode Fusion),推理时通过在回复开头预填一个空的 来硬关闭思考。
- 档位(effort level)是这个开关的精细化版本。实现思路有两条,两种方法也可以结合,作者推测 GPT-5.6 和 gpt-oss 可能采用了组合方案:
---RL 阶段做:系统提示写明档位,配合不同的 token 长度惩罚,低档位罚得重,高档位罚得轻(允许长想)。
---SFT 阶段做:给训练 prompt 配上不同推理力度的目标回答,让模型学会“看到档位标签就调整推理长度”。
3/ 两个缩放维度的区分
- 选 Luna/Terra/Sol 不同型号 = 训练算力的缩放(选的是不同规模的模型);
- 调 effort 档位 = 推理算力的缩放(同一个模型,多花点 token)。
4/ 六家开源旗舰的实现对比
- DeepSeek V4:作者按技术报告的总结,是训了三个独立的档位专家(Non-think / Think High / Think Max,各配不同的上下文窗口和长度惩罚),再蒸馏进同一个模型。
- Nemotron 3 Ultra:SFT 时用随机截断的推理轨迹训练,让模型学会“推理被外部掐断后照样给出答案”,支持硬性 token 预算。
- Kimi K2.5:Toggle 方法,RL 时在“限预算”和“不限预算”两个阶段交替,token 用量降了 25–30%,性能几乎不掉。
- GLM-5:重点在多轮和工具调用场景的逐轮开关。
- Qwen3:模式融合 + 推理时截断(截断这个能力是训完自己涌现出来的,没专门训过)。
- Inkling:最特别,用 0–1 的连续effort 值而不是离散档位,RL 时按该值调整每 token 成本。
作者认为短期内 effort 仍会是显式输入,终极目标是自动选档(像 GPT-5 的 Auto 模式,但那次做得不成功被下架了),未来更可能由 agent 框架或路由器根据任务状态自动推断档位,同时保留用户手动覆盖的能力。
顯示更多
How can an LLM switch between low-, medium-, and high-effort reasoning? And how does an LLM learn to reason more or less?
I put together a “little” article explaining how these effort levels are implemented at inference time and during training.
顯示更多