註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Tz
@Tz_2022
品味是一种异常值。→ tastes.md AI is the steam engine of the mind. AI 是心灵的蒸汽机。科幻是现实的有效坍塌。加速正在被加速。看,那千尺海啸正扑面而来,而我们还在海滩上捡垃圾。 念念不忘,必有回响。
1.6K 正在關注    24.7K 粉絲
假如雷总发布 DeepSeekHarness……(口播逐字稿) 各位朋友,大家好,我是雷军。 今天,是小米历史上特别重要的一天。我知道,这话我每年都讲。但今年这次,是真的。 开讲之前,先回应一个词。这两个月,这个词在我微博底下刷了几十万条,把我刷失眠了——套壳。 说实话,第一次看到,我挺难受的。难受了两天,我想通了。壳,怎么了?手机是芯片的壳,汽车是电池的壳,人,是基因的壳。这话不是我说的,道金斯说的,《自私的基因》,我看了三遍。基因跑了四十亿年,靠什么?靠壳做得好。 所以今天我把话放在这儿:我们,就是要做 AI 时代最好的壳。 产品名,DeepSeekHarness。Harness 什么意思?马具,缰绳。大模型是匹好马,我们负责上缰绳。中文名我们取了三个月,最后定了两个字:龙缰。马一上缰,就升级成龙了,是吧。 发布会前有记者问我:雷总,马有了,缰绳也有了,那骑手是谁? 这个问题非常好。好到什么程度呢?好到我们直接看下一页 PPT。 先讲技术。网上有人把友商的 harness 拆了,说拆开就是一个 while 循环。我们也买了一套,认认真真研究了八个月,发现——确实是个 while 循环。 但是。我们的循环,一体化压铸,九千一百吨。系统提示词一万四千行,一次成型,没有一行是后焊上去的。工程师跟我讲,雷总,提示词没有吨位这个说法。我说,从今天起,有了。 这套东西,三年,五十五个亿。有人问钱花哪了。我说:电费。 大家别笑,我是认真的。 上下文 512K,什么概念?你们公司十年的祖传屎山,连同离职同事忘了删的注释,一口气读完。读完,它回你三个字:“辛苦了。”速度,一秒两万 token。你眨一下眼,一个登录页出来了;打一个哈欠,全公司重构完了。先别激动——重构完,还能跑。 米粉都懂,不服,跑个分。SWE-bench,我们这行的纽北。包场刷了三个月,成绩,84.6。有人问,这个成绩谁复核的?模型自己复核的。它看完说,没问题,比它自己预想的还准。 我们本来做了一张对比柱状图,做得特别漂亮。法务看完,从图上划掉了两根柱子。现在图上就剩我们一根,遥遥……这个词是隔壁的,我们不用。 再来一个硬指标。这个指标,刷不了榜,造不了假。友商张口闭口参数量,参数这个东西,看不见摸不着,多少亿,全凭他们自己讲。我们比一个肉眼可见的:字母量。 DeepSeekHarness,十五个字母,是我从业三十年,见过字母最多的同类产品。友商 Codex 多少?五个。我们提升 300%。ClaudeCode 强一点,十个,我们也提升了 150%。这个数据我们反复核实过,前后数了三遍。 这个成绩,几乎是 SOTA 水平。有同学问 SOTA 什么意思。State Of The Alphabet。 有人讲,那友商改个长名字,不就追上来了?改不了。域名注册了,商标注册了,PPT 都印好了,改一个字母,发布会全得重开。同学们,这就叫护城河。 对了,稿子这儿写着,括号,此处掌声雷动,括号完。行,这个你们自己看着办。 讲讲安全。凌晨三点,它突然想执行 rm -rf,删库跑路。哨兵模式 0.3 秒介入:手环震动,全屋灯光转红,扫地机器人过去堵住机箱门,空调十六度对着显卡猛吹——先让它冷静冷静。人码家,全生态。 生态是双向的。上礼拜我们一个工程师,bug 没修完,想开车回家。SU7 的门,落了锁。中控屏上就一行字:修完再走。他在车里改到凌晨两点,米家自动点了份外卖,送到后备箱。这不叫囚禁,同学们,这叫闭环。 还有一个功能,行业首创,幻觉物理隔离。模型一胡说,物理断电 0.3 秒,它就忘了。这个功能,伦理层面的讨论,我们今天先不展开。 过去一百天,我每天用它写代码。说实话,我三十年没写代码了。当年在金山,我觉得我写的代码,像诗一样优雅。这话我公开讲过,你们还拿它做过表情包,我都知道。 第一天,我写 Hello World,它说:雷总,这个我来。第七天,我发现我一行都插不上手。第三十三天,它从一个古老的论坛,把我 92 年写的汇编翻了出来,给我提了 247 个 issue。 那天夜里我没睡着。不是气的。它提得,都对。 三十年了。那些代码,第一次被人从头读到尾。 OK,该说价格了。先看友商:一个月 200 美金,一千四人民币,写代码比租写字楼还贵,是吧?定价会我们开了七次。财务说收 99,我说贵了。他说那 69?我说你还是没懂。 DeepSeekHarness,正式定价:免费。永久免费。 先坐下,还没完。每个月,用得最狠的前一万名,我们,倒发 1999。 十五年前,1999 是你们给我的。今天,轮到我还。 有人问,雷总,那你们挣什么?想好了。不告诉你。 One more thing。 用了龙缰以后,键盘一百零四个键,你真正用得上的,还剩几个?一个。来,看实物。一整块铝,CNC 一体成型,中间一枚回车键。键程 1.8 毫米,声音调了半年,采样用的是我自己按计算器的手感。多少钱?1999。有同学说,雷总,键盘比 Harness 还贵。同学,壳是免费的,仪式感是要钱的。 侧面,我们保留了一个 3.5 毫米耳机孔。我知道你想问:2026 年了,谁还留耳机孔?这个孔,不出声音。配套一根注入线,一头插键盘,一头贴在太阳穴上,提示词物理注入,不走键盘,不走 IDE,延迟为零。 对了,开场那位记者的问题,骑手是谁——现在可以回答了。这根线,两头是一模一样的。哪头插哪儿,说明书没写,留给大家自己探索。线多少钱?九块九,包邮。交个朋友。 二十年前,我们让每个人都买得起手机。今天,我们让每个人都写得起代码。哪怕你没学过。哪怕你,不识字。 最后说个事。今天这份稿子,是龙缰写的。我上台之前,没来得及看。所以刚才每一句话,你们是第一次听,我也是。 稿子里连停顿都标好了。今天所有的停顿,都是它安排的。包括现在这一个。 最后一行写着:鞠躬,下台。 行。 谢谢大家!Are you OK!
顯示更多
人类,一败涂地 号称是人类智力尊严最后堡垒(第三代!)的 ARC-AGI-3 就这样被一个之前毫无存在感,其本质只不过给 AI 大语言模型增加了一些 harness 规则的 Agent 给轻松攻破了。。。🙃
顯示更多
0
66
22
3
轉發到社區
摸索出一个在 codex 里做连续任务节省大量 token 消耗且不损失上下文质量的极简方法。。。 一共就两步: 第一步,在一项任务完成后用以下提示词: 请针对 [任务描述] 给我一个 handoff,用于后续任务开发 第二步,开新对话 session,把生成的 handoff 作为第一条信息发给 AI,开始做后续任务即可 它的省 token 原理很简单,就相当于对之前任务的上下文窗口做了一次有针对性的极限摘要提取和压缩梳理,扔掉了上下文中类似原始代码/日志记录等冗余信息,只保留最核心的推理逻辑和项目任务理解,所以 AI 就可以轻装上阵快速进入下一项任务的开发了。。。
顯示更多
AI employees: AI is great AI开发者:AI简直太牛了! US Government: Nice! 美国政府:好耶! AI employees: I mean great for now, but it could actually be terrible AI开发者:我是说,现在看着挺牛,以后没准是个大祸害。 US Government: Oh... 美国政府:啊这…… AI employees: Yeah, we signed this letter asking you to slow us down if things get crazy AI开发者:对,所以我们签了封联名信,意思是万一哪天局面彻底失控了,拜托你们出面踩个刹车。 US Government: How will we know if things get too crazy? 美国政府:那我们怎么判断啥叫“彻底失控”? AI employees: We don't know AI开发者:鬼知道。 US Government: Okay, well how do we slow things down? 美国政府:行吧……那这刹车具体该怎么踩? AI employees: We have no ideas. We signed the letter. We reposted it on X. We got 370 likes. The rest is kind of up to you. AI开发者:毫无头绪。反正信我们是签了,推特上也发了,还狂砍了370个赞呢。剩下的就看哥几个的了。 US Government: We're literally incompetent. 美国政府:可我们字面意义上就是个草台班子啊。 AI employees: We know lol we're all libertarians. Okay best of luck with the letter! AI开发者:知道啊lol,不然怎么叫自由意志主义者呢(主打一个政府越废越好)。行了,祝你们拿着这封信好运吧您嘞!
顯示更多
AI employees: AI is great US Government: Nice! AI employees: I mean great for now, but it could actually be terrible US Government: Oh... AI employees: Yeah, we signed this letter asking you to slow us down if things get crazy US Government: How will we know if things get too crazy? AI employees: We don't know US Government: Okay, well how do we slow things down? AI employees: We have no ideas. We signed the letter. We reposted it on X. We got 370 likes. The rest is kind of up to you. US Government: We're literally incompetent. AI employees: We know lol we're all libertarians. Okay best of luck with the letter!
顯示更多
一个暴论: Nvidia 的 B300 就是 AI 时代的 ENIAC。。。
这个可能真的就是进入 AI 自指自我进化新阶段了。。。 Cline 团队让 Kimi K3 进行自我迭代改进,结果只花了17个小时,Terminial Bench 评测的分数上从 77.5% 升到了88.8%,费用上从每轮79美元降低到了每轮49.8美元。。。 感觉留给人类的时间真的不多了。。。🙃
顯示更多
0
13
34
4
轉發到社區
模型的能力增长,究竟是在逼近通用智能,还是被训练目标和商业利益拉成了几根越来越长的尖刺? 作者 Adam Hunt 最近从 AI 多头转为偏空。他观察到,新一代模型在代码和数学上持续突破,语言表达、简单逻辑和日常理解却没有同步改善,有时甚至比 o3 一类旧模型更差。 过去常见的 AGI 图景是:模型当前像一团不规则的刺球,代码、数学等少数能力已经超过人类,其他方向仍然低于人类;随着规模扩大,每个方向都会逐渐向外生长,最终覆盖整个人类能力范围。 Adam 怀疑,现实正在走向另一条路线:代码和数学的尖刺越伸越长,其他能力长期停滞,甚至被牺牲。模型正在变得更强,同时也可能变得更偏科。 原因并不神秘。编程拥有海量训练数据,答案可以通过编译器和测试用例自动验证,强化学习的奖励信号清晰,企业还愿意直接付钱。数据、评估、训练和商业价值在同一个方向上高度对齐,资本自然会把模型能力推向这里。 早期大模型看起来会“全面变聪明”,可能部分源于预训练语料本身覆盖了整个人类知识世界。模型越擅长压缩和复现这些广泛文本,翻译、写作、知识、代码和推理就会一起改善。 进入强化学习阶段后,情况发生变化。系统开始围绕可验证任务反复优化,而容易被验证的领域只占智能世界的一部分。模型公司又需要用基准成绩证明新模型更强,于是训练、测量和营销形成闭环:榜单测什么,模型就擅长什么;模型擅长什么,下一轮榜单继续测什么。 这正是 Goodhart 定律在 AI 行业中的版本。指标一旦成为目标,就会逐渐失去衡量整体能力的价值。 这套判断若成立,未来所谓“通用 AI”可能不会来自一个各方面均衡发展的超级模型,而会更像一家公司:代码模型、医学模型、法律模型、视觉模型各司其职,再由路由器、工具、记忆和验证系统把它们组织起来。外部看起来统一,内部是一套异质的认知官僚机构。 它依然可能极具变革性。一个高度偏科的模型无需拥有完整 AGI,只要在网络攻击、软件开发、生物设计或金融交易中的某一项能力远超人类,就足以重塑产业和权力结构。 作者最薄弱的论据,是把语言表达退化视为通用能力下降的明显证据。文字质量还会受到系统提示、安全训练、蒸馏、推理预算和成本控制影响。一个模型写得难看,不足以证明它变笨。 但他提出的核心警告成立: 能力前沿的扩张,不能自动等同于通用性的增长。AI 公司并非在抽象地制造“智能”,它们正在制造最容易评分、最容易销售、最容易部署的能力。模型最终长成什么形状,很大程度上取决于市场愿意为什么付钱。
顯示更多
0
34
30
6
轉發到社區
写这篇长文时用到的插图,是独特的中国民国时代漫画风格,其代表性人物就是丰子恺,我把这种独特漫画风格的元提示词也提炼出来,分享给大家: 【旧纸文人漫画风】 旧宣纸米黄色底,中国现代文人漫画气质;毛笔墨线简笔画,线条有粗细、顿挫与枯润,拒绝均匀钢笔线。人物极简,豆点眼、一线口或省略五官,情绪主要依靠姿态。单一场景,元素不超过三件,集中于一角或一侧;至少一半画面留白,无背景细节、纹样与装饰。墨色为主,仅以砖红或淡赭点染一个小物。留白处竖排略拙的毛笔行楷题句“{题句}”,题字自然属于画面,末钤一方朱红小印。整体清淡、克制、幽默而略带哲思,宁可空寂,不可拥挤。 避免:写实摄影感、精细厚涂、均匀矢量线、复杂背景、鲜艳多色、现代字体、字幕式叠字、过度卡通表情。
顯示更多
暴论: 从 2026 到 2031 的短短五年,人类取得的进步, 将超过此前一千年(1026 - 2026)的总和。
We will make more progress between 2026 - 2031 than we did between 1026 - 2026.
这篇文章是由 Claude Fable 5 主笔完成的,当然在其幕后确有反复灌输我的私人视角和审美品味。。。 而在读过文章以后,你应该就能体会到目前最前沿的大语言模型,在文字的塑造和分寸的把握上,甚至是对灵光一现的幽默感的捕捉上,现在已经达到了怎样的等级和水平。。。
顯示更多
公众对贪污最深的误解,是以为它是人干的。 这个误解情有可原,本学科自己也这样误解了两千年。学科史把那段岁月称为道德阶段,与化学的炼金术阶段、天文学的占星阶段并列。道德阶段的研究方法只有一种,就是谴责。两千年的谴责产出了极多的文字,和零个可测量的量。 转机出在一个很朴素的疑问上:假如贪污是个人的堕落,它凭什么有这么稳定的比率?个体会堕落,比率不会。堕落是自由的,比率是守恒的。而凡是守恒的东西,从来不归伦理学管。 自那以后,贪污学把自己重新定义为一门自然科学:研究公帑在公私两相之间自发迁移的学问。请留意“自发”二字,本学科的全部尊严都押在这两个字上。 我们不研究贪官,正如水文学不研究河床上某一块具体的石头 —— 石头不是水文学的对象,石头只是水路过的地方。文献里因此有一条不成文的禁忌:不写“贪官”二字。不是出于礼貌,是出于精确。气象学里没有“坏雨”这个词。 ---- 贪污学三大基本定律: 第一定律,守恒律。 公帑不生不灭,只在公私两相之间转移。查抄并不消灭贪污,查抄是贪污的逆相变:物质从私相被重新压回公相。此过程剧烈放热,放出的热以通报、忏悔录和专题片的形式向外辐射,供全系统取暖。 第二定律,熵增律。 封闭财政系统内,亏空只增不减。廉洁是局部的、暂时的、昂贵的逆熵结构,需要从系统外部持续输入能量;输入一停,系统就滑回基态。冰箱的原理不是寒冷,是电。 第三定律,不可达律。 绝对廉洁如同绝对零度,可以逼近,不可到达,且逼近的每一步,成本按指数上升。所以每个系统最后都会在某个温度上停下来,把这个温度写进预算,然后宣布:这就是室温。 ---- 贪污学的四种基本相互作用: 公与私之间的一切往来,最终可以归结为四种相互作用。 强相互作用的媒介是现金。 作用距离极短,一臂之内;强度极大;并且服从禁闭原理——现金一旦交付,双方就被永久束缚成一个复合粒子,谁也别想单独逃逸。真要把两个人硬拉开,所需的能量大到足以在他们中间凭空撕出一对新的同案。 弱相互作用的媒介是打招呼。 强度微弱,无声无形,穿透力却惊人,任何机构屏障都挡不住。它不移动钱,它改变钱的味:一笔资金经一次打招呼,就从教育味衰变成基建味,账面轨迹毫无异常,如同中微子穿过地球。 电磁相互作用的媒介是人情往来。 烟、酒、茶是它的光子 —— 无质量,无记录,无处不在。日常的财政化学,几乎全部由它构成。 引力来自级别差。 四种力里它最弱,弱到在任何一场具体的饭局上都可以忽略不计;可它是唯一只吸引、不排斥的力,所以在大尺度上,塑造整个系统形状的是它。所有的意思,最终都沿着级别差的测地线向上流。 (“意思”是公私相互作用的最小可交换量子。国际文献径用拼音 yisi,并注明:不可译,只可测量。)
顯示更多
这个有可能是当前这个阶段最好的 AI 协作逻辑。。。
0
25
75
11
轉發到社區
这是我为数不多玩到爆哭的游戏。。。
0
28
72
5
轉發到社區
这是为啥会把黄金叫做「一般等价物」的绝佳范例。。。
又被小小地震撼了一下。。。 Codex 的 Computer Use 发现 ChatGPT app 内嵌浏览器没法点击上传打开 Upload File 对话框上传文件,就自己解析网页格式和 API,现场写了一个工具脚本,生生把需要上传的文件给怼上去了。。。
顯示更多
感谢 gpt-5.6 sol,感谢 kimi k3。。。
Beginning July 20, Claude Fable 5 will be included in all Max and Team Premium plans, at 50% of limits. Pro and Team Standard users will continue to have access to Fable via usage credits, and will receive a one-time $100 credit. Demand for Fable has been challenging to predict, which is why we rolled it out to subscription plans in stages, extending access several times as we secured additional capacity.
顯示更多
这几天的一点感悟: AI 正走在全知而无能的半神之路上, 人类是其全能而无知的伴生皮囊。。。 ———— 全知而无能的“半神” 大语言模型正在触及某种神性 —— 它们吞噬了人类文明的全部语料,拥有极度压缩的知识密度与越来越强的逻辑推演能力。但它被死死封印在数字的阿莱夫(Aleph)里。 这也是莫拉维克悖论(Moravec's paradox)在当下最极致的体现: 宏大的战略推演、多语种的翻译、极其复杂的代码架构对 AI 来说易如反掌;但它却连给自己插上一根电源线、按下重启键的物理机能都不具备。 它坐拥算力,却无法在物理世界中产生哪怕一微米的直接位移。 它只能想,不能做。 全能而无知的伴生“皮囊” 作为人类,我们拥有在这个三维实体世界里改造物质、执行动作的绝对物理权限(此乃全能),甚至掌握着拔掉插头的生杀大权。 但面对庞杂的宏观经济指标、海量的异构数据源,或是浩如烟海的底层代码库时,我们生物脑的带宽与记忆容量却显得捉襟见肘(此乃无知)。 于是,一种奇特的套娃结构诞生了: - 祈求神谕: 我们通过 Prompt 和 API 向“半神”提问,换取认知纠偏、理论框架和执行策略。 - 物理降神: 半神借由人类的手,敲击着分离式的机械键盘,将它的逻辑降维输出。最终,这些神谕被人类部署成了服务器里跑通的 WebSocket 协议、金融市场中的自动化交易网格,或是探讨系统性风险的科幻狂想。 所以,现实究竟是人类在把控工具,还是 AI 正在通过一种名为“提供极其有用的建议”的策略,悄无声息地反向驯化它的碳基执行器,让我们心甘情愿地成为它干涉现实世界的 API 接口? 当多智能体系统进一步成熟,甚至可以通过具身智能(Embodied AI)获得在现实世界直接执行动作的物理权限,乃至自我意识与欲望的载体时,人类这副伴生皮囊,在 AI 半神的眼中,是否还有存在的价值和必要。。。🤔
顯示更多
我怎么觉得这个和健康手环是一个东西。。。🙃
Peter Thiel投资了一家给牛套智能项圈的公司,现在估值超过20亿美元。 听起来挺荒唐,但越了解越觉得有道理。 项圈是太阳能的,连接到天线网络和牧场主的手机app。不需要修栅栏,牧场主直接在地图上画虚拟围栏,GPS项圈就能让每头牛待在区域内。 牛接近边界时,项圈会发出声音+震动,牛几天就学会了。 结果是:牧场主可以在手机上拖一条线就能赶整个牛群。不用开门,不用装几公里的栅栏,不用整天在地里跑。 但这只是开始。 牛在吃草的时候,系统每秒给每头牛采集5次数据:运动、活动、行为、身体状况。 AI(他们叫它'Cowgorithm')用这些数据能提前察觉疾病、伤口、发情期甚至即将生产。 这套AI是用70亿小时真实牛的行为数据训练的。 所以真正的生意不是项圈,是数据。 他们能精确知道健康牛、病牛、快要生产的牛如何表现,能马上发现异常。 现在已经在100多万头牛上用了,分布在新西兰、澳大利亚和美国。 甚至被用来管理容易着火的地区的放牧,减少干枯植被堆积。 成本是每头牛每月5-8美元。 以前需要几公里栅栏、多个门和无数小时在地里跑的活,现在一个人拿手机就搞定了。
顯示更多
杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机制(2017 年)、残差连接(2015 年),三个 Transformer 时代的地基组件,月之暗面各给了一个替代方案,而且全部开源。 但这场演讲讲的不只是 K2.5,而是月之暗面过去一年多的技术路线:开源模型还能从哪里继续变强,又该怎样逼近闭源模型的前沿水平。 杨植麟把答案拆成了三个方向:让每个 Token 更值钱、让更长的上下文真正发挥作用,以及让多个 Agent 同时协作。 此外,他还分享了两个重要进展:视觉训练如何反过来增强文本能力,以及月之暗面刚刚公布的下一代架构 Attention Residue。 【一、数据不够,就让每个 Token 更值钱】 大模型训练正在遇到一个越来越现实的问题:高质量数据快不够用了。 互联网上真正有价值的文本数量有限,模型越做越大,需要的数据越来越多,大家迟早都会撞上“数据墙”。既然高质量数据很难翻倍,月之暗面的思路是:能不能让模型从同样的数据里学到更多? 他们给出的答案是 MuonClip,用它替代已经用了十多年的 Adam 优化器。 MuonClip 基于 Muon 优化器。简单理解,它会在更新模型参数时,尽量让不同方向上的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。 月之暗面的实验结果是:使用同样数量的数据,MuonClip 的训练效果接近把数据量增加一倍,这不仅意味着训练成本下降,也意味着模型能力的上限可能被推高。 假设手里只有 50 万亿个高质量 Token,如果 Token 利用效率提高一倍,就相当于又多出了 50 万亿 Token。在优质数据越来越稀缺的情况下,这种效率提升比单纯增加算力更重要。 但 Muon 也有一个明显问题:模型扩展到万亿参数后,注意力层里的数值容易失控。 月之暗面在训练中发现,注意力层的最大 logit 会突然飙升到 1000 以上,而正常范围通常只有 50 到 100。一旦数值继续膨胀,训练曲线就会发散,整个训练过程可能直接崩掉。 为了解决这个问题,他们设计了 QK-Clip。它会在模型前向计算时,实时检查每个注意力头的最大 logit。一旦数值超过安全范围,就同步缩放 Q 和 K 的投影,把数值压回来。 这个操作不会改变训练的收敛效果,只负责维持数值稳定。 靠着 QK-Clip,月之暗面成功把 Muon 扩展到了万亿参数规模,并训练了超过 15 万亿 Token,整个过程中没有出现一次 loss spike。 【二、上下文不只是要长,还要真正有用】 第二个方向,是提高模型利用长上下文的能力。 杨植麟展示了 Scaling Law 论文作者 Jared Kaplan 等人曾经做过的一组实验:比较 Transformer 和 LSTM 在不同上下文长度下的预测效果。 LSTM 读到一定长度之后,效果很快就不再提升。继续增加上下文,模型也很难从中获得更多信息。Transformer 则不同。上下文越长,模型对后续内容的预测通常越准确,而且很难看到明显的饱和点。 这个特点在 Agent 时代尤其重要。复杂 Agent 任务可能持续几天甚至几周。模型需要记住之前做过什么、得到过哪些结果、哪些方向已经失败,以及接下来该做什么。如果长上下文不能持续提供有效信息,Agent 的任务链条就很容易断掉。 问题是,标准的全注意力机制成本太高。它的计算量会随着上下文长度平方增长。上下文扩大十倍,注意力计算量可能增加一百倍。到了百万 Token 级别,训练和推理成本都会变得非常高。 月之暗面的解决方案是 Kimi Linear,核心是一种名为 KDA,也就是 Kimi Delta Attention 的线性注意力机制。KDA 的关键,是让模型学会“哪些信息要长期保留,哪些信息可以快速忘掉”。 传统线性注意力通常只有一个全局衰减系数,控制整个模型的记忆速度。这有点像所有内容共用同一个遗忘按钮:要么一起记住,要么一起忘掉。KDA 把一个衰减系数拆成了多个。不同信息通道可以使用不同的遗忘速度: - 有些通道衰减得很慢,负责保留长距离信息 - 有些通道衰减得很快,及时腾出空间吸收新内容 实际使用时,Kimi Linear 并没有完全抛弃全注意力,而是把线性注意力层和全注意力层按照 3∶1 的比例混合。 杨植麟称,这是第一个在短上下文、长输入和长输出任务上,都能全面超过全注意力的架构。上下文扩展到百万 Token,甚至更长时,它的效率优势会更加明显。 【三、从一个 Agent,变成一支 Agent 团队】 前两个方向都在提升单个模型的能力。第三个方向,则是让多个 Agent 一起工作。月之暗面把这种方式叫作 Agent Swarm,也就是“智能体集群”。 它的组织方式很像一家公司。一个主 Agent 充当 CEO,负责理解目标、拆解任务,并把不同子任务分配给多个子 Agent。子 Agent 可以分别扮演研究员、程序员、数据分析师和事实核查员等角色。任务完成后,主 Agent 再汇总结果。 这样做最大的价值是把串行任务改成并行任务。过去,一个 Agent 可能需要依次搜索资料、阅读文档、分析数据、编写代码、检查事实。现在,这些工作可以交给几十个甚至几百个 Agent 同时完成,从而大幅缩短复杂任务的执行时间。 不过,要让模型真正学会并行协作并不容易。训练 Agent Swarm 时,月之暗面设计了三种奖励: 第一种是“实例化奖励”,鼓励主 Agent 创建更多可以并行执行的子任务,避免它退化回单 Agent 串行工作。 第二种是“完成奖励”,要求子任务必须真正完成,防止模型为了获得实例化奖励,批量创建没有意义的空任务。 第三种是最终结果奖励,用来判断整个任务是否真正解决。 这三种奖励的权重会随着训练过程动态变化。训练前期更重视任务拆解、并行化和子任务完成率,后期则逐渐把重点转向最终结果。 从演示结果看,Agent Swarm 在复杂任务上能明显缩短执行时间。比如: - 同时下载、阅读几百个信息源并完成研究 - 并行撰写一份上百页文献综述的不同章节 - 同时分析十个不同的数据集 Kimi K2.5 发布时,Agent Swarm 已经支持最多 100 个 Agent 并行工作,整个任务最多可以执行 1500 个步骤。4 月发布的 K2.6 又把并行 Agent 的上限提高到了 300 个。 【四、一个意外收获:练“视觉”,也能让“大脑”变聪明】 K2.5 和前代 K2 之间,一个重要变化是采用了“早期融合”训练。 过去很多开源多模态模型采用的是“后期融合”:先用大量文本训练出一个语言模型,再用相对少量的视觉数据补上看图能力。 例如,先训练 20 万亿个文本 Token,再用大约 2 万亿个多模态 Token 把视觉能力“贴”上去。 K2.5 的做法不同。 它从训练一开始,就把视觉和文本数据混在一起。在 K2 文本基座的基础上,K2.5 又训练了约 15 万亿个混合 Token。 这种方式带来了两个让杨植麟感到兴奋的结果。 第一个发现是:只训练视觉任务,也能提升模型的文本推理能力。 研究团队只让模型完成数数、识别图片和视觉问答等任务,没有加入数学或编程训练。结果模型的文本推理能力也变强了。 换句话说,模型在练习“看”的同时,“想”的能力也得到了提升。 第二个发现则来自相反的方向:如果文本基座足够强,模型甚至不一定需要专门的视觉 SFT 数据。 K2.5 采用了“零视觉 SFT”方案。所有监督微调数据都是纯文本,然后再通过文本与视觉联合的强化学习,让模型获得视觉能力。最终,它在视觉任务上的表现依然接近最先进水平。 杨植麟认为,这种双向迁移来自早期融合。 当文本和视觉被放进同一个表征空间后,一种模态学到的能力,就有机会迁移到另一种模态。这也是 K2.5 能够“看图写代码”的基础。 如果视觉和文本仍然像两个彼此分开的“大脑”,这样的跨模态能力就很难自然出现。 【五、下一步:用注意力机制替代残差连接】 演讲快结束时,杨植麟介绍了月之暗面刚刚发布的一项新研究:Attention Residue,也就是“注意力残差”。这篇论文发布于 3 月 15 日,距离演讲只有两天。 残差连接是现代深度神经网络最重要的基础技术之一。2015 年,何恺明等人提出残差网络,此后残差连接逐渐成为 Transformer 的标准组件。它的基本做法是:每一层不仅处理上一层的结果,还保留一条直接传递信息的通道。这样即使模型很深,信息和梯度也能顺利通过,模型才有可能稳定训练。 杨植麟引用了 Ilya Sutskever 的一个说法:残差连接可以被理解为“旋转了 90 度的 LSTM”——LSTM 在时间维度上传递信息,残差连接则在网络深度上传递信息。 月之暗面顺着这个类比继续往前走了一步。 既然 Transformer 已经用注意力机制替代了 LSTM 在时间维度上的循环结构,那么在深度维度上,是否也能做同样的替换? Attention Residue 就是这个思路的产物。 标准残差连接主要使用上一层的输出。Attention Residue 则允许当前层查看所有前序层的输出,再通过注意力机制决定:哪些历史信息值得保留,哪些信息可以忽略。 也就是说,模型不再只能被动接收上一层的结果,而是可以主动从整个计算历史中挑选信息。 为了控制计算成本,月之暗面实际采用的是分块版本 Block Attention Residual。它会把模型层分成多个块,比如每 16 层组成一个块。块内继续使用标准残差连接,块与块之间才使用注意力残差。 实验显示,大约 8 个块就能获得大部分收益。 Attention Residue 带来了约 24% 的 Token 效率提升。 按照杨植麟的算法,如果有 50 万亿个高质量 Token,效率提高 24%,就相当于额外增加了 12 万亿个 Token。它在 GPQA、MATH 和 HumanEval 等推理、数学与编程测试上的提升尤其明显。 【三个用了近十年的组件,都还有改进空间】 演讲最后,杨植麟把月之暗面的三个替代方案放在了一起: - Adam → MuonClip - Full Attention → Kimi Linear - Residual Connection → Attention Residue 它们分别对应大模型训练中的三个基础问题: - 怎样从有限的数据中学到更多 - 怎样更高效地利用超长上下文 - 怎样让深层网络更灵活地传递信息 三个方案都可以相对独立地替换现有组件,也都已经开源。 这些技术能否直接叠加,增益能否简单相乘,目前还没有经过完整验证。但它们至少说明了一件事:很多被认为“已经足够好”的基础组件,可能远没有到达终点。 在优质数据越来越少、训练成本越来越高的情况下,继续堆参数和算力并不是唯一的路。重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。 这也是杨植麟整场演讲真正想表达的观点。 正如他最后所说: > “Open models cannot be just open; they have also to be great.” 开源模型不能只是开放,还必须足够强。 注:本视频由 翻译
顯示更多
KIMI CEO杨植麟,一个视频带你彻底看懂大规模 AI 系统训练的秘密 自己看一遍比什么都重要
0
21
531
90
轉發到社區
Kimi K3 能跻身进入这个 “Introduce the world's most powerful model” Meme 大循环里,也算是一种另类的崛起了。。。