註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Max For AI
@MaxForAI
Head of hype @lobehub Prev @listenhub @Sapient_Int 没啥好看的,也就发点AI相关的内容🫡 同名小红书4万粉丝,公众号01Founder(长文首发) 观点仅代表个人 更多请访问网站⬇️(欢迎商务、合作
加入 September 2023
3K 正在關注    40.3K 粉絲
牛逼,小米这次直接把大模型的强化学习训练过程直播出来了。 沉默了近半年后,罗福莉公布了 MiMo-V2.6 的最新进展:模型目前还在 RL 训练中。 而过去半年,小米 MiMo 团队基本都在研究同一个问题:强化学习到底还能扩多大。 这次他们主要把三件事往上硬拉了一截: 第一是算力规模。MiMo-V2.6 一次 RL step 大约处理 20 亿 Token,1568 条 Prompt,每条同时跑 16 个 rollout,而且整个过程是全异步的。 第二个更值得注意的是 Harness。 他们不再只让模型在单一任务、单一环境里强化,而是把多个 Agent 任务、多个环境、甚至多套 Harness 混在同一次 RL Run 里训练。 第三个是 Grader。 模型跑完任务之后,怎么判断哪一步做得好、奖励应该给谁,本身也开始消耗越来越多计算。MiMo-V2.6 引入了 Agent 组内信用分配,同时结合测试用例和 Rubric 给奖励。 换句话说,现在扩展的已经不只是模型训练算力了。 RL 正在从一个算法问题,变成一整套 Agent 系统工程:模型、环境、Harness、Verifier/Grader 一起扩。 这其实也是最近 Agent 模型越来越明显的一条路线。 以前大家卷 Pretrain 的 Token 数量,后来卷 Post-training 数据和 RL。 现在大家比得是你能不能同时造出足够多、足够复杂、还能自动判断对错的环境,让模型自己在里面干活、犯错、拿奖励,然后继续变强。 小米这次没有等模型练完再发技术报告,而是直接把 MiMo-V2.6 的 RL Run 做成了公开 Dashboard,训练过程还在继续跑。 罗福莉表示,接下来几周会把里面的技术细节陆续开源。 某种意义上,大模型训练终于也开始有点像“直播炼丹”了。 牛啊!
顯示更多
Nearly half a year of silence. We spent it studying one problem: how far RL can scale. MiMo-V2.6 is in the middle of its RL run right now. Three things we scaled: compute (~2B tokens per step, 1568 prompts × 16 rollouts, fully async), environments and harnesses (multi-task agentic RL, mixed across multiple harnesses in one run), and grader compute (agentic in-group credit assignment, with test-case and rubric-based rewards). We'll open-source the details piece by piece over the coming weeks. Streaming the run:
顯示更多