The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司 Arcee AI 的预训练负责人 Varun Singh。标题有点唬人,但这哥们的观点非常扎实。
他认为,过去 Base Model 的任务,是尽可能吸收人类已有的知识。
GPT-3 那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。
在 GPT-3 的训练数据里,来自网页和 Wikipedia 的数据大概占到了 85%。
那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。
后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL 在当时的作用也比较有限。
但是 O1 之后,整个行业都发现了 RL 的重要性。
大家开始发现,只要 RL 做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。
我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。
这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。
Base Model 的角色也因此发生了变化。它越来越像是在给后面的 RL 准备一些原子能力,也就是 Atomic Skills。
举个例子,如果希望通过 RL 训练出一个非常强的 Coding Agent,那 Base Model 在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。
但它最好已经掌握了 Python、代码结构、API、函数调用、Git、文件系统这些基础能力。
这些就是 Atomic Skills。
进入更复杂的任务和环境之后,再通过 RL 学习怎么把这些基础能力组合起来,这样就可以涌现出复杂 Agent 任务的能力。
所以,如果 Base Model 的目标变了,预训练的数据自然也会变。
前面说过,GPT-3 时代网页文本占了训练数据的 85%。而现在一些新模型里,这个比例已经降到了 15% 左右,代码反而成了占比最大的数据来源。
背后的逻辑其实很好理解。
现在模型公司已经非常清楚模型需要的关键能力,诸如 Coding、长程任务等等,那在预训练阶段,就可以有意识地提前给它准备这些能力需要的数据。
所以训练数据开始越来越有目的性。一些过去主要在后训练阶段才会出现的问答、对话,以及更接近 Agent 任务的数据,也开始提前进入预训练。
这种训练逻辑下,合成数据的重要性也开始上升。因为当大家越来越清楚模型未来需要什么能力,然后就可以围绕这些能力,主动去准备更合适的训练数据。
比如我们已经知道,未来模型需要很强的 Coding、Reasoning 和 Agent 能力,那就可以围绕这些目标,主动生成更接近真实任务的数据。
原来只是一段代码,现在可以把它变成找 Bug、修改代码、调用工具、连续完成任务的训练样本。
这样模型在预训练阶段接触到的,就不只是知识本身,也开始包含未来真正要用到的能力。
模型未来需要什么能力,预训练阶段就可以围绕这些能力去设计和生成数据。
这些变化,也催生了现在经常听到的 Mid-training。
原因也很好理解。
预训练阶段模型看到的,过去主要是网页文本、书籍、代码。但到了后训练阶段,它突然要面对 Reasoning Trace、Agent 交互记录、多轮工具调用、长上下文任务。
前后两个阶段的数据分布差别可能非常大。
如果直接从一个阶段跳到另外一个阶段,模型就需要突然适应一套完全不同的数据。
对 MoE 模型来说,这个问题会更加明显,因为预训练过程中不同 Expert 已经逐渐形成了自己的分工,数据分布突然变化,可能会影响原有的负载平衡。
所以 Mid-training 可以理解成一个过渡阶段。
在正式进入后训练之前,提前让模型适应更长的 Context、更接近 Reasoning 和 Agent 的数据,以及未来真正会遇到的任务分布。
这样 Pre-training 和 Post-training 之间就不会切得那么生硬。
所以整体来看,Pre-training、Mid-training、Post-training、RL 这几个阶段之间的界限,确实已经越来越模糊了。
或者换一种理解方式,现在看待模型训练,可以粗略简化成两个大的范式:Supervised Learning 和 Reinforcement Learning。
前者帮助模型建立知识、表征和各种基础能力,后者再让模型进入环境,通过不断探索、试错和反馈,把这些能力组合起来。
回到开头那个标题。The Base Model Is Dead 当然是个有点夸张的说法。
Base Model 没有死,真正变化的是它在整个模型训练体系里的角色。
过去我们希望 Base Model 尽可能把人类知识学进去,然后在这个基础上做一些后训练。现在它越来越像一个为 Reasoning 和 Agent 准备的底子。
先把 Atomic Skills 准备好,再把更多复杂能力留给后面的 RL。
Base Model 依然重要,只是它越来越像一个起点。
顯示更多