看完实践哥的这个帖子,也验证了自己的想法,属于本地部署小模型的时代正式到来了。
整个八月可以说是阿里 Qwen 系列的天下,没人给他打广告,但是奈何产品自带广告属性,疯狂在大众面前刷屏。
尤其是开源大模型 Qwen3.8-27B,成功的把开源模型生态带到了前所未有的高度。
而实践哥实验的这个 Apodex-1.1-mini-GPTQ-Int4 就是 一个 35B 的开源模型后训练一下,就号称专业 Agent 能力已经能摸到甚至超过 Fable。
详情可以看看视频,那我相信很多人会跟我一样,有必要搞懂几个词
什么是后训练呢?
什么是预训练?
什么是微调?
什么是预训练?
预训练:相当于给模型打基础、学通识。
模型通过海量的网页、书籍、代码、论文等数据,不断做「预测下一个 Token」的训练,逐渐学会语言、知识、代码和基本的推理能力。
可以理解为:
让模型先“读万卷书”,变得见多识广。
预训练结束后,通常得到的是 Base Model(基座模型)。
什么是微调?
微调:就相当于在现有模型基础上做专项训练。
不用从头训练,而是拿一个已经训练好的模型,再用特定领域或任务的数据继续训练。
比如把通用模型训练成:
医疗模型
法律模型
编程模型
客服模型
SQL 模型
可以理解为:
模型已经大学毕业了,现在再去接受岗位专项培训。
LoRA 就是一种常见的低成本微调方式,只训练少量额外参数,而不是修改整个模型。
什么是后训练?
后训练:就相当于预训练完成以后,对模型进行的一整套“调教和实战训练”。
它不是一种具体算法,而是一个大的训练阶段。
包括:
SFT 指令微调
DPO 偏好优化
RLHF
RLVR
推理训练
安全训练
工具调用训练
Agent 训练
目的就是让模型从:
“有能力” 变成:“知道怎么正确地把能力用出来”。
也就是让模型学会听指令、推理、拒绝不合适请求、调用工具、检查错误、完成复杂任务。
最后总结一下:
预训练决定模型的底子,微调让模型学会了专项,后训练则决定了模型怎么把能力真正的发挥出来。
顯示更多