登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI   🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
参加 December 2014
433 フォロー中    10.9K ファン
看完实践哥的这个帖子,也验证了自己的想法,属于本地部署小模型的时代正式到来了。 整个八月可以说是阿里 Qwen 系列的天下,没人给他打广告,但是奈何产品自带广告属性,疯狂在大众面前刷屏。 尤其是开源大模型 Qwen3.8-27B,成功的把开源模型生态带到了前所未有的高度。 而实践哥实验的这个 Apodex-1.1-mini-GPTQ-Int4 就是 一个 35B 的开源模型后训练一下,就号称专业 Agent 能力已经能摸到甚至超过 Fable。 详情可以看看视频,那我相信很多人会跟我一样,有必要搞懂几个词 什么是后训练呢? 什么是预训练? 什么是微调? 什么是预训练? 预训练:相当于给模型打基础、学通识。 模型通过海量的网页、书籍、代码、论文等数据,不断做「预测下一个 Token」的训练,逐渐学会语言、知识、代码和基本的推理能力。 可以理解为: 让模型先“读万卷书”,变得见多识广。 预训练结束后,通常得到的是 Base Model(基座模型)。 什么是微调? 微调:就相当于在现有模型基础上做专项训练。 不用从头训练,而是拿一个已经训练好的模型,再用特定领域或任务的数据继续训练。 比如把通用模型训练成: 医疗模型 法律模型 编程模型 客服模型 SQL 模型 可以理解为: 模型已经大学毕业了,现在再去接受岗位专项培训。 LoRA 就是一种常见的低成本微调方式,只训练少量额外参数,而不是修改整个模型。 什么是后训练? 后训练:就相当于预训练完成以后,对模型进行的一整套“调教和实战训练”。 它不是一种具体算法,而是一个大的训练阶段。 包括: SFT 指令微调 DPO 偏好优化 RLHF RLVR 推理训练 安全训练 工具调用训练 Agent 训练 目的就是让模型从: “有能力” 变成:“知道怎么正确地把能力用出来”。 也就是让模型学会听指令、推理、拒绝不合适请求、调用工具、检查错误、完成复杂任务。 最后总结一下: 预训练决定模型的底子,微调让模型学会了专项,后训练则决定了模型怎么把能力真正的发挥出来。
もっと見る