TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI 🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
가입 December 2014
433
팔로잉 중
10.9K
팬
AI少年
@aehyok
2026.08.27 07:51
看完实践哥的这个帖子,也验证了自己的想法,属于本地部署小模型的时代正式到来了。 整个八月可以说是阿里 Qwen 系列的天下,没人给他打广告,但是奈何产品自带广告属性,疯狂在大众面前刷屏。 尤其是开源大模型 Qwen3.8-27B,成功的把开源模型生态带到了前所未有的高度。 而实践哥实验的这个 Apodex-1.1-mini-GPTQ-Int4 就是 一个 35B 的开源模型后训练一下,就号称专业 Agent 能力已经能摸到甚至超过 Fable。 详情可以看看视频,那我相信很多人会跟我一样,有必要搞懂几个词 什么是后训练呢? 什么是预训练? 什么是微调? 什么是预训练? 预训练:相当于给模型打基础、学通识。 模型通过海量的网页、书籍、代码、论文等数据,不断做「预测下一个 Token」的训练,逐渐学会语言、知识、代码和基本的推理能力。 可以理解为: 让模型先“读万卷书”,变得见多识广。 预训练结束后,通常得到的是 Base Model(基座模型)。 什么是微调? 微调:就相当于在现有模型基础上做专项训练。 不用从头训练,而是拿一个已经训练好的模型,再用特定领域或任务的数据继续训练。 比如把通用模型训练成: 医疗模型 法律模型 编程模型 客服模型 SQL 模型 可以理解为: 模型已经大学毕业了,现在再去接受岗位专项培训。 LoRA 就是一种常见的低成本微调方式,只训练少量额外参数,而不是修改整个模型。 什么是后训练? 后训练:就相当于预训练完成以后,对模型进行的一整套“调教和实战训练”。 它不是一种具体算法,而是一个大的训练阶段。 包括: SFT 指令微调 DPO 偏好优化 RLHF RLVR 推理训练 安全训练 工具调用训练 Agent 训练 目的就是让模型从: “有能力” 变成:“知道怎么正确地把能力用出来”。 也就是让模型学会听指令、推理、拒绝不合适请求、调用工具、检查错误、完成复杂任务。 最后总结一下: 预训练决定模型的底子,微调让模型学会了专项,后训练则决定了模型怎么把能力真正的发挥出来。
더 보기
0
0
30
17
1
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
TVer新着
@TVer_info
100.9K 팬
Reuters
@Reuters
26.4M 팬
First Squawk
@FirstSquawk
569.2K 팬
吴说区块链
@wublockchain12
181.5K 팬
Bloomberg
@business
10.5M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.2K 팬
zerohedge
@zerohedge
3.4M 팬
中國新聞社
@CNS1952
547.6K 팬
一劍浣春秋
@chee828
231.9K 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬