TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
Charles在路上
@Charles77xixi
00后程序员👨🏻💻|前大厂 Infra,目前在做 Game Agent 把 AI 真正用进项目、把工资变成资产,联系方式在个人网站 合作 📮:charles77xixi
@gmail
.com
加入 January 2025
271
正在关注
4.6K
粉丝
Charles在路上
@Charles77xixi
2026.07.17 12:38
最近有跟很多人聊 AI,发现很多人其实分不清推理和训练是什么。 1️⃣ 推理(inference):模型答题 你每天用的 ChatGPT、Claude,基本都停在推理这一层,说白了就是你向一个已经训练好的模型发请求、它给你回复的过程。 模型的权重早就在训练阶段固定死了,你输入一段 prompt 进去,它做一次前向计算,吐出结果。可以直接把它当成一个服务端,请求和请求之间互不通信、互不影响。 2️⃣ 预训练(pre-training):从零造一个大脑 这是整个大模型诞生里最重、也最关键的一步。一般会拿几十 TB 的数据喂给一个随机初始化的网络,让它反复学预测下一个词,一次训练动辄几个月,烧掉巨量的 GPU 卡和电费,最后产出一个基座模型(base model)。 它对硬件的要求很变态,几千张顶级 GPU 得物理上挤在同一个机房,用 InfiniBand 高速互联连成一台超级计算机,因为每次训练都要同步梯度,这也是为什么HBM贵的原因。 预训练造出来的模型其实还很难用,它只能保证闷头续写(输出token),你问它一个问题,它可能给你顺手反问三个类似的问题出来。 3️⃣ 后训练(post-training):把大脑调教成助手 从只会续写的基座模型,需要通过后训练才能变成好好跟你聊天、帮你完成任务的助手。 它是一个很长的工序,把预训练之后所有继续改权重的工序都装进去,主要有以下几种方式: 1.SFT:监督微调,喂人工写好的问题和好答案,教它按指令回答 2.RLHF / DPO:用人类偏好数据对齐,让它知道哪种回答更受欢迎、更安全,Anthropic 那套 Constitutional AI 就是这一支的变体 3.推理训练 RLVR:拿数学对不对、代码跑不跑得通这种能验证的奖励,专门练它的推理链。后训练的数据量和成本比预训练小好几个数量级,但一个模型好不好用、听不听话、安不安全,主要是这一层练出来的,不是靠参数量堆出来的,比如gpt风格明显就更加严谨、claude会更发散。 同样是训练,预训练拼的是算力和资本,后训练拼的是数据质量和调教手艺。 4️⃣ 微调(fine-tune):特定化调整 这是普通公司和个人唯一玩得起的训练。微调就是拿一个已经预训练好的模型,用你自己私有小规模的特定数据再补一补,让它适配某个行业、某类任务、某种风格。上面说的 SFT 其实就是微调的一种,只不过大家平时说微调,更多指自己拿开源模型 Llama、Qwen 在自家的私有数据上接着训。 早期微调要动全部参数,成本还是挺高的,个人和小公司玩不起。后来有了 LoRA 这类参数高效微调,把原模型冻住,只训一小撮新增的低秩参数,便宜到一张显卡、几十块钱电费就能跑一次。 所以你听到某公司说我们训了个垂直领域的大模型,先别急着膜拜,大概率是在这一层 LoRA 了一下。
显示更多
0
0
1
18
4
转发到社区
热门用户
狱
@Wx1n11124
270.3K 粉丝
New York Post
@nypost
4.2M 粉丝
オリコンニュース
@oricon
1.9M 粉丝
吴说区块链
@wublockchain12
181.5K 粉丝
TVer新着
@TVer_info
100.9K 粉丝
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 粉丝
Reuters
@Reuters
26.4M 粉丝
First Squawk
@FirstSquawk
569.4K 粉丝
玉米棒棒
@fljjx61
501.9K 粉丝
Bloomberg
@business
10.5M 粉丝
billboard
@billboard
16.8M 粉丝
空空道人
@Kongkongda5882
34.3K 粉丝
中國新聞社
@CNS1952
547.7K 粉丝
华尔街观察 Xtrader
@cnfinancewatch
130.1K 粉丝
看中國
@kanzhongguo
348.8K 粉丝