大师:知道模型蒸馏吗?
我:拿大模型教小模型。
大师:怎么教?
我:让 Teacher 生成答案,再拿这些答案训练 Student。
大师:差不多。
但经典蒸馏不只是学“答案”。
Teacher 可能认为:
狗:90%
猫:9%
汽车:1%
Student 学的不只是“狗是对的”,还可以学 Teacher 的判断分布。
答案一样,不代表学到的东西一样。
⸻
我:那现在 LLM 蒸馏也是这样?
大师:已经不只这样了。
调用 Claude、GPT 时,你通常拿不到完整 logits。
所以今天更常见的是:
Teacher 生成回答、代码、推理轨迹、Tool Call、Agent trajectory。
然后拿这些行为数据训练 Student。
与其说是复制参数,不如说是在:
蒸馏行为。
我:那国内模型该不该蒸馏国外强模型?
大师:合法合规,为什么不学?
我:但一直学别人,不还是追赶者吗?
大师:所以蒸馏真正的毕业标准,不是 Student 考了多少分。
我:是什么?
大师:
有一天,Teacher 开始研究怎么蒸馏你。
我:那才算追上了?
大师:不。
大师喝了口茶。
那叫攻守易形。
我:那现在呢?
大师:
现在主要还是学生偷偷坐第一排。
老师已经开始查学生证了。
顯示更多