Register and share your invite link to earn from video plays and referrals.

Wayen
@wayen_ai
04 年工科大四 正在用 AI Agent 把学习、求职和副业做成自动化工作流 真实实测 / 翻车公开 / 工具排雷 / 工作流教学 AI 自动化|校园副业|求职提效
Joined May 2020
179 Following    3.6K Followers
读到一篇把 AI 模型训练过程讲得最清楚的文章。没有术语堆砌,用“教练、考试、新同事”三个比喻串起了整条链路。 以下是拆出的 5 个关键阶段: 1. 预训练:读所有书 模型先在大规模公开数据上学习预测模式——相当于读了世界上所有关于篮球的书。这时候的模型“很聪明,但不好聊”,有知识,也有 quirks。 2. 监督微调:看录像模仿 展示大量优秀行为示例让模型模仿。相当于新球员反复看乔丹的录像。能进步,但光靠模仿到不了顶级。 3. 强化学习:教练实时反馈 让模型自己上场打,做得好给奖励,做不好纠正。每次决策都被“打分”——相当于教练在场边喊“这球处理得对”“这球选择错了”。新研究发现,诚实、有用这些通用品质也能在这个阶段学会。 4. 评估:练习赛和期末考试 用模型没见过的题目测试——不然就相当于背答案,不是真理解。客观题看结果对不对,主观题让另一个模型当裁判打分。 5. 对齐:聪明且让人舒服 如果一个人智商爆表但粗鲁、固执、每句话都说“说真的,这就是答案”,你不会想和他共事。模型也一样。训练团队会在模型发布前花大量时间对话、记录问题、纠正 quirks——直到它从“书呆子天才”变成“靠谱同事”。 一个容易被误解的点:模型只在训练期间学习,你和它的对话不会实时更新模型智力。所以需要把经验写成规则或技能文件,让模型每次调用时读一遍——相当于给同事留了一本工作手册,他每天早上翻一遍再干活。 这篇是 @leerob 写的,对理解 AI 训练逻辑很有帮助。
Show more