登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
参加 March 2025
678 フォロー中    10.8K ファン
🎓 兄弟们,想把开源大模型微调成自己想要的样子,Hugging Face 官方维护的 TRL 把整套后训练都备好了。 GitHub 上 1.9 万 star,DeepSeek R1 训练用的 GRPO 算法,在 TRL 里就是一个现成的训练器。今天刚发 1.13 版,上一版是 8 月 26 号。 以前想照着论文给模型做一遍偏好对齐或者强化学习,得自己写训练循环、算奖励、处理多卡,光把代码跑通就要耗掉不少时间。 在 TRL 里,从监督微调 SFT,到用偏好数据做 DPO,再到 GRPO 强化学习,每一步都有对应的 Trainer 直接调,不想写代码还能用命令行起训练。 显卡不够也有办法:接上 PEFT 用 LoRA、QLoRA 加量化,有限的硬件也能训大模型;卡多了就通过 Accelerate 和 DeepSpeed 扩到多节点。连标注都能省,KTO 只要“好 / 不好”这种二元反馈,不用两两比较。 想自己动手做后训练的,先把 TRL 摸熟准没错。 GitHub:
もっと見る