TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
가입 March 2025
678
팔로잉 중
10.8K
팬
Ren
@Ryrenz
2026.09.11 03:05
🎓 兄弟们,想把开源大模型微调成自己想要的样子,Hugging Face 官方维护的 TRL 把整套后训练都备好了。 GitHub 上 1.9 万 star,DeepSeek R1 训练用的 GRPO 算法,在 TRL 里就是一个现成的训练器。今天刚发 1.13 版,上一版是 8 月 26 号。 以前想照着论文给模型做一遍偏好对齐或者强化学习,得自己写训练循环、算奖励、处理多卡,光把代码跑通就要耗掉不少时间。 在 TRL 里,从监督微调 SFT,到用偏好数据做 DPO,再到 GRPO 强化学习,每一步都有对应的 Trainer 直接调,不想写代码还能用命令行起训练。 显卡不够也有办法:接上 PEFT 用 LoRA、QLoRA 加量化,有限的硬件也能训大模型;卡多了就通过 Accelerate 和 DeepSpeed 扩到多节点。连标注都能省,KTO 只要“好 / 不好”这种二元反馈,不用两两比较。 想自己动手做后训练的,先把 TRL 摸熟准没错。 GitHub:
더 보기
0
0
0
0
0
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
Reuters
@Reuters
26.4M 팬
TVer新着
@TVer_info
100.9K 팬
First Squawk
@FirstSquawk
569.2K 팬
吴说区块链
@wublockchain12
181.5K 팬
Bloomberg
@business
10.5M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.2K 팬
zerohedge
@zerohedge
3.4M 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K 팬
一劍浣春秋
@chee828
231.9K 팬
中國新聞社
@CNS1952
547.6K 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬