TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
参加 March 2025
678
フォロー中
10.8K
ファン
Ren
@Ryrenz
2026.09.11 03:05
🎓 兄弟们,想把开源大模型微调成自己想要的样子,Hugging Face 官方维护的 TRL 把整套后训练都备好了。 GitHub 上 1.9 万 star,DeepSeek R1 训练用的 GRPO 算法,在 TRL 里就是一个现成的训练器。今天刚发 1.13 版,上一版是 8 月 26 号。 以前想照着论文给模型做一遍偏好对齐或者强化学习,得自己写训练循环、算奖励、处理多卡,光把代码跑通就要耗掉不少时间。 在 TRL 里,从监督微调 SFT,到用偏好数据做 DPO,再到 GRPO 强化学习,每一步都有对应的 Trainer 直接调,不想写代码还能用命令行起训练。 显卡不够也有办法:接上 PEFT 用 LoRA、QLoRA 加量化,有限的硬件也能训大模型;卡多了就通过 Accelerate 和 DeepSpeed 扩到多节点。连标注都能省,KTO 只要“好 / 不好”这种二元反馈,不用两两比较。 想自己动手做后训练的,先把 TRL 摸熟准没错。 GitHub:
もっと見る
0
0
0
0
0
コミュニティへ転送
人気のあるユーザー
GIGA特撮ヒロイン【公式】
@giga_web
63K ファン
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569.2K ファン
Bloomberg
@business
10.5M ファン
吴说区块链
@wublockchain12
181.5K ファン
billboard
@billboard
16.8M ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K ファン
一劍浣春秋
@chee828
231.9K ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン