TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
参加 November 2020
630
フォロー中
12.5K
ファン
Xudong Han
@Xudong07452910
2026.08.08 01:30
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
もっと見る
0
0
58
542
93
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569.4K ファン
ファミ通.com
@famitsu
1.4M ファン
Bloomberg
@business
10.5M ファン
モデルプレス
@modelpress
2.1M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
billboard
@billboard
16.8M ファン
一劍浣春秋
@chee828
231.9K ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
Yahoo!ニュース
@YahooNewsTopics
2.1M ファン