TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
Joined November 2020
630
Following
12.5K
Followers
Xudong Han
@Xudong07452910
2026.08.08 01:30
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
Show more
0
0
58
542
93
Forward to community
Most Popular Users
Tibo
@thsottiaux
777.9K Followers
Serenity
@aleabitoreddit
1.1M Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
New York Post
@nypost
4.2M Followers
OpenAI
@OpenAI
5.4M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
198.9K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
First Squawk
@FirstSquawk
569.4K Followers
Anthropic
@AnthropicAI
1.8M Followers
Ansem 🐂🀄️
@blknoiz06
1.4M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
472.8K Followers