TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
가입 November 2020
630
팔로잉 중
12.5K
팬
Xudong Han
@Xudong07452910
2026.08.08 01:30
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
더 보기
0
0
58
542
93
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
吴说区块链
@wublockchain12
181.5K 팬
TVer新着
@TVer_info
100.9K 팬
Reuters
@Reuters
26.4M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
First Squawk
@FirstSquawk
569.4K 팬
Bloomberg
@business
10.5M 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.3K 팬
中國新聞社
@CNS1952
547.7K 팬
一劍浣春秋
@chee828
0 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K 팬
zerohedge
@zerohedge
3.4M 팬
モデルプレス
@modelpress
2.1M 팬