註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 强化学习
强化学习 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 强化学习 的搜尋結果
想学强化学习,看论文太硬核,看博客又太碎片,找一份系统又不劝退的入门资料不容易。 《The Little Book of Reinforcement Learning》这本开源书籍,篇幅不长,从基础概念讲到常用算法。 附带全套 PyTorch 代码,书里讲到的每个算法都有可运行的实现,边读边练。 GitHub: 还有一份动态规划的详细推导作为补充,想深入数学细节的可以对照看。 对强化学习感兴趣、想从零入门的朋友,这本小书适合当起点。
顯示更多
最近如果想系统补一下强化学习,尤其是 LLM post-training,这套 Berkeley CS 185/285 很值得收藏。 Sergey Levine 的 Deep Reinforcement Learning 2026 春季版课程资料已经完整放出来了,昨天课程录像也开始上传到 YouTube。 课程从 imitation learning、Policy Gradient、Actor-Critic、Q-Learning,一直讲到 Model-Based RL、Offline RL 和 Exploration。 我比较感兴趣的是今年还专门加入了「RL with Sequences & LLMs」。 里面会从 RL 的视角重新讲 RLHF、Verifier Reward、GRPO、KL Regularization 这些现在做 LLM post-training 经常看到的东西。 而且不只是听课,Homework 4 直接要求自己实现 GR-REINFORCE 和 GRPO,再真正跑训练实验做对比。 最近 RL、Agent 和 LLM post-training 连得很紧,这套课正好可以把很多零散的概念重新串起来。 课程: YouTube 上搜索 RAIL 的「CS 185/285 (Spring 2026)」播放列表就能看到最新课程录像。
顯示更多
0
13
259
53
轉發到社區
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
顯示更多
0
58
542
93
轉發到社區
- 2015年,那时候流行 one-hot ,强化学习之父说 直接背答案太浪费了(那时候还流行 bert ,很容易过拟合) ,提出了蒸馏的本质是 大模型要学思路,不要学答案。这是所有技术发展的‘根因’ -- 那时候有本RL领域圣经叫做 《苦涩的教训》,就是说不要人工打标,直接尼玛把标注之前的所有东西丢给大模型让它自己学自己反思。
顯示更多
这篇讲 forecasting RL 预测强化学习的文章挺有意思。 它做的事情可以这样理解: 拿一批已经有结果的历史预测题,让 AI 回到当时的时间点。 但不能让它直接上今天的互联网,否则会偷看到答案。 所以作者搭了一个「时间遮罩」环境: 搜索只能搜当时以前的资料; 网页通过历史快照读取; 金融和趋势数据也只给当时可见的部分。 然后让模型自己查资料、判断证据、输出概率。 等真实结果揭晓后,用 proper scoring rule 给它打分,再用 RL 去强化更好的预测过程。 这点最有意思: 训练的不是一句答案,而是整套预测动作: 查什么、读什么、什么时候停、怎么处理冲突证据、最后给多少概率。 放到预测市场里,我觉得第一步还不是让 AI 自动交易。 更应该先让它保留 forecast diary: 1. 当时概率 2. 使用证据 3. 市场价格 4. 是否会交易 5. 后续结果 6. 错因归类 如果一个系统说 60% 的时候,长期并不像 60%,那它还不是策略,只是会写理由。 如果你也想练习“记录预测 → 等结果 → 校准自己”,可以从小额/模拟开始,把它当预测日记,而不是交易建议。 我自己用的链接: 原文在这里: 我觉得最值得看的不是结论本身,而是它把“预测”拆成了一个可以训练和复盘的过程。
顯示更多
Hugging Face发布399美元开源机器人Microduck,支持强化学习训练 Hugging Face推出25厘米高的开源鸭子机器人Microduck,售价399美元。该机器人支持强化学习训练,可行走、用喙拾取重达800克的物体,跌倒后自行起身,甚至完成溜冰动作。 Hugging Face CEO Clem Delangue称,Microduck旨在推动价格更低、可自主训练的开源机器人普及,开启“开源平价机器人的新时代”。
顯示更多
越来越感觉政治高手都是他妈的强化学习高手,最近看马基雅维利,他说:长治久安的根本在于深刻理解奖励预测偏差,通过一次性重罚把民众的预期打穿到基线以下,然后再将间歇性的小奖励分批赋予民众,使其在持续的正偏差中趋于稳态服从。
顯示更多
😱有狠人花了2000多个小时,用强化学习训练了一个AI,专门去挑战赛车游戏Trackmania的人类世界纪录! 最绝的是,AI自己瞎跑根本赢不了,作者必须把人类顶尖选手的骚操作和极限技巧强行喂给AI吃,最后AI竟然真的以0.01秒的微弱优势干翻了世界第一! AI到底能不能超越人类创造?😂
顯示更多
扎克伯格为了逃避保镖,竟然跑去学开直升机!😱 小扎自曝被安保团队强行接送了10年,最后实在忍无可忍,直言“我需要自由,必须自己掌控方向盘。 有钱人的任性真的颠覆想象,嫌开车太慢直接上天。
顯示更多
持续学习到底怎么落地?Mind Lab 用 LoRA 给了个解法 刚看 Mind Lab(Mindverse 旗下前沿实验室,成立还不到一年)出了 Macaron-V1 正式版。路线挺特别的,重点不在卷参数,是想让模型能从经验里接着学。 做法是用 LoRA 做后训练 RL,成本只有全参微调的 1/10。LoRA 模块像可插拔的经验单元:聊天、代码、UI、个人助理各训一个,基座共享,跑任务时按需组合(他们叫 MoL)。这么一来,模型就不再是训完定死的一套权重,能不断分化、把新经验吃进去。 感觉挺长一段时间里,LoRA 都被默认成“全参微调的打折平替”。他们这里有个我觉得挺有意思对 LoRA 的重新理解:base model 承载共性,adapter 承载个性(偏好、技能、工具习惯),说白了就是一块可写入、会随交互慢慢变的记忆。也是continual learning 这条路线,我目前看到最工程化的一份答卷。 Macaron-V1-Venti = 744B 的 GLM-5.2 基座 + 4×1B LoRA,一共 748B,原生支持 2M context: L0 Chat 管对话和指令 L1 Agent 管长程、动态工具任务(并入了Preview的OpenClaw LoRA) L2 Coding 管代码、SWE、终端 L3 UI/A2UI 管UI4A渲染和操作 至于为什么要拆成好几个 LoRA,他们的想法是:这些能力的思考流程差太远,全塞进一套 post-training 权重会互相干扰。MoL 让相似的技能共用一个 LoRA,差太多的各自单独训,再路由、组合;新增领域就加一个 adapter。 等 adapter 多起来,再让它们分工、组合、投票,就是他们所说的群体智能。 这条路也不是 Mind Lab 首创,John Schulman(OpenAI 联创、Thinking Machines首席科学家)那篇《LoRA without Regret》就是同一个方向。但全球能开万亿参数模型 RL 训练的 infra,目前就 Mind Lab 和 TML 两家。 不过Mind Lab是直接用国内最好的开源模型,最早2025年底在万亿参数Kimi K2上验证过RL后训练,Preview用GLM-5.1、Venti用GLM-5.2、Tall用Qwen-3.7-35b。拿这些现成的强基座来做,比 TML 从头做 Inkling 会更快(Inkling 现在的表现也明显还打不过 GLM 和 Kimi)。 商业化也很快:据团队披露,7 月启动商业化后2周达到 1000 万美元 ARR。 其实我会关注 Macaron-V1,很大一个背景是持续学习这个方向本身。 持续学习想解决的,是模型部署之后就不再进化这个老问题,让它能在真实使用里边用边学。 这方向最近越来越多重量级的人在点名。之前强化学习之父 Sutton 和 David Silver 提出“the era of experience”,说下一代 AI 拼的不再是喂数据,是从真实经历里持续学,他自己也去创业做了 Oak Lab 专攻这个。梁文锋最近四小时闭门会流出来,他给 DeepSeek 排的路线是 CoT → Agent → 持续学习,还说下一代模型不能持续学习,就不配叫下一代。 Macaron-V1 至少证明了这条路能工程化、也能商业化跑通。这种方向靠一两家撑不起来,挺期待接下来更多团队砸进来、多拿几个硬成果。真卷起来,应该会挺有意思。
顯示更多