注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 GRPO
GRPO 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 GRPO 的推特
🎓 兄弟们,想把开源大模型微调成自己想要的样子,Hugging Face 官方维护的 TRL 把整套后训练都备好了。 GitHub 上 1.9 万 star,DeepSeek R1 训练用的 GRPO 算法,在 TRL 里就是一个现成的训练器。今天刚发 1.13 版,上一版是 8 月 26 号。 以前想照着论文给模型做一遍偏好对齐或者强化学习,得自己写训练循环、算奖励、处理多卡,光把代码跑通就要耗掉不少时间。 在 TRL 里,从监督微调 SFT,到用偏好数据做 DPO,再到 GRPO 强化学习,每一步都有对应的 Trainer 直接调,不想写代码还能用命令行起训练。 显卡不够也有办法:接上 PEFT 用 LoRA、QLoRA 加量化,有限的硬件也能训大模型;卡多了就通过 Accelerate 和 DeepSpeed 扩到多节点。连标注都能省,KTO 只要“好 / 不好”这种二元反馈,不用两两比较。 想自己动手做后训练的,先把 TRL 摸熟准没错。 GitHub:
显示更多
兄弟们,又挖到一个 GitHub 宝藏开源项目——hello-agents 🏆直接登顶 GitHub 开源热榜 ,而且还在持续飙升中 它把 AI 和 Agent 从理论到实践系统,整理成了一套开源课程,覆盖了 Agentic RL、SFT 、GRPO 这些在找高端 AI 岗位时会用到的技能 这类内容之前要么散落在各处、要么得花钱买课。 这个项目把它整合成体系直接放出来,省了不少时间。
显示更多
0
7
235
36
转发到社区
✨ 太强了,一套从零手写 AI Agent 的中文教程,16 章一路带到你能跑起来的项目 GitHub 上已经 7.4 万 star,Datawhale 社区出品 想入门 Agent 的人多半卡在同一个地方:ReAct 的论文看懂了,不知道怎么接检索;框架一会儿有人说用 Dify,一会儿有人说用 LangGraph,也没人讲清楚差在哪。资料东一篇博客西一个视频,学到第三周还在原地。 这套教程把基础理论、开发实践、高级技术、综合案例和毕业设计连成一条线,推理范式、主流框架和 RAG、MCP、A2A、SFT、GRPO 这些都在同一条路径上讲。跟到最后手里是三个能跑的东西:智能旅行助手、自动化深度研究智能体和一个赛博小镇。 配套代码、在线阅读和 PDF 都有,内容按知识共享的非商业协议放出来,自己学和团队内部用都没问题。 学完不是知道 Agent 是什么,是手里有三个跑得起来的东西。 GitHub:
显示更多
最近如果想系统补一下强化学习,尤其是 LLM post-training,这套 Berkeley CS 185/285 很值得收藏。 Sergey Levine 的 Deep Reinforcement Learning 2026 春季版课程资料已经完整放出来了,昨天课程录像也开始上传到 YouTube。 课程从 imitation learning、Policy Gradient、Actor-Critic、Q-Learning,一直讲到 Model-Based RL、Offline RL 和 Exploration。 我比较感兴趣的是今年还专门加入了「RL with Sequences & LLMs」。 里面会从 RL 的视角重新讲 RLHF、Verifier Reward、GRPO、KL Regularization 这些现在做 LLM post-training 经常看到的东西。 而且不只是听课,Homework 4 直接要求自己实现 GR-REINFORCE 和 GRPO,再真正跑训练实验做对比。 最近 RL、Agent 和 LLM post-training 连得很紧,这套课正好可以把很多零散的概念重新串起来。 课程: YouTube 上搜索 RAIL 的「CS 185/285 (Spring 2026)」播放列表就能看到最新课程录像。
显示更多
0
13
259
53
转发到社区
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
显示更多
0
58
542
93
转发到社区
城堡Citadel创始人肯·格里芬,也与脸书创始人小扎一样,对AI运行机制不太懂。DeepSeek发布后,格里芬前往中国,然后得出惊人的结论:“DeepSeek的作者中,没有一个在美国受过教育。这是民族自豪感的一个体现”。格里芬大谈输掉人才争夺战。外界不清楚DeepSeek的海外背景员工比例,但格里芬判断“没有一个”肯定是假的。 DeepSeek的核心思想是效率优先的架构设计+高效强化学习。这些并非完全从零发明:MoE思想可追溯到早期工作,如GShard等;注意力压缩受MQA/GQA启发,RL基于PPO。特别是,DeepSeek的GRPO是PPO的变体,这些工作大多来自Google(注意力与MoE)和OpenAI(PPO),DeepSeek在它们之上,做了针对性的工程与架构改进。 AI处于早期,后面的进程,会超出想象。
显示更多
0
9
122
15
转发到社区
Agent 记忆最危险的时候,往往是它太相信过去。 很多 Memory Agent 找到相似经验后,会直接把它塞进上下文。但任务相似,不代表当前状态相同,旧经验有时反而会把决策带偏。 这篇论文提出 MemHarness,把 Agent 使用记忆的过程改成三步: 先检索过去经验,再结合当前状态进行判断和重构,最后才生成行动。 有用的部分会被保留,不匹配的内容会被修改或直接丢弃。整个能力通过 GRPO 和任务奖励端到端训练,不需要额外标注重构过程。 基于 Qwen2.5-7B,MemHarness 在 ALFWorld 和 WebShop 上分别达到 85.2% 和 75.6% 的成功率,比纯 GRPO 提升 8.8 和 9.5 个百分点。 在未见过的环境中,它也达到 85.9%,而直接回放原始记忆只有 76.3%。这说明记忆用错了,确实可能比没有记忆更糟。 这篇工作把 Agent Memory 从「保存过去」推进到了「根据现在重新理解过去」。 真正可靠的记忆系统,需要知道哪些经验值得保留,哪些需要改写,哪些应该及时忘掉。 📎 arxiv:
显示更多
0
42
119
17
转发到社区
Fable5的动态工作流规划能力和长程任务能力非常惊艳,模型本身训练已经带上了这些目标,做任务的时候,也很能感受到这个模型对 unknown unknown 的把控力。 这背后是前沿 AI 模型的训练目标,正在从让模型变聪明转向让模型会干活。 Fable5被明确设计为能够自主工作数小时甚至数天、分阶段规划、派发子任务给内部 agent、自我验证输出结果、在百万 token 上下文中始终保持注意力的系统。 这也不是 Anthropic 一家在走的路,把最近几个月的模型发布串起来看,所有实验室都在往同一个方向收敛。 DeepSeek V4 Pro 的训练管线是典型的例子:先用 SFT 加 GRPO 强化学习对每个领域独立培养专家能力,再通过 on-policy 蒸馏将所有领域的专长统一融合进一个模型。同时提供 Non-Think、Think High、Think Max 三种推理模式,让用户根据任务复杂度在延迟和深度之间做取舍。1.6万亿参数 MoE 架构,百万 token 上下文,10到12倍便宜于 GPT-5.5的价格。它的训练方法已经明确针对 agentic coding 和长程推理做了优化。 即将公布的GPT-5.6更进一步,OpenAI 用强化学习训练三个独立变体(Sol、Terra、Luna),让模型通过生成长 deliberation trace 来推理后再输出。Sol 甚至有一个 ultra 模式,会自主派生出多个子 agent 来并行处理多步骤任务的不同部分。 把这些拼在一起,能看到一条非常清晰的趋势线: 前 Qwen 技术负责人林俊旸回顾了 Qwen3混合思考模式(thinking/non-thinking 切换)的教训:思考模式和指令模式在训练目标上天然冲突,强行让一个模型两者兼顾,结果是两边都不够好。所以后续版本直接拆成了 Instruct 和 Thinking 两个独立变体。 但他更核心的判断是:AI 领域正在从训练模型转向训练 Agent。他把传统的推理思考(o1、DeepSeek-R1那种,依赖数学和代码的确定性奖励信号)和 Agent 思考区分开来,Agent 需要在交互式环境中制定计划、调用工具、根据反馈修正行动。后者的训练基础设施挑战大得多:要解耦训练和推理,要优化环境质量而不是数据多样性。 这就回到了 Dario Amodei 反复讲的那个最朴素的原理:AI 模型能力根本上取决于参数规模和输入数据。从这个角度看,LLM 行业确实没有天然护城河,训练方法在收敛,开源社区在追赶,算法创新很快就会被复制。 Anthropic 自己内部的数据也很说明问题,2023年收入从0到1亿美元,2024年到10亿,2025年到90-100亿,每年十倍增长。但 Dario 自己也在说“我们接近指数的终点”——当所有玩家的训练方法论趋同,真正的壁垒只剩下算力获取能力和生态锁定效应。 所以 Fable5让人兴奋的是它展示了一种新的模型行为模式:不需要外部脚手架告诉它一步步怎么做,它自己就能把一个大任务拆开、执行、纠错、完成。这种能力的来源是训练阶段就刻进模型权重里的目标函数。 当训练模型的思路和训练 Agent 的思路开始重叠,我们看到的就不再是一个更聪明的问答系统,而是一个真正能在现实工作流里接管长程任务的执行体。
显示更多
新浪微博最新开源了 1.5B 参数“小模型”「VibeThinker-1.5B」,训练成本仅 7800 美元,在数学和编码等复杂推理任务上达到甚至超越大型模型的水平! 背景与动机:为什么小模型能“逆袭”? OpenAI o1 模型开启了“大型推理模型”(LRM)时代,通过强化学习和长链式思考(Long CoT),在数学定理证明、临床诊断和编程竞赛等领域接近人类专家水平。随后开源项目如 DeepSeek R1(671B)和 Kimi K2(>1T)进一步强化了“规模定律”:参数越多,推理越强。小模型被视为先天不足,无法处理高难度问题。 论文作者质疑这一观点:如果从小模型入手,通过巧妙的训练策略,能否挖掘出隐藏的推理潜力?答案是肯定的。VibeThinker-1.5B 基于 Qwen2.5-Math-1.5B 基础模型,经过后训练优化,在基准测试中大幅提升——从 AIME24 数学测试的 6.7 分跃升至 80.3 分,编码基准LiveCodeBench V6 从 0 分升至 51.1 分。更惊人的是,它在多个数学挑战上小胜 DeepSeek R1,后者参数规模是它的 400 多倍。这表明,推理能力的瓶颈不在于“体型”,而在于训练范式的创新。 核心创新:Spectrum-to-Signal Principle(谱-信号原理) 论文提出“谱-信号原理”(SSP),这是一个重新定义监督微调(SFT)和强化学习(RL)协同的框架。传统方法视 SFT 为“准确定位最佳答案”的阶段,RL 则进一步精炼。但作者认为,这会让模型陷入单一路径的“局部最优”,限制后续探索空间。SSP 将两阶段解耦为互补角色: · 谱阶段(SFT):探索多样性 SFT 不再追求单次生成(Pass@1)的准确率,而是优化多采样成功率(Pass@K),生成一个“丰富的光谱”——即多种潜在正确解法。这能避免模型固守狭隘模式,提升问题解决的鲁棒性和创造性。 实现上采用“两阶段多样性探索蒸馏”: 1. 领域感知多样性探测:将数学领域拆分为子域(如代数、几何),为每个子域用强大 LLM 生成探测集,选出在 Pass@K 上最佳的“专家模型”。 2. 专家模型融合:通过加权平均(均匀权重)合并专家模型,形成统一 SFT 模型。这平衡了准确性和多样性,为 RL 铺平道路。 · 信号阶段(RL):放大正确路径 RL 从 SFT 的“光谱”中挑选并强化最佳推理轨迹。作者引入“最大熵指导政策优化”(MGPO),基于群相对政策优化(GRPO)扩展。GRPO通过采样多组响应计算相对优势,避免外部价值函数的复杂性。MGPO 进一步融入最大熵原理:优先训练不确定性高的样本(准确率接近 50%,即二元分布的最大熵点),用熵偏差正则化加权优势函数。这让模型高效聚焦“高价值”问题,避免浪费计算在已掌握的简单任务上。 RL 分两子阶段:先数学推理(上下文从 16K 扩展到 32K),后编码生成,奖励函数为二元正确性。 此外,论文强调数据净化:使用 10-gram 语义匹配去除训练与测试集重叠,确保成绩真实。训练数据结合开源数据集和合成数据,覆盖数学和编码领域。 实验与结果:小模型的“大逻辑” 在多个基准上评估 VibeThinker-1.5B,包括数学(MATH-500、AIME24/25、HMMT25)、编码(LiveCodeBench V5/V6)和知识(GPQA-Diamond)。评估采用 vLLM 后端,多采样 Pass@1,温度 0.6(数学用 1.0)。 · 与小模型比较:VibeThinker 在子 3B 类别中拔尖,AIME25 达 74.4(Qwen3-1.7B 仅 36.8),HMMT25 达 50.4(SmolLM-3B 仅 26.0),编码 V6 达 51.1(基础模型 0.0)。 · 与大型推理模型比较:数学上小胜 DeepSeek R1(AIME24:80.3 vs. 79.8;AIME25:74.4 vs. 70.0;HMMT25:50.4 vs. 41.7),与 MiniMax-M1-456B 持平。编码稍逊 Magistral Medium(55.9 vs. 59.4)。 · 与顶级非推理模型比较:数学碾压 GPT-4.1(AIME24:80.3 vs. 46.5)和 Kimi K2(49.5),编码胜 Claude Opus 4(51.1 vs. 47.4)。但在 GPQA 知识测试上仍有差距(46.7 vs. 70-82),提示小模型在广域知识上需进一步优化。 这些结果证实 SSP 的有效性:多样性驱动让小模型在推理密集任务中“以小博大”。 讨论与影响:重塑 AI 格局 VibeThinker 的成功源于算法设计而非参数堆积,推理成本降至大型模型的 1/30-1/60,便于边缘部署(推理成本低 20-70 倍)。它暴露了规模定律的局限:小模型潜力被低估,尤其在数学/编码领域。但知识基准的差距表明,未来需加强广义知识注入。 开源模型和技术报告:
显示更多
0
2
32
12
转发到社区