分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。
它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。
我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。
尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。
现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。
不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。
项目链接:
顯示更多
Claude Code 刚上线一个很实用的更新:不同 Session 之间终于可以直接通信了。
现在你同时跑多个 Claude Code,会话 A 发现了一个会影响会话 B 的改动,可以直接让 Claude 把结论发过去。传递的是它整理后的文本消息,不会把完整聊天记录或文件一起复制过去;对方甚至可以在任务执行过程中收到消息并继续处理。
这对并行开发很有用。比如一个 Session 在改数据库,另一个在做 API;前者确认 schema 变化后,可以主动通知后者。长时间跑测试的 Session,也可以在完成后把结果发回你正在盯着的主 Session。Claude 甚至可以自己判断什么时候有必要通知另一个会话。
我觉得这个更新很重要的一点,是多个独立 Agent 开始拥有了真正的「横向沟通」能力。以后并行跑几个 Coding Agent,很多上下文同步和任务交接,不需要人再充当中间的复制粘贴工具。
目前需要 Claude Code v2.1.224+,支持 macOS 和 Linux。同一台机器上的消息通过本地 socket 传递,不经过 Anthropic 服务器,而且每个 Session 原有的权限边界依然保留。
文档:
顯示更多
Agent 出错以后,到底该修模型,还是修 harness?
Scale AI 这篇《Model or Harness?》专门研究 Agent 的故障定位。
今天的 Agent 已经是一个复杂系统:模型之外,还有 Context、Memory、Tool、Grader、用户和运行环境。最后看到的失败结果相同,背后的原因可能完全不同。
比如 Agent 忽略了一条早期指令。
可能是上下文压缩把它删掉了,需要改 harness;也可能信息一直都在,只是模型没有正确使用,这时才该训练模型。
论文整理了 41 类常见失败,并把每个问题定位到具体的「组件交互 + 责任方」。
这样一次失败就能进一步回答:
该做模型 post-training,改 context / memory / tool,还是重新设计环境和评测。
作者还让不同前沿模型独立给失败案例分类,最好的结果与人工标注达到 Cohen’s κ = 0.76,说明这套分类有一定一致性。
我觉得这篇很适合现在的 Agent 发展阶段。
随着 harness 越做越复杂,「Agent 失败了」这个结论已经太粗了。
真正有用的 debugging,要继续追到第一处无法恢复的错误,再决定到底该修哪一层。
📎 arxiv:
顯示更多
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。
它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。
我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。
尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。
现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。
不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。
项目链接:
顯示更多
很多模型单项能力不差,一进入长任务,却容易卡在上一种思路里。
比如先做数学推导,再安排计划,最后从文档中提取信息。每一步单独完成都不算难,连在一起以后,模型常把前一步的解题方式和输出格式带到下一步。
普林斯顿等团队这篇论文提出了「Skill Entropy」,用来衡量模型从一种技能切换到另一种技能有多难。
他们还构建了 Skill2-Bench,覆盖数学、编程、科学、规划、信息提取和写作等 9 个领域,共 558 项技能。
实验发现,同一项技能放进跨技能长任务后,准确率会下降约 4%~13%。技能切换越困难,模型表现通常越差。
为了解决这个问题,作者提出 Skill-Entropy RL:模型在每一步回答前,先判断当前需要调用什么技能,再根据答案正确性和技能切换是否合理获得奖励。
训练后,Qwen3-4B 的得分从 34.4% 提升到 68.4%,Qwen3-1.7B 也从 14.6% 提升到 40.1%。
这项工作把长时推理的瓶颈从「会不会做」,进一步拆成了「能不能及时换挡」。
对于更强的 Agent,需要积累足够多的技能,也要知道什么时候结束上一种思路,切到下一种。
📎 arxiv:
顯示更多
🚨X 的创作者变现计划大更新啦~
从今天起,旧版 Revenue Share 不再接受新申请。 已经在里面的朋友可以继续赚到 9 月 7 日, 从 9 月 8 日开始,就可以申请加入新的 Original Content Rewards(原创内容奖励计划)。
新计划更看重原创内容, 会根据 Premium 用户在主页时间线看到你原创帖子的曝光来发放奖励。
门槛也调整了: 有 Premium、至少 500 个认证粉丝,过去 90 天有 50 万认证主页曝光就可以申请(我感觉这个要比500万曝光要难啊!)。
我看了一眼,达到旧收益门槛的朋友基本上也都会达到新的收益门槛,到时候可以留意一下 9 月 8 日之后的申请入口哦。
顯示更多
很多 Agent 单轮任务做得不错,一旦工作跨过几天、多个会话和多个 Agent,真正麻烦的事情才开始出现:目标变了,证据过期了,任务没人接,scheduler 却还在继续烧额度。
最近看到的 LoopX,就是专门处理这类问题的开源项目。
它在 Codex、Claude Code、Cursor、Pi 等 Agent 外面加了一层本地控制面。Agent 每次负责执行一个有边界的小任务,LoopX 则保存目标、Todo、权限门、证据、额度和交接状态,并决定下一轮应该继续、等待,还是停下来请人判断。
多个 Agent 也可以认领不同任务,通过 ownership、lease 和 handoff 协作,同时避免彼此重复修改或无限运行。它更像是一块面向长时 Agent 的「可执行看板」,让项目跨轮次依然可恢复、可审查、可接力。
项目还展示了跨越 200 多小时自然时间的代码修复和机器学习实验轨迹。这里指的是项目从开始到最新进展的真实时间跨度,并非模型连续自主运行了 200 小时。
长时 Agent 的难点,可能从来都不只是让模型一直运行。它还包括每一轮结束后,目标、证据、责任和下一步还能不能完整留下来。
项目链接:
顯示更多
这个新闻真的有点意思,TIME 周刊已经开始为人类和 AI 提供两个不同版本的网站。
同一个页面,普通浏览器拿到完整的 HTML;ClaudeBot、PerplexityBot 和 OAI-SearchBot 拿到精简的 Markdown,体积从约 303KB 降到 13KB。更特别的是,机器版页面里还会插入 FAQ 形式的品牌广告,并记录每次机器人访问和读取的 Token 数量。
这些广告会标注「Sponsored」,但人类访问的网页里完全看不到。TIME 与广告技术公司 Mobian 希望借助媒体网站的权威性,让品牌信息更容易进入 AI 搜索和回答。
这意味着互联网可能正在分成两层:一层写给人看,一层专门写给 AI 看。
当越来越多人通过 AI 获取信息,新的广告竞争也会从争夺人的注意力,变成争夺模型读取到的上下文。不过麻烦是如果 AI 看到的网页和我们看到的不同,谁来检查它到底读到了什么?
文章链接:
顯示更多
前 OpenAI 对齐研究员 Naomi Bashkansky 离职后的第二天,就加入了脑机接口初创公司 Conduit,去做一件听起来很像科幻的事:把人的想法直接变成给 AI 的指令。
她设想,未来戴上一条非侵入式头带,人不需要在脑中清楚地默念句子。看代码时产生的困惑、修改意图和一闪而过的想法,都可以被模型理解,再交给 Agent 执行。到了更远的阶段,AI 甚至会像一种新的感官和肢体,逐渐成为人的自然延伸。
支撑这个愿景的技术路线其实很朴素,大量收集脑信号与文字、语音之间的配对数据,再依靠规模化训练提高语义解码能力。Conduit 称自己已经从数千人身上收集约 1 万小时的非侵入式神经数据,并观察到了持续改善的 Scaling Law。它追求的也不是逐字读取思想,而是先判断一个人大概想表达什么,再结合 LLM 和当前上下文补全。
这项研究正在尝试缩短「产生想法」到「AI 开始行动」之间的距离。
但这段距离原本也给了人重新组织语言、放弃冲动和决定是否表达的机会。未来脑机接口真正需要解决的,除了准确率,还有如何区分一个明确的意图和脑中短暂闪过的念头。
文章链接:
顯示更多
很多模型单项能力不差,一进入长任务,却容易卡在上一种思路里。
比如先做数学推导,再安排计划,最后从文档中提取信息。每一步单独完成都不算难,连在一起以后,模型常把前一步的解题方式和输出格式带到下一步。
普林斯顿等团队这篇论文提出了「Skill Entropy」,用来衡量模型从一种技能切换到另一种技能有多难。
他们还构建了 Skill2-Bench,覆盖数学、编程、科学、规划、信息提取和写作等 9 个领域,共 558 项技能。
实验发现,同一项技能放进跨技能长任务后,准确率会下降约 4%~13%。技能切换越困难,模型表现通常越差。
为了解决这个问题,作者提出 Skill-Entropy RL:模型在每一步回答前,先判断当前需要调用什么技能,再根据答案正确性和技能切换是否合理获得奖励。
训练后,Qwen3-4B 的得分从 34.4% 提升到 68.4%,Qwen3-1.7B 也从 14.6% 提升到 40.1%。
这项工作把长时推理的瓶颈从「会不会做」,进一步拆成了「能不能及时换挡」。
对于更强的 Agent,需要积累足够多的技能,也要知道什么时候结束上一种思路,切到下一种。
📎 arxiv:
顯示更多
尤其在 AI 方向,一篇论文可能刚发布,一个月后就已经失去讨论热度。
新模型、新榜单和新方法不断出现,很多工作还没来得及被认真阅读和复现,就被下一波热点覆盖。
研究速度变快了,但论文的生命周期却变短了。那些真正有价值的工作,可能需要更长时间才能被看见。
顯示更多
很多 Agent 单轮任务做得不错,一旦工作跨过几天、多个会话和多个 Agent,真正麻烦的事情才开始出现:目标变了,证据过期了,任务没人接,scheduler 却还在继续烧额度。
最近看到的 LoopX,就是专门处理这类问题的开源项目。
它在 Codex、Claude Code、Cursor、Pi 等 Agent 外面加了一层本地控制面。Agent 每次负责执行一个有边界的小任务,LoopX 则保存目标、Todo、权限门、证据、额度和交接状态,并决定下一轮应该继续、等待,还是停下来请人判断。
多个 Agent 也可以认领不同任务,通过 ownership、lease 和 handoff 协作,同时避免彼此重复修改或无限运行。它更像是一块面向长时 Agent 的「可执行看板」,让项目跨轮次依然可恢复、可审查、可接力。
项目还展示了跨越 200 多小时自然时间的代码修复和机器学习实验轨迹。这里指的是项目从开始到最新进展的真实时间跨度,并非模型连续自主运行了 200 小时。
长时 Agent 的难点,可能从来都不只是让模型一直运行。它还包括每一轮结束后,目标、证据、责任和下一步还能不能完整留下来。
项目链接:
顯示更多
一个 9B 模型,专门学习怎么给 Agent 修 harness,最后比更大的前沿模型改得更稳。
这篇论文提出 Harness-R1,把「改进 Agent 的运行外壳」本身训练成了一项能力。
它会读取 Agent 的失败轨迹,找出工具误用、状态丢失、重复尝试和恢复失败等问题,再生成可以直接运行的 harness 补丁。
补丁可以介入任务开始、决策前、执行前和环境反馈后,调整上下文、动作验证和错误恢复。
关键在于,系统不会根据补丁写得是否合理来打分。
修改后的 Agent 必须重新执行任务,真实成功率有没有提升,才决定这次修改值不值得学习。
在 WebShop、ALFWorld 和 DBBench 上,Harness-R1 将 Qwen3.5-9B 的平均成功率从 44.3% 提升到 53.6%。当目标 Agent 自身经过微调后,它还能继续把成功率从 59.2% 推到 64.2%。
训练出的编辑能力也迁移到了 20 个未见过的目标模型,平均提升约 7 个百分
现在模型可以从经验中更新参数,Harness Engineer 则学习如何调整上下文、工具、验证和恢复机制。
看起来合理的修改,放进真实系统后可能反而降低成功率。未来 Agent 改进 Agent,真正重要的标准还是能不能跑通、能不能验证,以及出问题后能不能回滚。
📎 arxiv:
顯示更多
最近,几乎所有能长时间运行的 Agent,都开始被包装成自进化。
Jeff Dean 等研究者和资本押注 RSI,背后的判断很直接:单纯扩大参数、数据和算力,回报正在放缓,大家都在寻找下一条 Scaling Law。
真正的自进化至少要完成三个闭环:提出改动、验证它确实更好,再把结果变成下一轮的起点。只会持续写代码和运行任务,还算不上进化。
LLM 时代,生成已经很便宜,验证反而成了最大的瓶颈。面对科研、架构和开放式 Agent,单靠模型互相打分,很容易出现奖励投机和集体幻觉。
所以我很认同文章的判断,下一条 Scaling Law,可能来自模型外部的自进化基础设施:可执行环境、可靠验证,以及能够积累真实经验的长期记忆。
顯示更多
这一年,中美都出现了一波很明显的 AI 创业潮。
有人从大厂核心团队离开,带着多年积累重新出发;也有人刚毕业,几个人就开始做模型、Agent、机器人和各种新产品。
技术门槛下降是一方面,资本也在主动推动这股浪潮。相比等待成熟商业模式,很多投资机构更愿意提前押注顶尖人才、技术方向和团队速度。一个有说服力的背景,加上一套足够大的叙事,就可能迅速拿到启动资金。
过去创业往往要先证明产品和收入,现在不少 AI 公司先证明团队值得下注,再用资本争取时间和算力。
所以这一轮创业潮,既来自工具让小团队拥有更强的生产力,也来自资本担心错过下一个平台级机会。
顯示更多
最近会多分享一些 Agent 自进化方向的论文和工作,这也是我们团队接下来准备长期投入的方向。
我们会先从 Harness Agent 的自进化 做起。模型迭代需要大量数据和算力,Harness 则可以直接利用任务轨迹、工具反馈和评测结果,持续改进流程、记忆与执行策略,验证周期更短,也更容易落地。
我们想先看看:在模型保持不变的情况下,Agent 能不能通过不断优化自己的工作方式,真正做到越用越强。
顯示更多
一个 9B 模型,专门学习怎么给 Agent 修 harness,最后比更大的前沿模型改得更稳。
这篇论文提出 Harness-R1,把「改进 Agent 的运行外壳」本身训练成了一项能力。
它会读取 Agent 的失败轨迹,找出工具误用、状态丢失、重复尝试和恢复失败等问题,再生成可以直接运行的 harness 补丁。
补丁可以介入任务开始、决策前、执行前和环境反馈后,调整上下文、动作验证和错误恢复。
关键在于,系统不会根据补丁写得是否合理来打分。
修改后的 Agent 必须重新执行任务,真实成功率有没有提升,才决定这次修改值不值得学习。
在 WebShop、ALFWorld 和 DBBench 上,Harness-R1 将 Qwen3.5-9B 的平均成功率从 44.3% 提升到 53.6%。当目标 Agent 自身经过微调后,它还能继续把成功率从 59.2% 推到 64.2%。
训练出的编辑能力也迁移到了 20 个未见过的目标模型,平均提升约 7 个百分
现在模型可以从经验中更新参数,Harness Engineer 则学习如何调整上下文、工具、验证和恢复机制。
看起来合理的修改,放进真实系统后可能反而降低成功率。未来 Agent 改进 Agent,真正重要的标准还是能不能跑通、能不能验证,以及出问题后能不能回滚。
📎 arxiv:
顯示更多
太火了,token消耗量太大了!
DeepSeek 要开始涨价了😇
Simon Willison 最近在一台 M5 Max MacBook Pro 上运行了 MiniMax-H3 的 MLX 版本,从文字提示生成了一段带音频的视频,整个过程不到 45 分钟。视频效果不错,只是因为没有单独描述声音,最后生成了一段奇怪的说话声。
H3 可以接收文字、图片、音频和视频作为条件,再联合生成最长 15 秒的视频与声音。PipeNetwork 为它重新实现了一套 MLX 推理流程,背后包含 33B 视频音频扩散模型、Qwen3-VL-32B 编码器,以及两套音频和视频 VAE。
不过它距离实时生成还很远。项目作者也明确表示,目前真正卡住它的是计算量,高分辨率和长视频依然可能需要数小时,2K 本地生成暂时还不现实。
但本地 AI 的边界又往前推了一步。过去我们讨论的更多是本地聊天和生图,现在连视频与音频联合生成,也开始进入个人工作站能够运行的范围。
这对开发者最直接的意义,是可以在自己的机器上查看代码、修改流程、测试量化,并运行的范围。
这对开发者最直接反复调试,而不必把每一次实验都交给云端 API。
本地化最先改变的,可能就开发者重新拿回完整的实验循环。
顯示更多
Agent 连续工作几个小时,真正难的是中途失败后,还能准确知道自己做到哪了。
阿里高德团队开源的 LongHorizon-Harness,专门解决长时任务中的状态漂移和错误累积。
它把执行过程拆成 Manage–Execute–Audit 循环:
Manager 根据已经验证的进度安排下一步;Executor 在全新上下文中操作桌面、浏览器或命令行;Auditor 再独立检查真实环境。
只有审计确认的结果,才会进入长期任务状态。遇到操作失败、上下文刷新或交付不完整时,Agent 可以保留已完成的部分,从缺口继续推进。
它也不绑定具体模型和后端,可以接入 Claude、GPT、Qwen,以及 Claude Code、Codex CLI、OpenClaw 等工具。
在相同的 Qwen 3.7-Plus 与 Claude Code 配置下,GUI 与 CLI 混合任务通过率从 51.8% 提升到 80.7%;OSWorld 完整完成率从 2.8% 提升到 8.3%;Terminal-Bench 成功率从 69.7% 提升到 77.2%,同时减少了 24% 的 token。
我觉得这篇最有意思的地方在于,它把长时能力的重点,从让一个会话持续运行,推进到了让每段进度都可验证、可恢复,也能可靠地交给下一轮。
模型决定单步能力,harness 决定这些步骤最后能不能拼成一个完整交付。
📎 arxiv:
顯示更多