注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 ContinualLearning
ContinualLearning 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 ContinualLearning 的推特
翁家翌新 blog:超越梯度的学习 昨天看到翁家翌(前 OpenAI 研究员)新写了一篇 blog《Learning Beyond Gradients》,挺有意思的,分享一些我读下来的感受。 原文较长且偏技术,下面这版做了不少删减和重组,建议感兴趣的同学直接读原文 · · · 翁家翌:超越梯度的学习 持续学习(Continual Learning)之所以一直很难,很大程度上是因为神经网络的顽疾:灾难性遗忘。那如果我们不只盯着权重更新这一条路呢? 随着 LLM agent 越来越强,写代码这件事变得又快又好。但翁家翌注意到一个更有趣的现象:agent 可以反复读取失败信息、修改策略代码、添加测试、回放录像,让整套程序在不动任何网络权重的情况下持续变强。 · · · 这个视角让他重新审视了一个老朋友:heuristic,也就是手写规则和程序化策略。之前很多 heuristic 不是没用,而是维护太贵了,而coding agent 改变的正是这条维护曲线。那些曾经用完就扔的一次性补丁,开始变得值得长期拥有。 凡是能被持续迭代的东西,都开始变得更可解,这也恰恰是持续学习一直追求的目标。 它有没有可能成为继 pretraining → RLHF → 大规模 RL/RLVR 之后的下一个范式? · · · 翁家翌用 Codex(gpt-5.4)做了实验,纯写规则版本,完全不碰神经网络。结果超出预期: — Atari Breakout 的打砖块分数从 387 一路升到 864,达到理论最高分; — MuJoCo 四足和跑步机器人任务中,纯 Python 策略也跑进了常见 Deep RL 结果的量级,HalfCheetah 五轮均值 11836.7; — 跑完 Atari 全部 57 个游戏后,在相同的环境交互步数下,中位数得分已经远高于 PPO 这类标准算法。 这里被更新的对象早就不是单纯的策略函数了,而是一整套带着记忆、反馈入口和回归机制的软件系统。翁家翌把它叫作 Heuristic Learning(HL,启发式学习)。 (我自己也做过 evolve,但不训练神经网络,纯靠规则约束,感觉系统怎么都智能不起来。其实不管 RL 还是 HL,能不能跑起来都是看一件事,优化结果的评分能不能清晰定义。) · · · Heuristic Learning(HL) 是什么?HL 怎么持续学习? HL 的核心是用 coding agent 维护一个 Heuristic System(HS)。 和 Deep RL 的差异: — 反馈来源:不是 loss 函数,而是测试结果、环境奖励、日志、视频、失败模式分析; — 更新方式:不走反向传播,agent 直接改 policy、状态检测器、测试、配置或记忆结构; — 维护对象:不止一个 trace(黄金轨迹)、环境 wrapper 等。 以前怎么没人搞?专家系统 70 年代就有,但人维护起来是噩梦:加一条规则修好 case A,case B 崩了;规则堆到几百条后,除了原作者没人看得懂。 而 coding agent 不怕堆规则。它能同时读所有代码、跑全量测试、对比日志,把维护成本打下来。用翁的比喻说,就像纺纱机改变纺线成本曲线一样:手工纺贵得要死,机器一上来就塌掉了。 · · · Heuristic Learning 怎么做 Continual Learning 神经网络把经验压进权重,忘没忘、怎么忘的都是黑箱。HL 的历史则是显式的:版本 diff、回归测试、replay、视频、golden trace 全透明。新增能力前先固化旧能力:跑回归测试、跑固定种子回放。如果新规则破坏旧 case,agent 能直接定位到哪行代码引入的 regression。 但规则叠太多、agent 自己都维护不动的时候,就需要"历史压缩",把一堆 case-specific 的补丁合并成更通用的逻辑,否则系统迟早变成没人敢碰的代码泥球。 · · · 当然,HL 不是万能药。因为 Heuristic Learning 并不能做所有神经网络能做的事情。它的上限卡在代码的表达能力:比如复杂感知和长程泛化。翁家翌也坦率地说,他想不出有哪个 agent 能纯靠 Python、不用网络去搞定 ImageNet。 所以真正的问题变成了:怎么把神经网络和 HL 结合起来,同时搞定在线学习和持续学习? 最有希望的方向是:用 HL 快速处理在线数据,把在线经验变成可训练、可回归、可筛选的数据,再周期性地更新神经网络。以机器人为例,借用 System 1 / System 2 的说法,一种可能的分工是: — 专用浅层 NN 作为 System 1 的一部分:快、便宜,负责感知、分类、物体状态估计; — HL 也可以当做 System 1 的一部分:负责最新数据处理、规则、测试、回放、memory、安全边界、局部恢复; — LLM agent 作为 System 2:负责给 HL 提供反馈、改进数据,并周期性把 HL 生成的数据拿过来更新自己。 · · · Agentic coding 改变的不仅是写代码的速度,更改变了"哪些代码值得被长期拥有"。过去很多 heuristic 看上去没前途,不是它们太弱,而是维护不起。 coding agent 改变的就是这条维护成本曲线。 规则、测试、日志、记忆和补丁,原来只是散落的工程材料,现在开始能组成一个持续进化的 Heuristic System,去解决在线学习和持续学习一直没搞定的事。 欢迎来到下一个范式。 · so,skills + instruction following = AGI?
显示更多
0
1
171
41
转发到社区
持续学习到底怎么落地?Mind Lab 用 LoRA 给了个解法 刚看 Mind Lab(Mindverse 旗下前沿实验室,成立还不到一年)出了 Macaron-V1 正式版。路线挺特别的,重点不在卷参数,是想让模型能从经验里接着学。 做法是用 LoRA 做后训练 RL,成本只有全参微调的 1/10。LoRA 模块像可插拔的经验单元:聊天、代码、UI、个人助理各训一个,基座共享,跑任务时按需组合(他们叫 MoL)。这么一来,模型就不再是训完定死的一套权重,能不断分化、把新经验吃进去。 感觉挺长一段时间里,LoRA 都被默认成“全参微调的打折平替”。他们这里有个我觉得挺有意思对 LoRA 的重新理解:base model 承载共性,adapter 承载个性(偏好、技能、工具习惯),说白了就是一块可写入、会随交互慢慢变的记忆。也是continual learning 这条路线,我目前看到最工程化的一份答卷。 Macaron-V1-Venti = 744B 的 GLM-5.2 基座 + 4×1B LoRA,一共 748B,原生支持 2M context: L0 Chat 管对话和指令 L1 Agent 管长程、动态工具任务(并入了Preview的OpenClaw LoRA) L2 Coding 管代码、SWE、终端 L3 UI/A2UI 管UI4A渲染和操作 至于为什么要拆成好几个 LoRA,他们的想法是:这些能力的思考流程差太远,全塞进一套 post-training 权重会互相干扰。MoL 让相似的技能共用一个 LoRA,差太多的各自单独训,再路由、组合;新增领域就加一个 adapter。 等 adapter 多起来,再让它们分工、组合、投票,就是他们所说的群体智能。 这条路也不是 Mind Lab 首创,John Schulman(OpenAI 联创、Thinking Machines首席科学家)那篇《LoRA without Regret》就是同一个方向。但全球能开万亿参数模型 RL 训练的 infra,目前就 Mind Lab 和 TML 两家。 不过Mind Lab是直接用国内最好的开源模型,最早2025年底在万亿参数Kimi K2上验证过RL后训练,Preview用GLM-5.1、Venti用GLM-5.2、Tall用Qwen-3.7-35b。拿这些现成的强基座来做,比 TML 从头做 Inkling 会更快(Inkling 现在的表现也明显还打不过 GLM 和 Kimi)。 商业化也很快:据团队披露,7 月启动商业化后2周达到 1000 万美元 ARR。 其实我会关注 Macaron-V1,很大一个背景是持续学习这个方向本身。 持续学习想解决的,是模型部署之后就不再进化这个老问题,让它能在真实使用里边用边学。 这方向最近越来越多重量级的人在点名。之前强化学习之父 Sutton 和 David Silver 提出“the era of experience”,说下一代 AI 拼的不再是喂数据,是从真实经历里持续学,他自己也去创业做了 Oak Lab 专攻这个。梁文锋最近四小时闭门会流出来,他给 DeepSeek 排的路线是 CoT → Agent → 持续学习,还说下一代模型不能持续学习,就不配叫下一代。 Macaron-V1 至少证明了这条路能工程化、也能商业化跑通。这种方向靠一两家撑不起来,挺期待接下来更多团队砸进来、多拿几个硬成果。真卷起来,应该会挺有意思。
显示更多