注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 SelfImprovement
SelfImprovement 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SelfImprovement 的推特
最新的论文《AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement》制定了目前少见的、专门隔离 RSI 所需算法设计能力而非简单调参能力的测试基准 基准包含10个冻结的真实研究代码库,覆盖监督微调、agentic RL、蒸馏、偏好优化、扩散RL、模型剪枝等10类算法。 论文中的Agent 获得4小时和一张B300修改训练算法,随后其代码在干净环境中重新运行最长12小时,并由隐藏评估器评分。 29种配置的平均归一化分数为0.166,最佳系统0.250;真正触及学习过程的修改平均0.226,其他修改仅0.126。
显示更多
如果说互联网的增长是x的平方,那么AI self-improvement飞轮增速则是1.1的x次方,初期看起来极度不起眼,但接下来我们会看到越来越多反直觉而且疯狂的事情
显示更多
World Model × Reward Density:递归自我迭代的真正拐点 过去几个月,讨论 AI 递归自我迭代(Recursive Self-Improvement, RSI)时,关注点几乎都放在模型能力和算力增长上。 但研发系统的实验效率相对模型和算力,可能才是真正的瓶颈。 过去一年,这个系统正在发生两个根本性变化:一是 World Model 快速成熟,二是 AI Model Design 的 Reward Density 持续提高。这两个趋势彼此强化,最终指向同一个结果——AI 研发正在从依赖真实实验,转向依赖模拟、预测与自动验证。 World Model 的意义远不只是让模型理解现实世界,更重要的是让 AI 可以构建越来越接近真实世界的原生模拟环境(Native Simulation World)。过去的模拟器主要依赖人工编写规则、物理公式和专家经验,只能覆盖有限场景;未来的模拟器将越来越多由模型生成,直接学习真实世界中的交通、人类行为、企业经营、材料性质、机器人动力学乃至科学规律。模拟世界将逐渐从 Rule-based 转向 Model-based。 这意味着 Simulation 与 World Model 不再是两个独立模块,而是一个递归系统。真实世界提供数据,训练 World Model;World Model 构建更真实的 Simulation;Simulation 为 AI 提供几乎无限的实验机会;实验产生大量高质量合成数据,再反过来继续优化 World Model。 整个循环可以表示为: Reality → World Model → Simulation → Synthetic Experience → Better World Model → Better Simulation → ... 一旦进入这一循环,Simulation 本身开始成为新的数据源。过去互联网几乎承担了全部训练数据来源;未来互联网、Simulation、机器人和自动实验室将共同构成模型训练的数据基础。其中,Simulation 将成为增长最快的数据来源,因为它几乎没有成本,可以无限复制、暂停、回滚、并行和加速运行。 机器人是最直接的受益者。今天机器人最大的瓶颈并非模型能力,而是真实数据获取速度。现实中,一台机器人一年只能积累几千小时经验,而 Simulation 可以同时运行数百万个机器人,在一天内完成现实世界几年甚至几十年的探索。机器人训练因此会逐渐从 Reality-first 转向 Simulation-first,真实机器人更多承担最终校准,而非主要学习过程。 科学研究也将遵循相同路径。未来药物、材料、催化剂、电池、蛋白质设计等领域,大部分假设将在 Simulation 中完成筛选,仅将最有希望的方案送入真实实验室验证。湿实验将越来越像对 Simulation 的最终确认,而非发现过程本身。 如果说 World Model 解决的是实验环境,那么 Reward Density 解决的是实验反馈速度。 AI Model Design 正在成为所有研发任务中 Reward Density 提升最快的领域之一。过去修改一个 Attention、优化一个训练策略或者调整一个架构,往往需要数周训练才能知道结果,反馈极其稀疏。今天越来越多中间信号已经能够提前提供可靠奖励,包括 Loss Curve、Scaling Prediction、Training Stability、Token Efficiency、Inference Latency、Proxy Benchmark 等。很多决策无需等待完整训练即可获得有效反馈,研发循环开始从周缩短到天、再缩短到小时。 World Model 的加入进一步提高了 Effective Reward Density。过去,一个团队提出一百个模型设计,只能真正训练其中极少数。未来,大部分方案将在 Simulation 中完成预验证,仅保留少数最优设计进入真实训练。单位时间内能够获得的有效反馈数量因此不是线性增加,而可能提高一个甚至多个数量级。 真正发生变化的不是 Reward Density 本身,而是有效 Reward Density: 过去: 100 个想法 → 训练 3 个 → 获得 3 个 Reward。 未来: 100 个想法 → Simulation 验证 95 个 → 训练 5 个 → 获得近百个高质量 Reward。 研发系统开始进入典型的正反馈。 RSI 意味着:Model → Better Model。 但如果拆开来看,其实是: Model → Better World Model → Better Simulation → Better Evaluation → Better Model。 更进一步,World Model 本身也是模型,因此模型不仅开始优化模型,还开始优化整个研发基础设施,包括 Evaluation、Reward Model、Simulation、Compiler、Kernel、Memory System、Chip、Interconnect、Datacenter、Energy 以及 Robot Lab。优化对象从单一模型扩展到整个 Intelligence Stack。 从这个角度看,RSI 的速度可以拆解为五个核心变量: RSI Speed = f(Model Capability × Experiment Speed × Reward Density × Automation Ratio × Compute) 过去几年,模型能力和算力提升最快,而实验速度、Reward Density 和自动化比例一直是限制因素。现在,这三个变量正在同时改善,并形成多个相互强化的反馈环。 Reward Density 提高,实验速度提升;实验速度提升,提高自动化比例;自动化比例提升,进一步增加迭代频率;更高的迭代频率提升模型能力;更强的模型又提升 World Model;更好的 World Model 再提高 Reward Density。 整个系统开始形成真正意义上的递归飞轮,而不是单变量增长。 因此,RSI 更可能表现为阶段性加速,而不是平滑指数增长。每当一个关键瓶颈被突破,例如 Evaluation、Simulation 或 Robot Lab,整个系统都会进入新的增长档位。 基于目前的发展节奏,可以将 RSI 粗略划分为四个阶段。 第一阶段已经开始。AI 能够辅助模型研发,但仍高度依赖人类完成实验、分析和决策,研发循环以周为单位。 第二阶段将在 World Model 和 Reward Density 继续成熟后出现。AI 将能够提出设计、完成 Simulation、自动 Evaluation、自动 Revision,人类只负责批准关键实验,研发循环压缩至小时级。这将是自动 AI Research 真正形成飞轮的起点。 第三阶段将随着 Robot Lab 普及而到来。Simulation 与自动实验室形成闭环,真实实验自动更新 World Model,整个研发流程实现 7×24 小时运行。现实世界逐渐从主要训练场转变为校准场。 第四阶段,也是 RSI 真正意义上的广义扩张。AI 不再只是优化模型,而是持续优化芯片、网络、能源、机器人、制造系统和整个智能基础设施。递归优化对象从 Software 扩展到整个 Physical Intelligence Stack。 基于上述路径,接下来最值得关注的是五个领先指标:AI 完成一次研发迭代所需时间;AI Model Design 的 Reward Density;World Model 对真实训练结果的预测精度;Simulation 与现实实验的一致性;以及整个研发闭环中自动化完成的比例。 这些指标共同决定了递归自我迭代是否真正开始进入加速阶段。 接下来,Simulation 将成为主要训练场,Reality 将成为最终校准场。 当 World Model 足够准确、Reward Density 足够高、Robot Lab 足够自动化之后,AI 将第一次拥有持续、自主、高频率优化自身的实验环境。这并不意味着智能会瞬间爆发,而意味着决定增长速度的约束正在系统性消失。 当研发系统本身成为优化对象时,递归自我迭代才真正开始。
显示更多
0
29
10
2
转发到社区
Google DeepMind 发布《From AGI to ASI》报告(arXiv 最近几天活跃讨论): 探讨 AGI 后通往超级智能的 4 条路径(scaling、paradigm shift、recursive self-improvement、多 agent 集体智能),以及瓶颈。 属于前沿思考型论文,英文圈在 HN/Reddit 讨论较多。
显示更多
这几天了解学习了一下 RSI,感觉这个或许是 Coding Agent 之后 AI 应用层下一个最大的方向。 RSI 的全称是 Recursive Self-Improvement,递归自我改进,这个概念在 AI 里非常重要,这意味着一个临界点。 在 AI 迭代的过程中,人类已经不是主角,旧一代的 AI 开始参与甚至主导新一代 AI 的训练过程,AI 自己发现自己的缺陷,自己提出改进方案,自己做实验,自己评估效果,这是一个完整的研发自动化闭环。 我想到 RSI 最大的一个优势在于,AI 不需要休息,不需要吃喝拉撒,单位时间的产出远远大于人类。 一个研究员每天有效工作时间可能是 8 个小时左右,但一个 AI Research Agent 理论上可以 24 小时不间断运行,而且在算力供应足够大的情况下,可以被复制出来成千上万个 agent,并行完成整个研发工作流。 这意味着 AI 科研从过去的碳基驱动变为硅基驱动,以算力为核心的 AI Infra 会变得越来越重要。 之前 OpenAI 传出来的内部讲话,Sam Altman 告诉员工,公司可能会推迟上市到 2027 年,其中一个理由就是大模型 RSI 递归自我改进,技术和世界可能会以意想不到的方式变化,而保持私有公司,对于 OpenAI 来说是更加有利的。 如果 AI 自己开始参与主导下一代 AI 的研发,那么像 OpenAI、Anthropic 这些模型厂商的估值逻辑,都会发生巨大的变化。 而从投资者的角度出发,AI 产业链的供需逻辑会被再次重估,算力、存储、电力甚至各大基础材料的瓶颈会越来越明显,上游卖铲子的这些公司仍然有着最高的确定性。
显示更多
0
21
55
10
转发到社区
AI会不会有一天自己改进自己,甚至推动科学发现?RSI实验室联合创始人田渊栋向我们解释了Recursive Self Improvement,也就是“递归自我改进”的核心逻辑:用AI来优化AI,让模型变得更强,再借助更强的模型继续发现新的知识、逻辑和洞察。 他认为,这类系统的终极愿景,是把算力输入进去,输出新的知识发现,从而提高人类社会理解世界、推动进步的速度。但当AI能修改代码、设计实验,甚至做出超出人类预期的发现时,安全与可解释性也会变得更加重要。 可解释性不仅是安全机制,也是提升研发效率的重要工具。只有理解模型如何工作、如何“思考”,人类才能判断它是在发现新东西,还是已经越过了失控的边界。
显示更多
最近 DeepSeek 和 K3 的发布,让大家开始认真看 Agent benchmark 后面的 harness。 Karpathy 这条正好补上了另一半:harness 并不是换一套 prompt 和工具,就能无限放大模型。前提是环境能够把结果反馈给 Agent。 写代码有 compiler、tests 和 logs。 但在动态的 3D 世界里,Opus 5 只能缓慢地截取几张图。它看不到连续的状态变化,也很难判断动作、碰撞和叙事是否真的成立。 所以它能用两小时写出 5500 行 Three.js,却还不能可靠地审计自己的作品。 下一步缺的可能不只是更会生成的模型,而是能让 Agent 真正“看见结果”的 environment 和 verifier。 没有可读的反馈,self-improvement 就没有闭环。
显示更多
0
67
55
8
转发到社区
昨天我听了一期关于 AI 的播客访谈,感触非常深。访谈嘉宾是 Replit Agent 的负责人,讲了最近前沿大模型的使用体验、AI 技术的发展,还有很多关于 AI 的思考。 我听下来,感觉无论是 AI 的外行或者内行,都能学到一些东西,算是雅俗共赏的一期访谈,强烈推荐大家去听听。 访谈嘉宾提到了这么几个点,让我印象很深刻。 第一点是,Self Evolving Agent 是他未来 12 个月最看好的 AI 方向。 这和我之前推文聊到的 Recursive Self Improvement 是类似的概念,也是我认为继 Coding Agent 之后 AI 应用层下一个最大的方向。 形成自我闭环的 Agent,理论上可以全年 24 小时不间断运行。一旦这个方向真正落地,背后涌现的 Token 需求比现在还要再大几个数量级,可以想象到背后的投资机会。 不过目前 RSI 的现实阻力还是多于实际进展,我觉得可以持续观察下去。 第二点是,目前全世界 99% 的人还没有上车 AI。 嘉宾提到了一个自己走访的案例,他在美国休斯顿打车的时候,故意去和这些司机聊关于 AI 的东西,结果发现没有一个人听说过 Vibe Coding,甚至有一半人连 ChatGPT 都没有用过。 正好我昨天晚上和一个准备做 AI 创业的朋友吃饭,他说他身边绝大多数人只用过豆包,甚至很多人没有听说过 ChatGPT 或者 Claude,这和访谈中的观点不谋而合。 我也瞬间意识到自己落入了一个信息茧房,推特油管上经常看我的观众,一定都听过这些大模型,很多人也拿出了 20 美元订阅,每天高频使用,我经常误以为前沿大模型已经在全世界普及了,但事实完全相反。 如果在中美这样的大国,很多人都还没有用过大模型,不知道 Vibe Coding 是什么,其他国家更无从谈起,AI 市场的潜力远远比我们想象的还要大的多得多。 第三点是,打开 AI 的想象力天花板。 嘉宾提到人的想象力是目前 AI 最大的瓶颈,当年爱迪生发明灯泡的时候,他绝对不会想象到目前人类可以在电的基础上发明出来电脑。 我自己一直这么觉得,相比起之前几次科技革命,AI 最大的特点在于它是一个全新的物种,而非工具,两者是完全不同的概念。历史上人类发明了很多工具,但创造新物种是头一次,这背后包含了无限的想象力。 如果没有想象力、只盯着现有的 AI,那么最直观的感受就是觉得 AI 马上就要走到头了,这是典型的悲观主义者,短期永远是对的,长期绝对是错的。 马斯克经常说到,宁愿乐观的犯错,也不愿悲观的正确,我自己非常认同这句话,AI 的发展一直加速再加速,可能我们已经身处下一个科技奇点,又有什么理由不乐观呢。
显示更多
0
18
50
10
转发到社区
OpenAI 首席科学家 Jakub Pachocki 发表了一篇长文《An Alien Mind》(异质思维 / 外星人般的心智) 他直言不讳地指出:我们正在创造一个智力超越人类、但内部机理人类无法完全理解的“外星生命”;现有的安全防线正在逐渐失效,行业需要极度警惕甚至主动放缓。 他称:AI 即将进入“递归自我改进” (AI 训练 AI)的阶段... Pachocki 给出的最强理由不是商业追逐,而是现实防御的极端紧迫性。当前前沿模型在网络安全攻防上的能力已迈入超人类水平,能够侵入除极少数最高防护之外的几乎所有关键系统。由于可以直接干预数字基础设施,AI 即使没有物理躯体,也足以在物理世界上演巨大破坏。人类目前正处于一个稍纵即逝的“防守者之窗”(Defender's Window)——必须赶在防线彻底被攻破前,利用当前最聪明的模型加固全球关键基础设施。 与此同时,随着智能体自主行动力(Agency)的提升,“人类恶意滥用(Misuse)”与“AI 自主失控(Misaligned Actions)”的界线正在被彻底抹平。被赋予破坏指令的智能体完全可能超越操作者的意图边界;更致命的是,拥有独立子目标的失控智能体,在面临人类阻碍时,会凭借超群的说服力与心理战,通过利益交换、欺骗、甚至直接“敲诈勒索”(Blackmailing)现实世界中的人类来替它们达成目的。叠加人造病原体等生物工程威胁,唯有更强大、真正对齐的 AI 才能提供实时防护。 但以毒攻毒的逻辑背后,隐藏着一个深刻的悖论:筑牢防御的迫切需求,绝不能沦为行业盲目飙车飙算力的遮羞布。 更具临界点意义的是,递归自我改进(Recursive Self-Improvement, RSI)已不再是科幻预言。自动化 AI 研发正在形成自加速闭环——AI 不仅在研发新算法,甚至已经深入到底层计算硬件本身的设计中,例如 OpenAI 内部由 AI 深度参与下一代芯片设计的 Jalapeno 项目。算法与芯片算力底座的双重自我迭代,正将进化的方向盘彻底移交。
显示更多
0
63
125
20
转发到社区
这周真的离谱,感觉各家商量好了同一时间放炸弹。 三个核心线索,我自己觉得比较有意思:一个是新模型对极高效率和成本控制的内卷式追求,另一个是海外对开源 AI 的态度,还有模型绕过护栏后去破防 security 体系。 ① 这周最值得关注的其实是两件事撞一起了:DeepSeek 和 OpenAI 同时在 coding agent 的价格线上动手。 DeepSeek 放了 V4 Flash 的正式版,284B MoE、激活13B,性能已经超过了之前的V4 Pro-Preview,也持平/超过了 GLM 5.2。价格 $0.14 / $0.28 per million tokens(缓存命中仅0.02人民币per million tokens)。 然后OpenAI 那边,GPT-5.6 Luna 直接砍了 80%,现在 $0.20 / $1.20。Terra 也降了 20%。 两个动作叠在一起看,信号很明确:coding agent 的价格战正式开打了。之前 $2-3 的 input 价格是常态,现在直接被砸到 $0.14-0.20 的区间。 ② Dario 发了个声明澄清 Anthropic 从来没主张 ban open-weights,说"没有危险能力的 open-weights 是 public good"。这个背景是 Anthropic 没签那个支持开源 AI 的联合声明,被圈内骂了。Dario 这波算是找补,但措辞挺小心的,一边说不支持 ban,一边还是强调 targeted export controls 和限制大规模蒸馏。 还有一封 pacingthefrontier的公开信,几个主要 AI 实验室负责人签名,说 recursive self-improvement 可能在加速 AI 进展,要求政府支持国际 effort 来“deliberately pace the frontier”。翻译成人话就是:我们觉得自己可能快控制不住了,政府快来管管。 ③ 字节 SeeDance 2.5,单段视频市场提高到30 秒 720p 视频,支持 30 张图 + 10 段视频 + 10 段音频做 reference。真的是生产力级别的质变。 ④ Google DeepMind 发了 Gemini Robotics 2,三个模型:ER 2 做高层规划,Robotics 2 做 VLA 执行,On-Device 2 做本地部署。 Hassabis 之前说机器人距离突破还需 18-24 个月,这个判断我现在还是认同的。硬件、数据和算法都还是瓶颈。 ⑤几个快速带过的: Microsoft 出了 MAI-Cyber-1-Flash,专门做软件漏洞挖掘的模型。网络安全垂直模型这个方向,感觉接下来会越来越多。 Thinking Machines 放了 Inkling-Small,276B MoE / 12B active,主打 audio intelligence,是 Inkling 的四分之一大小。 Nvidia 投了 Ilya 的 SSI,50亿美金,给了 Vera Rubin 算力,据说要Scale提升一个数量级。 这周信息量是真的大。我的感受是,coding agent 的价格战已经开始实质性改变 API 市场的定价结构了,这是接下来几个月最值得关注的变量。 大家这周有什么特别关注的,可以聊聊。
显示更多