对于科技成长股,最大的逻辑思维紧箍圈,就是mean revision, 均值回归,因为科技改变,产业链、商业逻辑完全进化,这种思维,会完全让大家成功避开整个AI 牛市。
但不代表不看估值和入市时机。
显示更多
《用 CPV 模型预测 AI 技术演进》
过去几年,AI 领域几乎每天都有新概念出现。
Prompt Engineering、RAG、Memory、Agent、MCP、J-space、Tool Use、World Model……
大多数讨论都围绕一个问题展开:
下一个热点是什么?
我更关心另一个问题:
为什么热点会依次出现?
如果一种理论只能解释已经发生的事情,它的价值有限;真正有价值的理论,应该能够预测未来。
CPV(Cognitive Positioning Value)提供的,正是这样一种视角。
它关注的不是某项技术,而是反馈最终作用到了系统的哪一层。
⸻
AI 的发展,本质上是反馈不断向深层沉淀
CPV 将反馈划分为五个层级:
CPV1:行为(Action)
CPV2:状态(State)
CPV3:模型(Model)
CPV4:结构(Structure)
CPV5:边界(Boundary)
越往下,反馈改变的对象越深。
AI 技术的发展,几乎就是沿着这五层不断推进。
⸻
CPV1:改变输出
这一阶段的代表是 Prompt Engineering。
Prompt 改变输入。
模型改变输出。
任务结束,一切恢复原状。
模型没有成长。
它只是完成了一次推理。
后来出现的 Prompt 自动优化、思维链(Chain of Thought)、提示模板,本质上仍然属于这一层。
它们提高了完成任务的能力,却没有改变模型本身。
⸻
CPV2:改变状态
随后,人们发现一个新的问题:
模型什么都记不住。
于是,Memory 出现了。
长期记忆、用户画像、上下文管理、会话历史……
反馈终于开始影响模型的运行状态,而不是一轮对话。
模型开始拥有“今天的自己”。
但这里仍然存在明显的局限。
Memory 越来越长。
越来越混乱。
越来越互相矛盾。
于是,新的结构压力出现了。
⸻
CPV3:改变模型
真正的成长,不应该只是不断累积记忆。
而应该修改世界模型。
例如:
昨天认为用户喜欢苹果。
后来连续半年都选择安卓。
系统不应该同时保存两条冲突的信息,而应该形成新的理解:
用户真正偏好的是开放生态。
这里发生变化的已经不是 Memory,而是模型本身。
未来的 AI 一定会越来越重视:
记忆巩固(Memory Consolidation)
经验抽象(Experience Abstraction)
世界模型更新(World Model Revision)
它们共同指向同一个方向:
反馈开始改变模型,而不是继续堆积数据。
⸻
CPV4:改变结构
随着模型越来越复杂,另一个瓶颈出现了。
一个网络承担所有能力,越来越低效。
于是开始出现:
Planner。
Executor。
Memory。
Vision。
Reflection。
Safety。
它们逐渐成为不同的功能模块。
MoE、Tool Use、Agent、MCP、多智能体协作,都可以看作这一趋势的不同表现。
未来 AI 更像一个组织。
而不是一个越来越大的 Transformer。
反馈开始重组系统结构。
⸻
CPV5:改变边界
这是最深的一层。
今天,人们谈论 AI,通常想到的是:
一个模型。
未来,AI 的边界会不断扩展。
浏览器。
手机。
电脑。
机器人。
汽车。
摄像头。
传感器。
云端。
其他 Agent。
这些都会成为 AI 系统的一部分。
到那个时候,我们讨论的不再是一个模型,而是一个持续运行的智能系统。
它的边界不断重新定义。
人与 AI 的关系也会随之改变。
⸻
为什么 CPV 能预测未来?
因为每一层都会产生新的结构压力。
Prompt 足够成熟之后,系统开始需要记忆。
记忆足够丰富之后,系统开始需要学习。
模型足够复杂之后,系统开始需要重新组织。
结构足够完善之后,系统开始突破自身边界。
技术演进并不是热点随机切换。
而是上一层已经无法继续承载反馈。
新的层级因此诞生。
这是一种复杂系统普遍存在的演化规律。
⸻
J-space 给了我们一个验证
Anthropic 最近公开的 J-space 研究,让人们第一次能够观察模型内部的工作空间。
很多人关注的是:
AI 是否拥有了类似意识的东西。
我关注的是另一件事。
J-space 解释的是:
AI 此刻如何思考。
CPV 解释的是:
AI 为什么会演化到下一阶段。
两者回答的是不同的问题。
前者研究计算过程。
后者研究反馈如何不断向更深层沉淀。
它们并不冲突。
反而共同构成了一幅更完整的智能演化图景。
⸻
一个理论真正的价值
未来几年,还会不断出现新的技术名词。
也许叫 Workspace Editing。
也许叫 Self Evolution。
也许叫 Autonomous Organization。
名字会不断变化。
但如果这些技术仍然停留在同一层反馈,它们只是同一类问题的不同实现。
真正值得关注的,不是名字。
而是它让反馈深入了哪一层。
能够回答这个问题,才能真正理解 AI 为什么会这样发展,以及下一次技术跃迁会发生在哪里。
CPV 的意义,不在于解释某一项 AI 技术。
它试图描述的是:
所有能够持续学习的复杂系统,都遵循着同一种反馈演化规律。
因此,它不仅可以解释 AI,也可以预测 AI。
显示更多
如果说 Nature、Science、Cell 是理工医科的无上圣殿,那么 UTD-24 就是世界商科自成一派的幻之神坛。
在北美顶级商学院,比如Wharton, Sloan,Chicago Booth, Stanford,Harvard,或者国内的清华经管、清华五道口、北大光华、北大汇丰、复旦管院、上交高金,上交安泰,一个青年学者想拿到终身副教授,系统不看Ta拿了多少国家项目,也不看Ta教书多受欢迎,在这个列表里有几篇发文,才是十分重要的关键因素。
北美的残酷标准是在六年考核期内,通常需要发 4-6 篇 UTD-24。
少一篇,可能直接解雇。
国内顶尖高校标准是,很多C9高校的商学院,只要你能以第一作者(或通讯作者)发出一篇 UTD-24,直接可以用来评正教授,或者拿到几十万不等的现金重奖。
UTD-24 里的期刊,每年的整体录用率常年控制在 3% 到 5% 左右。
审稿周期长到脱水。
从投递、初审、Major Revision、二审、三审……到最终接收,耗时 3 到 5 年 是家常便饭。
很多博士生在读博第一年投出去的文章,毕业工作好几年了才被录用。
常年霸榜前三的通常是宾大沃顿商学院(Wharton)、纽约大学斯特恩商学院(Stern)这些顶级怪兽,他们一年能发几十甚至上百篇。
而国内除了解放军式的清北复交等极少数头部院校能挤进全球前100之外,绝大多数普通高校商学院,全院教授加起来,一年的产出可能是 0。
只是,对于绝大多数普通人类、甚至对于99%的现实商业世界来说,UTD-24 几乎毫无卵用。它就是高等教育全球化之后,象牙塔内部演化出的一场高智商、高内耗的无限游戏。
我读商科论文,更多的以自娱自乐为主。商科的本质应该是解决现实中的管理、金融和市场问题。但 UTD-24 里的很多文章,已经彻底走上了极度数学化、微观化、理论化的死胡同。
而且,一篇典型的 UTD-24 论文,从构思到发表要折腾5年。5年前推导的电商模型,在5年后的互联网早就变成了历史文物。
它的读者是谁?
不是CEO,不是创业者,而是下一位准备投这家期刊的大学教授。
它唯一的价值,就是作为参考文献,被塞进下一篇同样没人读的 UTD-24 论文里。
毕竟,学校靠这个数据去排 Financial Times 或者 U.S. News 的名次,名次高了就能招来MBA 学生、拿到更多的校友捐款。
然后,用这些钱去挖能发 UTD-24 的论文机器。
这是一个完美的资本与名誉的闭环。
但这个闭环,大概率会把把真正的社会价值挡在了门外。
显示更多
World Model × Reward Density:递归自我迭代的真正拐点
过去几个月,讨论 AI 递归自我迭代(Recursive Self-Improvement, RSI)时,关注点几乎都放在模型能力和算力增长上。
但研发系统的实验效率相对模型和算力,可能才是真正的瓶颈。
过去一年,这个系统正在发生两个根本性变化:一是 World Model 快速成熟,二是 AI Model Design 的 Reward Density 持续提高。这两个趋势彼此强化,最终指向同一个结果——AI 研发正在从依赖真实实验,转向依赖模拟、预测与自动验证。
World Model 的意义远不只是让模型理解现实世界,更重要的是让 AI 可以构建越来越接近真实世界的原生模拟环境(Native Simulation World)。过去的模拟器主要依赖人工编写规则、物理公式和专家经验,只能覆盖有限场景;未来的模拟器将越来越多由模型生成,直接学习真实世界中的交通、人类行为、企业经营、材料性质、机器人动力学乃至科学规律。模拟世界将逐渐从 Rule-based 转向 Model-based。
这意味着 Simulation 与 World Model 不再是两个独立模块,而是一个递归系统。真实世界提供数据,训练 World Model;World Model 构建更真实的 Simulation;Simulation 为 AI 提供几乎无限的实验机会;实验产生大量高质量合成数据,再反过来继续优化 World Model。
整个循环可以表示为:
Reality → World Model → Simulation → Synthetic Experience → Better World Model → Better Simulation → ...
一旦进入这一循环,Simulation 本身开始成为新的数据源。过去互联网几乎承担了全部训练数据来源;未来互联网、Simulation、机器人和自动实验室将共同构成模型训练的数据基础。其中,Simulation 将成为增长最快的数据来源,因为它几乎没有成本,可以无限复制、暂停、回滚、并行和加速运行。
机器人是最直接的受益者。今天机器人最大的瓶颈并非模型能力,而是真实数据获取速度。现实中,一台机器人一年只能积累几千小时经验,而 Simulation 可以同时运行数百万个机器人,在一天内完成现实世界几年甚至几十年的探索。机器人训练因此会逐渐从 Reality-first 转向 Simulation-first,真实机器人更多承担最终校准,而非主要学习过程。
科学研究也将遵循相同路径。未来药物、材料、催化剂、电池、蛋白质设计等领域,大部分假设将在 Simulation 中完成筛选,仅将最有希望的方案送入真实实验室验证。湿实验将越来越像对 Simulation 的最终确认,而非发现过程本身。
如果说 World Model 解决的是实验环境,那么 Reward Density 解决的是实验反馈速度。
AI Model Design 正在成为所有研发任务中 Reward Density 提升最快的领域之一。过去修改一个 Attention、优化一个训练策略或者调整一个架构,往往需要数周训练才能知道结果,反馈极其稀疏。今天越来越多中间信号已经能够提前提供可靠奖励,包括 Loss Curve、Scaling Prediction、Training Stability、Token Efficiency、Inference Latency、Proxy Benchmark 等。很多决策无需等待完整训练即可获得有效反馈,研发循环开始从周缩短到天、再缩短到小时。
World Model 的加入进一步提高了 Effective Reward Density。过去,一个团队提出一百个模型设计,只能真正训练其中极少数。未来,大部分方案将在 Simulation 中完成预验证,仅保留少数最优设计进入真实训练。单位时间内能够获得的有效反馈数量因此不是线性增加,而可能提高一个甚至多个数量级。
真正发生变化的不是 Reward Density 本身,而是有效 Reward Density:
过去:
100 个想法 → 训练 3 个 → 获得 3 个 Reward。
未来:
100 个想法 → Simulation 验证 95 个 → 训练 5 个 → 获得近百个高质量 Reward。
研发系统开始进入典型的正反馈。
RSI 意味着:Model → Better Model。
但如果拆开来看,其实是:
Model → Better World Model → Better Simulation → Better Evaluation → Better Model。
更进一步,World Model 本身也是模型,因此模型不仅开始优化模型,还开始优化整个研发基础设施,包括 Evaluation、Reward Model、Simulation、Compiler、Kernel、Memory System、Chip、Interconnect、Datacenter、Energy 以及 Robot Lab。优化对象从单一模型扩展到整个 Intelligence Stack。
从这个角度看,RSI 的速度可以拆解为五个核心变量:
RSI Speed = f(Model Capability × Experiment Speed × Reward Density × Automation Ratio × Compute)
过去几年,模型能力和算力提升最快,而实验速度、Reward Density 和自动化比例一直是限制因素。现在,这三个变量正在同时改善,并形成多个相互强化的反馈环。
Reward Density 提高,实验速度提升;实验速度提升,提高自动化比例;自动化比例提升,进一步增加迭代频率;更高的迭代频率提升模型能力;更强的模型又提升 World Model;更好的 World Model 再提高 Reward Density。
整个系统开始形成真正意义上的递归飞轮,而不是单变量增长。
因此,RSI 更可能表现为阶段性加速,而不是平滑指数增长。每当一个关键瓶颈被突破,例如 Evaluation、Simulation 或 Robot Lab,整个系统都会进入新的增长档位。
基于目前的发展节奏,可以将 RSI 粗略划分为四个阶段。
第一阶段已经开始。AI 能够辅助模型研发,但仍高度依赖人类完成实验、分析和决策,研发循环以周为单位。
第二阶段将在 World Model 和 Reward Density 继续成熟后出现。AI 将能够提出设计、完成 Simulation、自动 Evaluation、自动 Revision,人类只负责批准关键实验,研发循环压缩至小时级。这将是自动 AI Research 真正形成飞轮的起点。
第三阶段将随着 Robot Lab 普及而到来。Simulation 与自动实验室形成闭环,真实实验自动更新 World Model,整个研发流程实现 7×24 小时运行。现实世界逐渐从主要训练场转变为校准场。
第四阶段,也是 RSI 真正意义上的广义扩张。AI 不再只是优化模型,而是持续优化芯片、网络、能源、机器人、制造系统和整个智能基础设施。递归优化对象从 Software 扩展到整个 Physical Intelligence Stack。
基于上述路径,接下来最值得关注的是五个领先指标:AI 完成一次研发迭代所需时间;AI Model Design 的 Reward Density;World Model 对真实训练结果的预测精度;Simulation 与现实实验的一致性;以及整个研发闭环中自动化完成的比例。
这些指标共同决定了递归自我迭代是否真正开始进入加速阶段。
接下来,Simulation 将成为主要训练场,Reality 将成为最终校准场。
当 World Model 足够准确、Reward Density 足够高、Robot Lab 足够自动化之后,AI 将第一次拥有持续、自主、高频率优化自身的实验环境。这并不意味着智能会瞬间爆发,而意味着决定增长速度的约束正在系统性消失。
当研发系统本身成为优化对象时,递归自我迭代才真正开始。
显示更多