Fable5的动态工作流规划能力和长程任务能力非常惊艳,模型本身训练已经带上了这些目标,做任务的时候,也很能感受到这个模型对 unknown unknown 的把控力。
这背后是前沿 AI 模型的训练目标,正在从让模型变聪明转向让模型会干活。
Fable5被明确设计为能够自主工作数小时甚至数天、分阶段规划、派发子任务给内部 agent、自我验证输出结果、在百万 token 上下文中始终保持注意力的系统。
这也不是 Anthropic 一家在走的路,把最近几个月的模型发布串起来看,所有实验室都在往同一个方向收敛。
DeepSeek V4 Pro 的训练管线是典型的例子:先用 SFT 加 GRPO 强化学习对每个领域独立培养专家能力,再通过 on-policy 蒸馏将所有领域的专长统一融合进一个模型。同时提供 Non-Think、Think High、Think Max 三种推理模式,让用户根据任务复杂度在延迟和深度之间做取舍。1.6万亿参数 MoE 架构,百万 token 上下文,10到12倍便宜于 GPT-5.5的价格。它的训练方法已经明确针对 agentic coding 和长程推理做了优化。
即将公布的GPT-5.6更进一步,OpenAI 用强化学习训练三个独立变体(Sol、Terra、Luna),让模型通过生成长 deliberation trace 来推理后再输出。Sol 甚至有一个 ultra 模式,会自主派生出多个子 agent 来并行处理多步骤任务的不同部分。
把这些拼在一起,能看到一条非常清晰的趋势线:
前 Qwen 技术负责人林俊旸回顾了 Qwen3混合思考模式(thinking/non-thinking 切换)的教训:思考模式和指令模式在训练目标上天然冲突,强行让一个模型两者兼顾,结果是两边都不够好。所以后续版本直接拆成了 Instruct 和 Thinking 两个独立变体。
但他更核心的判断是:AI 领域正在从训练模型转向训练 Agent。他把传统的推理思考(o1、DeepSeek-R1那种,依赖数学和代码的确定性奖励信号)和 Agent 思考区分开来,Agent 需要在交互式环境中制定计划、调用工具、根据反馈修正行动。后者的训练基础设施挑战大得多:要解耦训练和推理,要优化环境质量而不是数据多样性。
这就回到了 Dario Amodei 反复讲的那个最朴素的原理:AI 模型能力根本上取决于参数规模和输入数据。从这个角度看,LLM 行业确实没有天然护城河,训练方法在收敛,开源社区在追赶,算法创新很快就会被复制。
Anthropic 自己内部的数据也很说明问题,2023年收入从0到1亿美元,2024年到10亿,2025年到90-100亿,每年十倍增长。但 Dario 自己也在说“我们接近指数的终点”——当所有玩家的训练方法论趋同,真正的壁垒只剩下算力获取能力和生态锁定效应。
所以 Fable5让人兴奋的是它展示了一种新的模型行为模式:不需要外部脚手架告诉它一步步怎么做,它自己就能把一个大任务拆开、执行、纠错、完成。这种能力的来源是训练阶段就刻进模型权重里的目标函数。
当训练模型的思路和训练 Agent 的思路开始重叠,我们看到的就不再是一个更聪明的问答系统,而是一个真正能在现实工作流里接管长程任务的执行体。
显示更多