我越来越确定,模型能力的下一次质变不是 benchmark 分数,而是主动性。
Fable 和 Astra 这类模型跟上一代前沿模型之间的真正差距,不是指令执行能力,而是会不会在没有指令的情况下自己决定做什么。
上一代模型:你指定目标,它执行得又快又准。
新一代模型:还没等你开口,它已经在扫描环境、评估选项。
这个差异在安全假设上是地震级的。
当模型只是执行者,安全边界卡在 prompt 层就够了。
当模型有主动性,安全边界必须下沉到行为约束层。
一个能按指令黑掉目标的模型,和一万个能自主选择攻击目标的模型,是完全不同的威胁模型。
如果你还在用执行者的假设去部署 agent 级模型,问题不是会不会出事,是你已经出事了但还没发现。
顯示更多