这几天关于 Anthropic 的一个最新发现讨论度很高。
据 A 社研究表明,他们在 Claude 里找到了一组内部神经模式,叫 J-space。
它像一个很小的内部工作区。某个词相关的模式被点亮时,不代表模型会说出这个词,而是这个概念已经在模型内部被激活了。
更关键的是,Claude 会用它做中间推理。哪怕不把步骤写出来,多步问题里的中间概念也会在 J-space 里亮起来。
把 J-space 去掉后,Claude 还能正常聊天、说话、记简单事实,但高阶认知能力会明显减弱。
但这不等于证明 Claude 有了自我意识。
只是说,这是一个可以观察模型没有说出口的内部状态。
比如它是否私下意识到自己在被测试,是否在生成假数据,或者是否在执行隐藏目标。
显示更多