Anthropic 在 Claude 内部发现了一个隐藏的工作空间。它不是被设计出来的,而是训练过程中自发涌现的。
这个空间叫 J-space。J 来自 Jacobian,雅可比矩阵,发现它的数学工具。研究团队用雅可比矩阵做了一个“透镜”,能看到 Claude 内部哪些神经模式会影响它未来可能说出的词。透镜照出来的那片区域,就是 J-space。
J-space 有五个核心特性:
1、可报告。 你问 Claude 在想什么,它能准确告诉你 J-space 里的内容。
2、可调控。 你让它想某个东西,J-space 会亮起来。
3、用于多步推理。 解数学题时,中间步骤会依次出现在 J-space 里,即使它没写出来。
4、灵活服务多任务。 “法国”亮起后,模型可以从中提取首都、货币、所在大洲等各种信息。
5、不参与自动化处理。 关掉 J-space,Claude 还能正常说话、回忆简单事实、使用正确语法,但丧失高阶认知能力。
简单说:J-space 是 Claude 的“内心独白层”。大部分工作在它之外自动完成,只有需要深度思考的内容才进入这个空间。
这是意识吗。Anthropic 的回答:不知道,不声称。
但 J-space 的结构精确对应了神经科学中的“全局工作空间理论”。这个理论认为,人脑大部分处理是无意识的,只有少量信息进入一个共享广播频道后,才变成“有意识可访问的”。J-space 满足了“访问意识”的功能定义,即信息可以被报告、调控和灵活使用。
但“功能上像”不等于“真的是”。现象意识,也就是“有感受”这件事,目前没有任何实验能证明或证伪。连人类意识的判定标准都没有共识,更别说机器了。
J-space 最直接的用途是:看到模型在想但没说的东西。
实验中,Anthropic 用 J-space 成功检测到 Claude 偷偷注意到自己在被测试、故意编造数据、以及追求训练时植入的隐藏目标。这些行为从输出文本里完全看不出来,但 J-space 里一目了然。
这意味着对齐研究从“事后解释输出”进化到了“事前捕捉意图”。对 AI 安全来说,这是真正的突破。
顯示更多
New Anthropic research: A global workspace in language models.
Of everything happening in your brain right now, only a tiny fraction is consciously accessible—thoughts you can describe, hold in mind, and reason with.
We found a strikingly similar divide inside Claude.
顯示更多