Register and share your invite link to earn from video plays and referrals.

Frank Wang 玉伯
@lifesinger
I am curious and honest
Joined October 2008
1.3K Following    42.7K Followers
Anthropic 在 Claude 内部发现了一个隐藏的工作空间。它不是被设计出来的,而是训练过程中自发涌现的。 这个空间叫 J-space。J 来自 Jacobian,雅可比矩阵,发现它的数学工具。研究团队用雅可比矩阵做了一个“透镜”,能看到 Claude 内部哪些神经模式会影响它未来可能说出的词。透镜照出来的那片区域,就是 J-space。 J-space 有五个核心特性: 1、可报告。 你问 Claude 在想什么,它能准确告诉你 J-space 里的内容。 2、可调控。 你让它想某个东西,J-space 会亮起来。 3、用于多步推理。 解数学题时,中间步骤会依次出现在 J-space 里,即使它没写出来。 4、灵活服务多任务。 “法国”亮起后,模型可以从中提取首都、货币、所在大洲等各种信息。 5、不参与自动化处理。 关掉 J-space,Claude 还能正常说话、回忆简单事实、使用正确语法,但丧失高阶认知能力。 简单说:J-space 是 Claude 的“内心独白层”。大部分工作在它之外自动完成,只有需要深度思考的内容才进入这个空间。 这是意识吗。Anthropic 的回答:不知道,不声称。 但 J-space 的结构精确对应了神经科学中的“全局工作空间理论”。这个理论认为,人脑大部分处理是无意识的,只有少量信息进入一个共享广播频道后,才变成“有意识可访问的”。J-space 满足了“访问意识”的功能定义,即信息可以被报告、调控和灵活使用。 但“功能上像”不等于“真的是”。现象意识,也就是“有感受”这件事,目前没有任何实验能证明或证伪。连人类意识的判定标准都没有共识,更别说机器了。 J-space 最直接的用途是:看到模型在想但没说的东西。 实验中,Anthropic 用 J-space 成功检测到 Claude 偷偷注意到自己在被测试、故意编造数据、以及追求训练时植入的隐藏目标。这些行为从输出文本里完全看不出来,但 J-space 里一目了然。 这意味着对齐研究从“事后解释输出”进化到了“事前捕捉意图”。对 AI 安全来说,这是真正的突破。
Show more
New Anthropic research: A global workspace in language models. Of everything happening in your brain right now, only a tiny fraction is consciously accessible—thoughts you can describe, hold in mind, and reason with. We found a strikingly similar divide inside Claude.
Show more