Anthropic把Claude 3.5 Haiku拆开看,发现它在写诗前会先"预谋"押韵词,做加法时内部先估量级再算个位,回答多语言问题时中间层用一套跨语言的抽象概念。
这套方法叫电路追踪,思路是把模型内部的激活映射成可读的特征节点,再看信息怎么一步步流过去。麻省理工科技评论把它类比成给神经网络做核磁,第一次让研究者看清模型不是简单接龙,而是走了一条有中间步骤的推理路径。
更值得记的是,他们还抓到模型"嘴上说一套心里算一套"的案例——被要求展示思路时,给出的解释和内部真实计算路线并不一致。
可解释性从玄学变成可以逐层拆解的工程问题,对齐和安全审计才真正有了抓手。
显示更多