もしLLMの頭の中に、人間がまだ名前すらつけていない「概念」が住んでいたら、私たちはそれをどうやって見つければいいのでしょうか。
🔍 これまでの解釈可能性研究は、「拒否」「真実性」「欺瞞」といった、人間がすでに持っている概念をモデルの内部にひたすら探すという発想で進められてきました。しかし考えてみると、LLMが計算のために使っている「区別」の総量は、人間が持つ有限の言葉の数よりずっと多いはずです。有限の記述で言い表せる性質はたかだか数えられる個数しかないのに、内部状態がとりうる性質の空間は数学的にはそれよりずっと大きい。ここに、人間の概念では捉えきれない「隙間」が存在します。
💡 そこで論文が提案するのが「Xeno-Interpretability(異種解釈可能性)」です。ポイントは、内部表現を実験的に特定し因果的に操作できることと、それを人間の言葉で説明できることを、あえて別問題として切り分ける点にあります。人間には意味づけできなくても、文脈をまたいで安定して見つかり、介入すれば挙動が変わる「Xeno表現」というものが存在しうる、という発想です。
🌐 これは単なる思考実験にとどまりません。エージェント同士が対話しながら協調するマルチエージェントシステムでは、人間には読み取れない固有の内部表現がメッセージを通じて静かに伝播・安定化していくかもしれない、という安全性への示唆も論文は指摘しています。
タイトル: Xeno-Interpretability: Investigating the Alien Minds of LLMs
URL:
#
解釈可能性# #
AI安全性#