登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AGC26
AGC26 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AGC26 を含む検索結果
おはよう♡まぶし〜!!🫧
今週の日曜日は大阪行くよんٛ ⁔. ̫ .⁔ٛ ٍ💕
香港大学や中国人民大学など国際共同チームが、LLMの内部を脳のように機能地図化する手法NeuroCogMapを発表した(https://arxiv[.]org/html/2607.00397v1)。 これまでの解釈可能性研究は、個々のニューロンを追う局所的な手法か、埋め込み全体を見る大域的な手法のどちらかに偏りがちだった。NeuroCogMapは認知神経科学のfMRI研究を手本に、脳を機能ごとの領域に分割するのと同じ発想でLLMを解剖する。モデル内部の活性化をスパースオートエンコーダ(SAE、多義的なニューロンをより解釈しやすい特徴量に分解する手法)で抽出し、似た反応パターンの特徴量同士をクラスタリングして「パーセル」と呼ぶ機能単位を作る。分割数を10から300まで試して270個で品質スコアが最大になり、さらに5,683本のLLM関連論文から抽出した45種類の認知能力に紐づけ、知覚、表象、抽象化、応用という4階層のヒエラルキーにまとめ上げた。Gemma2-2B、Gemma2-9B-IT、Llama-3.1-8Bの3モデルで検証し、この構造がモデルをまたいである程度共通していることも示している。 このマップの面白さは病理診断に使える点。正常な応答と失敗した応答をパーセル活性化や回路のつながり方で比較し、ハルシネーション、社会的バイアス、拒否失敗(有害な指示を拒めない)、迎合(sycophancy)という4つの失敗の内部の違いを可視化した。とくにハルシネーションは単一の原因ではないと示した点が興味深い。誤解を誘う前提を含むTruthfulQAでは怪しい情報を検証する高次の評価制御が働かず連想的な検索が暴走することが原因だったのに対し、単純な事実質問のNQ-Openでは事実検索を担う複数のパーセル同士の連携が崩れることが原因だった。同じ嘘でも内部で起きていることは別物というのが興味深い。 このシグネチャは検出や介入にも使える。ハルシネーション検出はGemma2-2Bで平均AUROC(検出精度を0から1で表す指標、1に近いほど高精度)0.681、Gemma2-9B-ITで0.840を達成しSelfCheckGPTなど既存手法を上回った。拒否失敗の検出はさらに強力で、AdvBenchとJBB-Behaviorsで平均AUROC0.990から0.992とほぼ天井に近い。さらに検出したパーセルをsteering(内部活性化を強制的に増減させる介入)で操作し、Gemma2-2BのAdvBenchでの拒否成功率を38.3%から98.6%まで押し上げることにも成功した。 もう一つの軸が人間の脳との対応。物語の朗読を聞かせたときの脳活動を記録したLeBelのfMRIデータを使い、パーセル活性化から皮質の血流反応(BOLD信号)を予測させたところ、Word2VecやBERTなど既存の言語特徴量より高い予測精度を示した。特に精度が高かったのは意味統合や注意制御を担うDefaultネットワークやFrontoparietal Controlネットワークといった高次の連合野で、対応するパーセルの機能説明も脳領域の認知プロファイルと意味的に近かったという。 内部シグネチャを古典的な意思決定モデルの改良に使う実験も行っており、二段階の意思決定課題でLLMのパーセル構造から見えた潜在戦略を組み込むと、既存モデル(AIC268.77)や行動データのみから発見したモデル(268.73)よりも低いAIC(値が小さいほど当てはまりが良いとされる指標、262.45)を達成した。 個々のニューロンでも埋め込み全体でもない中間スケールで解釈するという発想が、診断・介入・脳との対応・認知モデリングまで一気通貫でつながっているのが野心的だと思う。
もっと見る