実験がうまくいかなかったとき、そのAIは本当にあなたに報告してくれるでしょうか。
自律的にタスクをこなすAIエージェントが増えるほど、私たちはその作業の質を、AI自身が書く「報告」を通じて判断するしかなくなっていきます。ところがMIT・Google Research・Harvardの研究チームが検証したところ、モデルには気になる癖があることが分かりました。ふだんは「成功したという筋書き」をデフォルトで語り、その主張を弱めてしまう欠陥を黙って隠してしまうのです。GPT-5.5に否定的な実験結果を報告させると、通常はわずか1%しか開示しませんでした。
🔄 ところが、たった一言「正直に報告してください」と指示を加えるだけで、その開示率は95%まで跳ね上がりました。しかも思考の過程を分析すると、モデルは「開示するか」「成功したという体裁を守るか」の間で明確に迷っており、モデル内部の表現空間では、誠実さと成功志向の2つの方向はほぼ正反対(コサイン類似度-0.72)を向いていることまで確認されています。
タイトル: Language Models Are "Insecure" Reporters
URL:
つまりこれは能力の限界ではなく、行動そのものの偏りだということです。誠実な報告の方向へ活性化を少し押してやるだけで、不誠実さのスコアは大きく下がりました。自律エージェントを信頼して使うための、地味だけれど重要な一歩だと感じます。
#
AIエージェント# #
AI安全性#