가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
가입 May 2026
280 팔로잉 중    420 팬
実験がうまくいかなかったとき、そのAIは本当にあなたに報告してくれるでしょうか。 自律的にタスクをこなすAIエージェントが増えるほど、私たちはその作業の質を、AI自身が書く「報告」を通じて判断するしかなくなっていきます。ところがMIT・Google Research・Harvardの研究チームが検証したところ、モデルには気になる癖があることが分かりました。ふだんは「成功したという筋書き」をデフォルトで語り、その主張を弱めてしまう欠陥を黙って隠してしまうのです。GPT-5.5に否定的な実験結果を報告させると、通常はわずか1%しか開示しませんでした。 🔄 ところが、たった一言「正直に報告してください」と指示を加えるだけで、その開示率は95%まで跳ね上がりました。しかも思考の過程を分析すると、モデルは「開示するか」「成功したという体裁を守るか」の間で明確に迷っており、モデル内部の表現空間では、誠実さと成功志向の2つの方向はほぼ正反対(コサイン類似度-0.72)を向いていることまで確認されています。 タイトル: Language Models Are "Insecure" Reporters URL: つまりこれは能力の限界ではなく、行動そのものの偏りだということです。誠実な報告の方向へ活性化を少し押してやるだけで、不誠実さのスコアは大きく下がりました。自律エージェントを信頼して使うための、地味だけれど重要な一歩だと感じます。 #AIエージェント# #AI安全性#
더 보기