「配信率100%、スキーマ有効性100%、エラー0件」の完璧なパイプラインなのに、同じリクエストを投げ直したら判定結果が変わる。そんな衝撃の負の結果を、事前登録+完全な監査証跡つきで報告した論文です。
タイトル: Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
URL:
🔧 注目ポイント1: エンジニアリングの完璧さは測定の信頼性を保証しない
3,312件の計画済みコールで応答率・スキーマ有効性ともに100%、再試行やエラーも0件という理想的な実行にもかかわらず、繰り返しランキングの一致度(Spearman中央値)はわずか0.400。事前登録した安定性ゲート(閾値0.90)を明確に下回りました。
🎲 注目ポイント2: バイト同一の入力でも出力がドリフトする
同じリクエストを24時間後に再実行しても、全順位の一致率はわずか0.780。しかも面白いことに、同一日内の別ウィンドウ同士でも中央値0.805とほぼ同じ数値になり、これは「翌日ドリフト」ではなく共有エンドポイントの即時的な非決定性であることが判明しました。
📉 注目ポイント3: サンプル数を増やしても解決しない
オブザーバー呼び出しを8回から500回(合計74.8万コール)まで増やしても、安定性ゲートの通過率は0/500のまま。候補間のスコア差がノイズフロアより7〜10桁も小さいため、そもそも順位付け不可能なタスクが多いことが根本原因でした。
LLMを評価の「ものさし」として使う前に、そのものさし自体が安定しているかを計測する重要性を教えてくれる一本だと思います。
#
LLM評価# #
再現性#