登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他に、早稲田大で非常勤講師、#fukabori#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する学びをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
参加 May 2009
682 フォロー中    20.1K ファン
LLMに回答の自信度を数値化させるのは無意味では、という主張。 ・LLMに0から100の自信度を出力させる手法がよく見られる ・しかし、LLMに自信度を自己評価させるのは完全に無意味 ・科学的な根拠はなく、出力が信頼できそうに見えるだけの心理的なトリック ・Anthropicの研究などで、モデルが内省的な認識を持つことは確認されている ・ただ、それは実験環境での話であり、実際の出力の正しさを評価できるレベルにはない ・思考プロセスを用いて自己評価させても「その自信度の自信度は?」という無限ループに陥る ・実際にDeepMindの論文でも、外部フィードバックなしの自己修正は性能を低下させることが示されている ・現在のモデルは、自らの状態を定量化できるほど自分自身を理解していない ・そもそも、スコア化しようとする自信の定義が極めて曖昧 ・回答の正確性なのか、一貫性なのか、ユーザーの目的を満たそうとしているのか ・全く異なる次元の問題を単一の数値に押し込めるのは無理がある
もっと見る