TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他、早稲田大で非常勤講師、#
fukabori
#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する個人メモをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
参加 May 2009
694
フォロー中
20.4K
ファン
iwashi / Yoshimasa Iwase
@iwashi86
2026.07.29 03:30
LLMに回答の自信度を数値化させるのは無意味では、という主張。 ・LLMに0から100の自信度を出力させる手法がよく見られる ・しかし、LLMに自信度を自己評価させるのは完全に無意味 ・科学的な根拠はなく、出力が信頼できそうに見えるだけの心理的なトリック ・Anthropicの研究などで、モデルが内省的な認識を持つことは確認されている ・ただ、それは実験環境での話であり、実際の出力の正しさを評価できるレベルにはない ・思考プロセスを用いて自己評価させても「その自信度の自信度は?」という無限ループに陥る ・実際にDeepMindの論文でも、外部フィードバックなしの自己修正は性能を低下させることが示されている ・現在のモデルは、自らの状態を定量化できるほど自分自身を理解していない ・そもそも、スコア化しようとする自信の定義が極めて曖昧 ・回答の正確性なのか、一貫性なのか、ユーザーの目的を満たそうとしているのか ・全く異なる次元の問題を単一の数値に押し込めるのは無理がある
もっと見る
0
0
1
7
1
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569.2K ファン
ファミ通.com
@famitsu
1.4M ファン
Bloomberg
@business
10.5M ファン
モデルプレス
@modelpress
2.1M ファン
billboard
@billboard
16.8M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K ファン
一劍浣春秋
@chee828
0 ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
cv usk
@cv_usk
417 ファン