TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他、早稲田大で非常勤講師、#
fukabori
#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する個人メモをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
Joined May 2009
694
Following
20.4K
Followers
iwashi / Yoshimasa Iwase
@iwashi86
2026.07.29 03:30
LLMに回答の自信度を数値化させるのは無意味では、という主張。 ・LLMに0から100の自信度を出力させる手法がよく見られる ・しかし、LLMに自信度を自己評価させるのは完全に無意味 ・科学的な根拠はなく、出力が信頼できそうに見えるだけの心理的なトリック ・Anthropicの研究などで、モデルが内省的な認識を持つことは確認されている ・ただ、それは実験環境での話であり、実際の出力の正しさを評価できるレベルにはない ・思考プロセスを用いて自己評価させても「その自信度の自信度は?」という無限ループに陥る ・実際にDeepMindの論文でも、外部フィードバックなしの自己修正は性能を低下させることが示されている ・現在のモデルは、自らの状態を定量化できるほど自分自身を理解していない ・そもそも、スコア化しようとする自信の定義が極めて曖昧 ・回答の正確性なのか、一貫性なのか、ユーザーの目的を満たそうとしているのか ・全く異なる次元の問題を単一の数値に押し込めるのは無理がある
Show more
0
0
1
7
1
Forward to community
Most Popular Users
Tibo
@thsottiaux
775.3K Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Elon Musk
@elonmusk
241.7M Followers
Serenity
@aleabitoreddit
1M Followers
Sam Altman
@sama
6.3M Followers
OpenAI
@OpenAI
5.4M Followers
New York Post
@nypost
4.2M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
198.5K Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
472.6K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
Bitcoin Archive
@BitcoinArchive
1.8M Followers
Anthropic
@AnthropicAI
1.8M Followers
First Squawk
@FirstSquawk
569.2K Followers