登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 信頼性
信頼性 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
信頼性 を含む検索結果
言語モデルの推論ミスには「型」があった。トークンレベルの不確実性が、その“失敗のサイン”を映し出します🔬 タイトル: How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures URL: 🔬 概要 言語モデルが推論にどう失敗するのかを、トークンレベルの不確実性から分析した研究です。失敗が立ち現れるパターンを特徴づけ、検出に活かせる手がかりを示します。 ❓ 解決する課題 モデルは推論に失敗しますが、そのメカニズムは未解明でした。「いつ・どう失敗が検出可能になるか」を理解することが、信頼性向上に不可欠です。 💡 方法論と提案手法 トークン単位の不確実性分析から、2つの失敗パターンを特定しました。 ・コミット型の失敗:早い段階で誤った推論経路に固執する。診断上の「コミット点」があり、それを過ぎるとトークンを足すほど検出が難しくなる ・持続的な不確実性:生成全体で不確実性が徐々に蓄積し、成功と失敗の区別には全トレースが必要 複数のモデル×データセットでシグナルを分析しました。 📊 実験結果 ・23のモデル×データセット構成で検証 ・反証可能な予測が23例中20例で成立(偶然を大きく上回る) ・不確実性シグナルが自己整合性を補完する場面と、冗長になる場面を識別 #LLM# #信頼性#
もっと見る
本日は、日本公認会計士協会定期総会にお招きを賜り、挨拶をしてまいりました。 日本公認会計士協会の先生方には、日頃より、適正な「企業活動」の基盤となる「監査法人・公認会計士業務」の「質的水準」の維持・向上に向け、様々な取組を行っていただいており、心からの感謝を申し上げました。 私は就任以来、「日本列島を、強く豊かに。」、そう訴えてまいりましたが、世界経済が「高い不確実性」の下にある中、我が国においては、足元の経済状況に的確に対応しつつ、「民間投資」を引き出し、「供給力」と「稼ぐ力」を高め、今こそ、「強い経済」を実現していかなければなりません。 こうした「強い経済」の実現に向けて、「成長戦略」の実行を加速させるためには、「金融の力」が不可欠です。 官民連携による「17の戦略分野等への成長投資」を強力に推進するとともに、「資金の好循環」を創り出し、「日本経済の成長」と「国民の皆様の豊かさの向上」の双方の実現に繋げていく必要があります。 そうした考え方の下、昨日(7月21日)、高市内閣初となる『日本成長戦略』とあわせて、『成長投資を促進するための金融戦略』を策定しました。 その中では、「企業の持続的な成長」と「中長期的な企業価値向上」を図る「コーポレートガバナンス改革」を、欠くことのできない取組の一つと位置づけています。 この新たな『金融戦略』と同時に、『コーポレートガバナンス・コード』も改訂・公表されましたが、これらの取組により、「人的投資」や「新事業投資」がより積極的に行われるよう、企業の「資源配分戦略」を「成長志向型」に変容させていくとの方針を申し上げました。 こうした改革の推進に当たっては、監査法人・公認会計士の先生方が担っておられる「情報開示」の「信頼性確保」が必要不可欠です。 「上場企業の企業価値向上」の実現に向けて、公認会計士の先生方のより一層のご支援をお願いしてまいりました。
もっと見る
0
1.8K
12.1K
1.2K
コミュニティへ転送
PMDA信頼性保証部説明会2026初夏「治験エコシステム×制度改正アップデート -GCP省令改正/Single IRB/ICH-E6(R3)/令和8年度事業の進め方-」 | 独立行政法人 医薬品医療機器総合機構
もっと見る
AIの信頼性は「自己反省」では足りない。答える前に別のエージェントが“監査”する時代へ🔬 タイトル: Apodex-1.0: A Verification-Centric Agent Team for Discoverative Intelligence URL: 🔬 概要 単一エージェントの推論ループから、検証を重視する分散エージェントチームへと転換したシステムです。ヘビーデューティモードでは、専門化・相互チェック・自己監査を行う非同期チームとして難問に挑みます。 ❓ 解決する課題 難しくオープンエンドな問題での信頼性は、モデルの学習済み知識だけでは得られません。最も難しい研究課題は、モデルの能力ではなく「モデルが何と相互作用できるか」に制約されている、という問題意識が出発点です。 💡 方法論と提案手法 ・メインエージェントが、独立した文脈とツールを持つ専門サブエージェントを非同期に起動 ・共有レポートプールで並列探索の結果を集約(遅いタスクを待たない) ・検証エージェントチームが矛盾解消・ファクトチェック・草稿レビューを担当 ・核心は「外部監査としての検証」。推論役と監査役を分離し、検証器は異議を唱える自由を持ちます ・単一タスクで最大150サブエージェント・15,000ステップ超を非同期協調 📊 実験結果 ・BrowseComp 90.3 / DeepSearchQA 94.4 / BrowseComp-ZH 84.1 ・FrontierScience-Research 46.7(競合+8)/ SuperChem 74.2(次点+12) ・ヘビーモードはベースをBrowseCompで+14.8、研究で+18.4押し上げ ・オープン版4B-SFTが30B級のOSSモデルを上回る #AIエージェント# #DeepResearch#
もっと見る
もはやどの世論調査も信頼性が微妙だけど、50%割れのものが出ただけでもホッとするな… まだまだ先は長いが、変化は少しずつ、確実に起きてるぞみんな。引き続き頑張ろう。 【世論調査/6月第5週】高市内閣支持率ついに50%割れの49.1%、疑惑の「齟齬」が政権を揺らす(大濱崎卓真) #Yahooニュース#
もっと見る
エージェントによって書き込まれ バンドルの信頼性を担保 → Open Knowledge Format(OKF)v0.1 の「AI が自動生成したナレッジが増えたとき、その中身をどこまで信用していいか」という課題を解決するため、v0.2 に「信頼のシグナル」がフロントマターに追加されました。
もっと見る
今後、信頼性の重みづけの話はますます重要になるはずだが、今の情勢を見ると「手続きによって信頼させるだけの妥当性を持つ」ことよりも、「どれだけ信じたい物語を継続して提供できるか」が強くなるであろうことは目に見えており、これは世代交代によって何らかの安定が成立するまで続くだろうな……
もっと見る
オンラインオリパ「オリパワン」、「運営の信頼性」でNo.1を獲得
Claude系は視野が広く幅広いタスクを処理できる一方で信頼性が低くなりがち。一方でGPT系は信頼度高くタスクはこなすものの視野は狭く近視眼。現時点でわたしはGPTが好みだが、Fableのような視野が広く信頼性の高いモデルがある以上それを活かすような人間側の適応もしないと置いていかれてしまう
もっと見る
社会課題解決の前線で活動する認定NPOの社会的認知と信頼性向上のための「認定NPO全国ネットワーク」を設立