登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 言語モデル
言語モデル コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
言語モデル を含む検索結果
言語モデルの推論ミスには「型」があった。トークンレベルの不確実性が、その“失敗のサイン”を映し出します🔬 タイトル: How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures URL: 🔬 概要 言語モデルが推論にどう失敗するのかを、トークンレベルの不確実性から分析した研究です。失敗が立ち現れるパターンを特徴づけ、検出に活かせる手がかりを示します。 ❓ 解決する課題 モデルは推論に失敗しますが、そのメカニズムは未解明でした。「いつ・どう失敗が検出可能になるか」を理解することが、信頼性向上に不可欠です。 💡 方法論と提案手法 トークン単位の不確実性分析から、2つの失敗パターンを特定しました。 ・コミット型の失敗:早い段階で誤った推論経路に固執する。診断上の「コミット点」があり、それを過ぎるとトークンを足すほど検出が難しくなる ・持続的な不確実性:生成全体で不確実性が徐々に蓄積し、成功と失敗の区別には全トレースが必要 複数のモデル×データセットでシグナルを分析しました。 📊 実験結果 ・23のモデル×データセット構成で検証 ・反証可能な予測が23例中20例で成立(偶然を大きく上回る) ・不確実性シグナルが自己整合性を補完する場面と、冗長になる場面を識別 #LLM# #信頼性#
もっと見る
大規模言語モデルの圧倒的な進化の下で、自分だけの言葉を持つことの意味|茂木健一郎 @kenichiromogi
大規模言語モデル(LLM)は、自然言語で蓄積されてきた人間の集合知を統計的にまとめたものだから、ある意味では私たちの知、コミュニケーションの共通基盤としてすぐれている。LLMと一人ひとりの発話行為の関係は、完全に独立ではなく、個性はニュアンスの問題になる。
もっと見る
大規模言語モデル(LLM)に「株の大口注文をいつ・どれだけ売買するか」を決めさせる研究が出ていた( 機関投資家が大きな注文を一度に出すと価格が動いて損をするため、小分けにして執行する(親注文執行)のがアルゴリズム取引の基本課題。従来はTWAP(注文を時間で均等に分割する手法)のような固定ルールか、個別に学習させたモデルに頼るしかなく、市場の前提が変わるたびに弱くなったり再学習が要ったりした。 この論文が提案する「PACE」(先読み制御執行、の意)は、LLMに役割を分けて執行させる。Planner役が数十分単位の値動きの方向性を読んで大まかな配分計画を立て、Executor役がそれをもとに数分単位で数量を上下させる。市場の前提を置かず、専用の学習も不要というのが利点。 深セン証券取引所の実データで検証したところ、PACEはTWAPやAlmgren-Chriss(伝統的な最適化手法)、XGBoost/LSTM(学習ベースの手法)をすべて上回り、最も成績の良かった手法よりも0.65bps(ベーシスポイント、1万分の1)高い成績を出した。年間1000億ドルを取引するファンドなら年間650万ドルのコスト削減に相当する規模で、1,680件の注文全体でLLMのAPI利用料はわずか30ドル程度だったという。 行動特性も興味深く、人間の投資家は自信過剰だと成績が悪化しやすいが、このLLMは自信度が高いときほど成績が良かった。締め切り間際に慌てるのではなく、早めに多く取引を終わらせる傾向も見られた。
もっと見る
【📢ID登録締切まであと4日|大規模言語モデル講座2】 「大規模言語モデル講座2」のID登録締切が、8/31(月)10:00に迫っています! 本講座では、LLMの基礎知識を踏まえ、 🔹RAG・Tool Useなど外部環境の活用 🔹LLMの軽量化 🔹安全対策 🔹LLMの分析・解釈可能性 🔹ドメイン特化 など、LLMを実際に活用していくために必要となる応用技術を学びます。 さらに、毎年恒例の「個人型LLM開発コンペ」も開催予定! 講義で知識を身につけるだけでなく、実践を通してさらに理解を深められます。 LLMの基礎からさらに一歩先へ進み、応用・社会実装につながる技術を身につけたい方は、ぜひこの機会にご応募ください! 📅ID登録締切:8/31(月)10:00 📅講座申込締切:9/2(水)10:00 ▼詳細・お申し込み
もっと見る
VLM(画像を見て言葉で答える大規模言語モデル)に専門ツールを使わせて学ばせたあと、使い方ごと本体に染み込ませてツールを手放せるようにする学習手法SpatialCLIが発表された(https://arxiv[.]org/html/2607.27703v1)。 VLMは「机の上で一番遠いクマのぬいぐるみはどれか」のような課題全体の理解は得意だが、実際の距離を正確に測るのは苦手。SAM 3(輪郭を切り出す専門モデル)やDepth Anything 3(奥行きを推定する専門モデル)は精密だが、どのクマを見ればいいかという文脈判断ができない。しかもこうした専門ツールは呼び出すたびに時間がかかり、学習時点の計測では1回あたり平均2.916秒だったという。 SpatialCLIの名前は、位置特定・輪郭抽出・奥行き・姿勢推定という4つの専門ツールをVLMに呼び出させるCall、お手本の成功例と強化学習(GRPO)でツールの選び方を磨くLearn、ツールを使って解けた過程を文章に変換しツールなしでも同じ結論に辿り着けるよう学習し直すInternalizeという3段階に由来する。ツールを使う学習と使わない学習を同時に行うため、ツールの使い方を忘れずに専門能力だけをモデル本体に取り込める。 新設した516問のベンチマークSpatialCLI-Benchは、フロンティアモデルのGPT-5.6 Solでも正答率48.8%にとどまる難問揃い。Qwen3-VL-8B(80億パラメータ)にSpatialCLIを適用すると、ツールなしで35.3%から72.7%、ツールありでは91.3%まで伸びた。視点を変えながら空間関係を捉える力を測る別のベンチマークMindCubeでも29.3%から84.6%(ツールあり)に達し、同じ条件のGPT-5.6 Sol(72.1%)を上回っている。 ツールを使わせて学ばせてから、学んだことを染み込ませて手放させる。この順番が、身体を持つAIが現実世界の空間を扱えるようになる道筋の一つになりそうだ。
もっと見る
モデル自身に長い文章の中から使えそうな部分を選ばせてから、その部分だけで一時的に学習させる手法をMeta AIとバージニア大学が発表した(https://arxiv[.]org/html/2607.09415v1)。 近年のLLM(大規模言語モデル)は数十万トークンの長文を一度に読めるようになったが、扱える入力の長さ(コンテキストウィンドウ)を広げるだけでは長文を有効に使えるとは限らない。入力が長くなるほど正解率が下がる現象が知られていて、質問に関連する証拠を見つけて使う能力がボトルネックになっている。 有望な解決策がテスト時学習(TTT、Test-Time Trainingの略)だ。答える前にテスト入力そのものを訓練データとしてモデルの重みを一時的に更新する手法で、長文脈タスクとの相性が良いとされてきた。ただし長文脈全体を学習に使うのは計算コストが高く、ランダムに抜き出した断片を使うと無関係な情報がノイズになる。 著者らはLLMの長文読解力を測るベンチマーク「LongBench-v2」で診断実験を行い、興味深い結果を得た。ランダムな断片で学習させるとベースモデルの正解率40.4%が38.9%まで下がる一方、正解を教えられたうえで判断するGPT-5.5が選んだ「本当に必要な部分」だけで学習させると45.9%まで伸びた。TTTの効果は学習させる部分の質に強く依存している。 これを受けて提案されたのがSelf-Guided TTT(S-TTT)だ。2段階構成で、まずモデル自身に長文脈の中から質問に関連しそうな部分を原文のまま抜き出させ(Stage 1)、その部分だけを使って次単語予測(次にくる単語を当てさせる、通常のAI学習と同じ方式)で一時的に学習させる(Stage 2)。最終的な回答生成は元の文脈全体を見て行う。 Qwen3-4B-Thinking-2507とLlama-3.1-8B-Instructの両方で検証したところ、ベースモデルは一貫して上回り、ランダムに断片を選ぶ手法や文脈全体を使う手法など既存のTTT手法に対しても総じて上回るか同等の成績を残した。最大では15%の相対的な改善を達成している(Qwen3-4B-Thinking-2507、LongBench-v2の64k〜128kトークン帯域で正解率30.7%→35.3%)。 パープレキシティ(次単語の予測しにくさ)やエントロピー(予測の不確実性)が高い部分を選ぶより、モデル自身が「質問に関連しているか」で選ぶ方が明確に優れていた点も興味深い。難しい部分を学ばせればいいわけではなく、質問との関連性を見極める判断力そのものが効いているらしい。
もっと見る
【イベント】7/30 (木) にPFNが開発する大規模言語モデルPLaMo™の技術セミナーを開催します! PLaMo 3.0 Primeの事前・事後学習や開発の工夫、活用事例を紹介します。 さらに、開発中のPLaMo 3 翻訳モデルの話や開発陣とのフリートークもあります。 ぜひご参加ください!
もっと見る
【イベント】7/30 (木) にPFNが開発する大規模言語モデルPLaMo™に関する技術セミナーを開催します! 先月リリースしたPLaMo 3.0 Primeを中心に、事前・事後学習の手法や実装上の工夫、活用事例、日本語LLMの設計思想などをご紹介します。 セミナー後は開発メンバーとのフリートークも予定しています。ぜひご参加ください!
もっと見る
【ID締切まであと3日】 ChatGPTをはじめとする大規模言語モデル(LLM)の仕組みを、基礎理論から最新のモデル動向まで体系的に学べる「「大規模言語モデル(LLM)講座1」のID締切まで、あと3日となりました。 本講座では、 ・事前学習・事後学習の仕組み ・ベンチマーク評価 ・最新の推論モデルの動向 ・公開モデルやAPIを活用した性能向上手法 など、LLMを理解するために必要な知識を一気通貫で学びます。 また、松尾・岩澤研究室が監修した実践的な演習を通じて、手を動かしながら理解を深めることができます。 LLMに関する理論・技術・実装を体系的に学びたい方に最適な講座です。 🗓️ID登録締切:6/22(月)10:00 🗓️募集締切:6/24(水)10:00 ▼講座詳細・お申し込みはこちら
もっと見る