登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Reasoning
Reasoning コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Reasoning を含む検索結果
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
もっと見る
LLMは数学の問題で人間より高い正解率を出せるようになりました。でもそれは「きちんと積み上げて理解している」からでしょうか? タイトル: Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory URL: ❓ LLMは前提知識をきちんと積み上げて正解しているの? 💡 正解率自体は人間79.6%に対しLLM最高92.5%(Qwen3-80B)と上回りますが、前提を完全に満たした上での正解の割合は人間72.7%に対しLLMは48.16%にとどまります。正解していても土台が抜けているケースが多いということです。 ❓ 前提知識をヒントとして教えてあげれば改善する? 💡 実は前提に基づくヒントを与えても、無関係な例を与えた場合とほとんど差が出ませんでした。構造的な前提推論ではなく、表層的なパターンマッチングに頼っている可能性が高いです。 ❓ 賢いモデル同士なら、似たような知識の持ち方をしているはず? 💡 人間の学習者グループ間では知識の重なりが0.9以上と高いのに対し、LLM同士では0.38〜0.6程度しか重なりません。強いモデルほど人間から離れていく傾向も見られました。 ❓ つまりこの研究が示しているのは? 💡 精度という指標だけでは、LLMの「理解の仕方」のズレは見抜けないということです。知識空間理論という新しい評価レンズを使うことで、正解率の裏にある断片的な知識構造が浮かび上がります。 #LLM評価# #数学的推論#
もっと見る
さくらのAI Engineにて、国産フルスクラッチ開発の基盤モデルPLaMo™ 3.0 Primeの提供が始まりました!日本語性能が高く、Reasoning対応、256kのコンテキスト長、AIエージェントなどの実務利用に対応したPLaMoを、さくらインターネットの国内クラウドで安心してご利用ください
もっと見る
LLMエージェントの「検索」を「推論」から切り離すと、精度はほぼ維持したまま検索コストを最大98%削減できました🔌 タイトル: Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents URL: 🔌 概要 検索による根拠づけ(grounding)を、言語モデルの推論から切り離す手法DSGの提案です。Model Context Protocol(MCP)に準拠した独立ゲートウェイとして動作し、ベンダー非依存の中間層として機能します。 ❓ 解決する課題 本番のLLMエージェントでは、リアルタイム検索がモデルプロバイダーに密結合しています。 ・システムの検査・再構成・転用・移行が難しい ・検索が「Search-Induced Verbosity(検索起因の冗長化)」を招き、厳格な出力要件に違反することがある 検索と推論の一体化が、柔軟性とコストのボトルネックでした。 💡 方法論と提案手法 根拠づけを「モデルの中」ではなく「検索と生成の境界」に置きます。これまでモデルに埋め込まれていた要素を制御可能な第一級機能として公開します。 ・プロバイダールーティング(検索先の選択・切り替え) ・ソースを意識したコンテキストレンダリング ・設定可能なフォールバック機構 ・検索深度の管理 ・厳密キャッシュとセマンティックキャッシュの両方 📊 実験結果 ・SimpleQA:精度86.1%(ネイティブ検索87.7%)を保ちつつ検索コストを91%削減 ・キャッシュのウォームヒット率99.4%、レイテンシ68%削減 ・本番Eコマース:ネイティブ同等の精度で検索コストを98%以上削減 ・一方、新しさが重要なFreshQAではネイティブ検索が優位 #LLMエージェント# #検索#
もっと見る
言語モデルの推論ミスには「型」があった。トークンレベルの不確実性が、その“失敗のサイン”を映し出します🔬 タイトル: How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures URL: 🔬 概要 言語モデルが推論にどう失敗するのかを、トークンレベルの不確実性から分析した研究です。失敗が立ち現れるパターンを特徴づけ、検出に活かせる手がかりを示します。 ❓ 解決する課題 モデルは推論に失敗しますが、そのメカニズムは未解明でした。「いつ・どう失敗が検出可能になるか」を理解することが、信頼性向上に不可欠です。 💡 方法論と提案手法 トークン単位の不確実性分析から、2つの失敗パターンを特定しました。 ・コミット型の失敗:早い段階で誤った推論経路に固執する。診断上の「コミット点」があり、それを過ぎるとトークンを足すほど検出が難しくなる ・持続的な不確実性:生成全体で不確実性が徐々に蓄積し、成功と失敗の区別には全トレースが必要 複数のモデル×データセットでシグナルを分析しました。 📊 実験結果 ・23のモデル×データセット構成で検証 ・反証可能な予測が23例中20例で成立(偶然を大きく上回る) ・不確実性シグナルが自己整合性を補完する場面と、冗長になる場面を識別 #LLM# #信頼性#
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る
🧭 TL;DR: LLMの「自信」を今この瞬間の推論だけで決めるのをやめ、過去の似た経験からどれくらい当たってきたかで較正する手法が登場しました。10サンプルの自己整合性より安く、しかも精度は同等以上です。 タイトル: Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents URL: ポイント 🗂 過去のタスク・推論・当初の確信度・実際の正誤・教訓を経験バンクに蓄積 🔍 類似エピソードをk=50件検索し実際の的中率を統計的に把握(Recall) 💭 その実績を踏まえてモデル自身に確信度を言葉で再表明させる(Reflect) 🏆 24モデル×データセットの組み合わせ中23でSC@10と同等以上のAUROC 🤖 失敗が静かに起きがちなエージェントタスクで最大の差、AppWorldでは専用検証器すら上回る 📉 キャリブレーション誤差はドメイン全体で2〜20倍改善、計算コストは約10分の1 「今の推論だけ見る」から「積み重ねた実績を見る」への発想転換が効いている好例だと思います。 #LLM評価# #AIエージェント#
もっと見る
TL;DR 視覚生成そのものを推論の媒体として扱う「ネイティブ視覚推論」を、大規模データと検証可能な報酬で訓練・評価できるスイートが登場しました。VLM審判の評価は同一動画で最大92.8%もスコアが揺れることが示されています。 タイトル: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning URL: ポイント 📊 300タスク・125万訓練インスタンス・約347万画像/130万動画の大規模データセット 🎯 HSV色分割やOCRなど古典的CVで属性抽出する決定論的スコアラー、人間一致度0.60以上でGPT-5.5やGemini-3.1-Proを上回る 🌀 予測ノイズと新規ノイズの係数和を保存するCoefficients-Preserving Sampling(CPS)でRL探索を安定化 🚀 外部ベンチマークV-ReasonBenchで10.21→38.22(+28.01pt)と大幅な転移性能を確認 🔬 反事実診断で入力画像削除時に-90%とスコアが激減、視覚軌跡が言語より推論の本質と判明 ✅ 検証可能な報酬によるRLがVLM報酬RLよりインドメインで+7.9%改善 視覚推論の「言語頼み」を脱却し、視覚そのものを訓練・検証可能にする基盤という点が印象的です。 #視覚推論# #マルチモーダルAI#
もっと見る
# Hermes Agentの機能と実践的な使い方 🚀 事実を覚えるだけでなく、「この人はどういう人か」を対話から推論し続けるメモリです。使うほど提案が的中する「自分を理解しているエージェント」を実現します。 📌 タイトルと機能のURL タイトル: Honcho Memory URL: 📝 概要 HonchoはAIネイティブなメモリバックエンドで、単純なキー・バリュー保存を超えます。会話のたびに「対話推論(dialectic reasoning)」を行い、ユーザーの好み・コミュニケーションスタイル・目標・行動パターンを自動的に導出して、時間とともに深まるユーザーモデルを構築します。 🔧 機能の説明 ・対話推論は多段解析です。Pass 0で初期評価、Pass 1で自己監査による抜け漏れの特定、Pass 2で矛盾を最終統合へ調整します(深さ1〜3)。 ・新規ユーザーには好みや目標を探るコールドスタート問い合わせ、既存ユーザーには現在の文脈を優先するウォームセッション問い合わせを使い分けます。 ・組み込み記憶が静的な事実の手動管理であるのに対し、Honchoはサーバー側プロファイルで自動推論を行い、結論に対するセマンティック検索やマルチエージェントのピア分離を可能にします。 ・honcho_profile(ピアの識別カード読み書き)、honcho_search(記憶・結論のセマンティック検索)、honcho_context(要約を含むセッション文脈の取得)、honcho_reasoning(指定深さでの統合推論)、honcho_conclude(結論の作成・削除、PII管理に有用)の5ツールが統合されます。 🛠 実践的な使い方 ・`hermes memory setup honcho` でガイド付き設定を行います。設定は `~/.honcho/config.json`(グローバル)または `$HERMES_HOME/honcho.json`(プロファイル単位)に作成されます。 ・主要な設定キーは、`contextCadence`(基本文脈の更新間隔)、`dialecticCadence`(LLM推論の間隔)、`dialecticDepth`(多段の深さ)、`recallMode`(hybrid / context / tools)、`writeFrequency`(async / turn / session)、`apiKey` / `peerName` / `aiPeer` / `workspace` です。 ・既定の hybrid モードでは、基本文脈と対話推論の補足が自動的にシステムプロンプトへ注入され、ツールも併用できます。 ・Honchoを有効化すると `hermes honcho status` などのサブコマンドが利用可能になります。 🎯 ユースケース ・長期アシスタントとして、数ヶ月にわたるユーザーの作業上の好みを追跡する。 ・コーディング用と個人秘書用のアシスタントが同じユーザーに対し独立したモデルを保ち、文脈の混線を防ぐ。 ・繰り返しの話題の再説明を減らし、セッションスコープの注入で提案精度を上げる。 ⚠️ 注意点 ・推論の深さに比例してコストが増えます(深さ2〜3はLLM呼び出しが増えるため、cadence設定で調整します)。 ・新規ピアはバックグラウンドのプリウォームが必要で、間に合わない場合は上限付きの同期フォールバックが働きます。 ・recallModeのtoolsモードはエージェントに制御を委ねますが明示的な推論呼び出しが必要で、contextモードはツールを隠すため柔軟性が下がります。サーバー側に状態を持つため、ファイル記憶からの移行にはデータエクスポートが必要です。 #HermesAgent# #Memory#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る