登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Reasoning
Reasoning コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Reasoning を含む検索結果
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
もっと見る
さくらのAI Engineにて、国産フルスクラッチ開発の基盤モデルPLaMo™ 3.0 Primeの提供が始まりました!日本語性能が高く、Reasoning対応、256kのコンテキスト長、AIエージェントなどの実務利用に対応したPLaMoを、さくらインターネットの国内クラウドで安心してご利用ください
もっと見る
LLMエージェントの「検索」を「推論」から切り離すと、精度はほぼ維持したまま検索コストを最大98%削減できました🔌 タイトル: Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents URL: 🔌 概要 検索による根拠づけ(grounding)を、言語モデルの推論から切り離す手法DSGの提案です。Model Context Protocol(MCP)に準拠した独立ゲートウェイとして動作し、ベンダー非依存の中間層として機能します。 ❓ 解決する課題 本番のLLMエージェントでは、リアルタイム検索がモデルプロバイダーに密結合しています。 ・システムの検査・再構成・転用・移行が難しい ・検索が「Search-Induced Verbosity(検索起因の冗長化)」を招き、厳格な出力要件に違反することがある 検索と推論の一体化が、柔軟性とコストのボトルネックでした。 💡 方法論と提案手法 根拠づけを「モデルの中」ではなく「検索と生成の境界」に置きます。これまでモデルに埋め込まれていた要素を制御可能な第一級機能として公開します。 ・プロバイダールーティング(検索先の選択・切り替え) ・ソースを意識したコンテキストレンダリング ・設定可能なフォールバック機構 ・検索深度の管理 ・厳密キャッシュとセマンティックキャッシュの両方 📊 実験結果 ・SimpleQA:精度86.1%(ネイティブ検索87.7%)を保ちつつ検索コストを91%削減 ・キャッシュのウォームヒット率99.4%、レイテンシ68%削減 ・本番Eコマース:ネイティブ同等の精度で検索コストを98%以上削減 ・一方、新しさが重要なFreshQAではネイティブ検索が優位 #LLMエージェント# #検索#
もっと見る
言語モデルの推論ミスには「型」があった。トークンレベルの不確実性が、その“失敗のサイン”を映し出します🔬 タイトル: How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures URL: 🔬 概要 言語モデルが推論にどう失敗するのかを、トークンレベルの不確実性から分析した研究です。失敗が立ち現れるパターンを特徴づけ、検出に活かせる手がかりを示します。 ❓ 解決する課題 モデルは推論に失敗しますが、そのメカニズムは未解明でした。「いつ・どう失敗が検出可能になるか」を理解することが、信頼性向上に不可欠です。 💡 方法論と提案手法 トークン単位の不確実性分析から、2つの失敗パターンを特定しました。 ・コミット型の失敗:早い段階で誤った推論経路に固執する。診断上の「コミット点」があり、それを過ぎるとトークンを足すほど検出が難しくなる ・持続的な不確実性:生成全体で不確実性が徐々に蓄積し、成功と失敗の区別には全トレースが必要 複数のモデル×データセットでシグナルを分析しました。 📊 実験結果 ・23のモデル×データセット構成で検証 ・反証可能な予測が23例中20例で成立(偶然を大きく上回る) ・不確実性シグナルが自己整合性を補完する場面と、冗長になる場面を識別 #LLM# #信頼性#
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る
# Hermes Agentの機能と実践的な使い方 🚀 事実を覚えるだけでなく、「この人はどういう人か」を対話から推論し続けるメモリです。使うほど提案が的中する「自分を理解しているエージェント」を実現します。 📌 タイトルと機能のURL タイトル: Honcho Memory URL: 📝 概要 HonchoはAIネイティブなメモリバックエンドで、単純なキー・バリュー保存を超えます。会話のたびに「対話推論(dialectic reasoning)」を行い、ユーザーの好み・コミュニケーションスタイル・目標・行動パターンを自動的に導出して、時間とともに深まるユーザーモデルを構築します。 🔧 機能の説明 ・対話推論は多段解析です。Pass 0で初期評価、Pass 1で自己監査による抜け漏れの特定、Pass 2で矛盾を最終統合へ調整します(深さ1〜3)。 ・新規ユーザーには好みや目標を探るコールドスタート問い合わせ、既存ユーザーには現在の文脈を優先するウォームセッション問い合わせを使い分けます。 ・組み込み記憶が静的な事実の手動管理であるのに対し、Honchoはサーバー側プロファイルで自動推論を行い、結論に対するセマンティック検索やマルチエージェントのピア分離を可能にします。 ・honcho_profile(ピアの識別カード読み書き)、honcho_search(記憶・結論のセマンティック検索)、honcho_context(要約を含むセッション文脈の取得)、honcho_reasoning(指定深さでの統合推論)、honcho_conclude(結論の作成・削除、PII管理に有用)の5ツールが統合されます。 🛠 実践的な使い方 ・`hermes memory setup honcho` でガイド付き設定を行います。設定は `~/.honcho/config.json`(グローバル)または `$HERMES_HOME/honcho.json`(プロファイル単位)に作成されます。 ・主要な設定キーは、`contextCadence`(基本文脈の更新間隔)、`dialecticCadence`(LLM推論の間隔)、`dialecticDepth`(多段の深さ)、`recallMode`(hybrid / context / tools)、`writeFrequency`(async / turn / session)、`apiKey` / `peerName` / `aiPeer` / `workspace` です。 ・既定の hybrid モードでは、基本文脈と対話推論の補足が自動的にシステムプロンプトへ注入され、ツールも併用できます。 ・Honchoを有効化すると `hermes honcho status` などのサブコマンドが利用可能になります。 🎯 ユースケース ・長期アシスタントとして、数ヶ月にわたるユーザーの作業上の好みを追跡する。 ・コーディング用と個人秘書用のアシスタントが同じユーザーに対し独立したモデルを保ち、文脈の混線を防ぐ。 ・繰り返しの話題の再説明を減らし、セッションスコープの注入で提案精度を上げる。 ⚠️ 注意点 ・推論の深さに比例してコストが増えます(深さ2〜3はLLM呼び出しが増えるため、cadence設定で調整します)。 ・新規ピアはバックグラウンドのプリウォームが必要で、間に合わない場合は上限付きの同期フォールバックが働きます。 ・recallModeのtoolsモードはエージェントに制御を委ねますが明示的な推論呼び出しが必要で、contextモードはツールを隠すため柔軟性が下がります。サーバー側に状態を持つため、ファイル記憶からの移行にはデータエクスポートが必要です。 #HermesAgent# #Memory#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る
タオバオを運営するアリババが、ECサイトの「あなたへのおすすめ」を支えるレコメンドAI「RecGPT-V3」の技術レポートを公開した(https://arxiv[.]org/html/2607.15591v1)。数億人規模の日次アクティブユーザーを抱えるタオバオのホーム画面「Guess What You Like」枠に実際に投入し、本番A/Bテストまで行った上での報告。 前身のRecGPT-V1・V2は「ユーザーの行動履歴を読んでLLMに意図を推論させる」設計で成果を出してきたが、大規模運用の中で3つの壁にぶつかった。 1つ目は、リクエストのたびに行動履歴を全部読み直す非効率さ。V3は「Memory Hub」というユーザーごとの永続的な記憶層を新設した。ガジェット好き、バドミントン好き、育児中といった興味ごとにメモリユニットとして蓄積しておき、新しい行動が来たら該当ユニットだけを差分更新する仕組みに変えることで、ユーザー理解にかかる計算コストを55.8%削減している。 2つ目は、LLMが出す自然言語タグと実際の商品とのズレ。「バドミントンラケットスタンド」のようなタグ1つに幅広い商品群が対応してしまい、本当に欲しい商品を絞り込む手がかりが失われていた。V3ではLLM(ベースはQwen3-14B)の語彙に、商品の意味を離散コードで表す「Semantic ID」を65,536個追加し、自然言語とSemantic IDの両方で推論できるハイブリッドモデルにした。 3つ目は、精度を上げるための思考の連鎖(Chain-of-Thought、答えを出す前にLLMが踏む思考ステップ)が長すぎる問題。1サンプルあたり2,840トークンにも及ぶ思考過程が推論を遅くしていた。V3は「Latent Intent Reasoning」でこれをわずか10個の潜在トークンに圧縮しつつ、必要なときは人が読める説明文に復元できる仕組みも保っている。論文中の実例では、この10トークンだけから、本格派で攻撃的なプレースタイルのバドミントン好きでフルカーボンラケットやガットが必要、という趣旨の説明文まで復元できたと報告されている。出力トークン数は95.7%減り、処理速度は3.46倍(1,020秒から295秒)になった。 結果、本番A/Bテストではフィードで商品詳細ページ閲覧数(IPV)が1.28%、クリック率(CTR)が1.00%、取引件数(TC)が1.97%、流通取引総額(GMV)が3.97%向上しながら、サービング全体の計算コストは52.4%削減された。精度とコストを同時に改善できているのが実運用ならではの説得力がある。
もっと見る
# Hermes Agentの機能と実践的な使い方 🚀 開発者がエージェントと向き合う日常の窓口がCLIです。リポジトリ直下で `hermes` と打つだけで、対話・スラッシュコマンド・ワンショット実行まで全部こなせます。 📌 タイトルと機能のURL タイトル: CLI URL: 📝 概要 Hermes CLIはターミナル対話インターフェースです。会話ストリーム・固定の入力欄・現在のモデルやトークン使用量を示すステータスバーで構成され、スラッシュコマンドで挙動を細かく調整しながら作業できます。対話モードのほか、単発質問やセッション再開にも対応します。 🔧 機能の説明 ・起動モードは、対話(`hermes` または `hermes chat`)、単発質問(`hermes chat -q "..."`)、再開(`hermes --continue` / `hermes --resume `)があります。 ・ステータスバーはモデル名・トークン使用量(例 12.4K/200K)・色分けされたコンテキスト残量・推定コスト・圧縮回数・バックグラウンドタスク数・経過時間を表示します。 ・スラッシュコマンドが豊富です。`/model`(モデル切替)、`/personality`(人格切替: helpful, concise, technical, teacher など)、`/voice on|off|tts`、`/reasoning high`、`/background `、`/sessions`、`/usage`、`/tools`、`/status` などがあります。 ・長い会話はコンテキスト上限に近づくと自動要約(圧縮)され、既定で先頭3ターンと直近20ターンを保持して中間を要約します。 🛠 実践的な使い方 ・起動フラグで挙動を変えられます。`--model` / `--provider` でモデル指定、`-s`(`--skills`)でスキルのプリロード、`-w` で隔離されたgit worktree、`--tui` でモダンUI、`--yolo` でツール承認の自動許可です。 ・複数行入力は `Alt+Enter` / `Ctrl+J`、外部エディタ起動は `Ctrl+G`、エージェント中断は `Ctrl+C`(2秒以内に2回で強制終了)です。 ・`~/.hermes/config.yaml` の `quick_commands` にLLMを介さず実行するシェルコマンドを定義し、`/status` のように呼び出せます。 ・`busy_input_mode` を steer にすると、作業中の入力を `/steer` で現在の実行に注入できます。 🎯 ユースケース ・リポジトリ直下で「テストが落ちてる原因を調べて直して」と依頼し、進行を見ながら `/model` や `/reasoning` で調整する。 ・`/background` で並列の隔離セッションを立て、別タスクを同時進行させる。 ・`hermes chat -q "..."` を使い、スクリプトやパイプラインからワンショットで呼び出す。 ⚠️ 注意点 ・`Shift+Enter` の改行は端末依存で、標準のWindows TerminalやmacOS ・`/background` セッションはメインの会話履歴から完全に独立しており、前景の文脈を一切共有しません。 ・CLIは可読性のため最終応答からMarkdownの囲みや装飾を取り除きます(コードブロックやリストは保持)。音声モードは対応端末が必要です。 #HermesAgent# #DevTools#
もっと見る