登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 マルチモーダルLLM
マルチモーダルLLM コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
マルチモーダルLLM を含む検索結果
🧠 「もう画面に映っていない情報」を覚えて行動できますか? 最新のマルチモーダルLLMでも、神経衰弱や3D迷路でボロボロに崩れることが分かりました。 📰 タイトル: Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games 🔗 URL: 💡 概要 MLLMが「過去の見えない観測」を内部に保持して行動できるかを測る新ベンチマーク「RNG-Bench」の提案です。神経衰弱(Matching Pairs)と一人称視点の3D迷路という2つのゲームで、文脈内の信念状態トラッキングだけを切り出して評価します。 🔍 解決する課題 既存ベンチは状態を全部見せたり、エピソード後に「思い出して答える」だけを測りがちでした。本研究は記憶ミスがその後の観測を変えてしまう「思い出して行動する」閉ループ設定に踏み込み、より現実のエージェントに近い難しさを測ります。 🛠 方法論と提案手法 ・ゲームをPOMDP(部分観測マルコフ決定過程)として定式化し、履歴から信念状態を維持する力を要求 ・グリッドサイズ、視覚パターン、テキスト/画像モダリティで難易度を細かく制御 ・2モデルが同一盤面で戦うDuel、真の隠れ状態を注入するOracleを用意 ・通常時とOracle時を比べる「Memory Gap」指標で、忘却と判断ミスを切り分け 📊 ユースケース / 実験結果 10×10神経衰弱でGPT-5.4が62.3%、Gemini-3.1-Proが50.0%、Qwen3.5-397Bが25.3%。13×13迷路ではGemini-3.1-ProがSR50%で首位。Qwen3.5-397Bは4×4で90.6%→12×12で0.7%へ崩壊。行動履歴のテキストを消すとGPT-5.4は約75%性能低下し、履歴の長さより視覚認識が壁になると判明しました。 #マルチモーダルLLM# #AIエージェント#
もっと見る
製造業のAI活用、つまずきの本当の原因は「目(視覚)」ではなく「知識」でした🏭 18種類の最先端モデルを徹底検証して、その事実を突き止めた研究です。 タイトル: FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios URL: 🏭 概要 本研究は、製造現場でマルチモーダルLLM(MLLM)がどこまで実用に耐えるかを、厳密に測るための評価フレームワーク「FORGE」を提案しています。2D画像と3D点群(point cloud)を組み合わせ、型番などの細かいドメイン情報を付与した高品質なデータセットを構築し、18種類の最先端MLLMを横断的に評価しました。 ❓ 解決する課題 製造業はAI活用を急速に進めていますが、その性能を正しく測る基盤が追いついていませんでした。 ・製造現場の高品質なマルチモーダルデータ(実機画像や3D形状)は希少で、評価用データが不足しています ・既存データセットは、型番・構造的な欠陥・組立の正誤といった製造特有の細粒度な意味情報を欠いています そのため、現行のMLLM評価は実際の製造業の要求を反映できていませんでした。 💡 方法論と提案手法 FORGEは、現実的な条件で能力を測るために設計されています。 ・実世界の2D画像と3D点群を含む高品質なマルチモーダルデータで構成します ・正確な型番を含む、製造特有の細粒度ドメイン意味アノテーションを付与します ・評価する中核タスクは3つです ・ワークピース検証(対象部品が正しいものか) ・構造表面検査(表面の欠陥や状態の確認) ・組立検証(組み付けが正しく行われているか) 🌍 ユースケース / 実験結果 検証から、実務に直結する重要な知見が得られました。 ・評価したMLLM群の間で、性能に大きなギャップが存在することが判明しました ・従来の想定に反し、視覚的グラウンディング(画像中の対象を特定する力)はボトルネックの本質ではありませんでした ・真のボトルネックは「ドメイン固有知識の不足」であると結論づけられました ・この知見を裏付けるように、コンパクトな3Bパラメータのモデルを教師ありファインチューニングしたところ、未知の製造シナリオで最大90.8%の相対精度改善を達成しました 巨大な汎用モデルに頼るより、小型モデルを自社の現場データで鍛える方が、検査や品質管理で現実的な解になり得ます。 #製造業AI# #MLLM#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る
LM Studio内にインストールされているローカルLLM Gemma 4 12B QATをComfyUIから直接呼び出せるようにした。 併せて、別サーバのLM StudioにAPI接続するのも切り替え可能。 これで、Qwen 3.6系とGemma 4 QAT系が同時に使えるようになった。 動画分析はマルチモーダルのGemma 4 12B QATのほうが速い印象がありますね。
もっと見る
⚙️ 月125兆トークンを捌くLLM推論基盤は、どう信頼性とコストを両立しているのか。リクエスト数ではなく「モデルユニット」でコストを測り、GPUコストを80%削減しつつ安定運用を実現したDatabricksの実戦知です。 タイトル: Reliable LLM Inference at Scale URL: 📝 概要 本記事は、大規模なLLM推論を信頼性高く・コスト効率よく運用するための、Databricksのアーキテクチャと手法を解説します。GPUインフラの不安定さや、予測困難なリクエストコストといった本番特有の課題に、具体的な仕組みで対処しています。 ❓ 解決する課題 ・GPUインフラはCPUより本質的に不安定で、prefill/decodeを分離した構成では単一障害が複数ノードに波及します ・リクエストコストは事前推定が難しく、出力トークン生成がレイテンシを支配する一方、その時間は予測困難です ・高負荷時には、リクエストの組み合わせ次第で健全なサーバが突然不健全状態に陥ります 💡 方法論と提案手法 ・コストを「α×入力トークン+β×出力トークン+γ×マルチモーダル」とモデル化する「モデルユニット」抽象を導入し、係数はモデル/ハードウェアごとの自動ベンチマークで決定します ・自動シャーダーDicerが、キュー長でなくモデルユニットで測ったサーバ負荷でルーティングし、ステートフルセッションでキャッシュヒット率を高めます ・保留リクエスト数でなく「モデルユニット利用率」でオートスケールし、ピーク閾値に近づくと増設します ・ブラックボックスのヘルスチェックでサイレントハングを検知し、ヘルスチェックを最高優先度にして誤検知を防ぎます 🎯 ユースケース Superhumanやコーディングエージェント、サポートボットなど、トラフィックが数時間で急増するマルチテナントのエージェント型アプリを支えます。LLMアプリが単一テナントから共有本番環境へ移る局面に直結します。 📊 実験結果 ・コスト認識オートスケーリングで、静的なピーク見込みプロビジョニング比のGPUコストを80%超削減しました ・ヘルスチェックの誤検知を週数件からゼロへ、サイレント障害の検知・回復は5分未満に収めました ・画像処理をTorchvisionへ切り替え、OMP_NUM_THREADSをコンテナ上限に正しく設定し、同じレプリカ・負荷でスループットを3倍超に跳ね上げました ・月125兆トークンをマルチテナントで処理しています #LLM# #MLOps#
もっと見る
【報道発表】アリババ、Qwenシリーズ最大規模・最高性能の旗艦AIモデル「Qwen3.8-Max」を発表 ▶️ 🟢総パラメータ数2兆4,000億、最大100万トークンのコンテキストウィンドウに対応。Text Arenaで5位、Vision Arenaで2位にランクインし、圧倒的な性能を実現 🟢先端のスパースMoEアーキテクチャにより高性能と高効率を両立。自律型コーディングやマルチモーダル機能で、複雑で長期的なタスクもスマートに処理 #Qwen# #Qwen3#.8-Max #AI# #LLM# #アリババクラウド#
もっと見る
AIエージェントの回答を「検証可能で説明できる事実」に根拠づける——ナレッジグラフ+GraphRAG+エージェントのフルスタックをまるごとオープンソースで提供する基盤です🕸️ タイトル: trustgraph-ai/trustgraph URL: 🕸️ 概要 AIエージェントのためのオープンソースのセマンティック・デプロイメント基盤です。コアは「コンテキストグラフ」(ドメイン知識を構造化しクエリ可能にした表現)。コンテキストグラフ・メモリ・検索・オーケストレーション・推論を、決定論的なエージェント向けにフルスタックで提供します。 ❓ 解決する課題 LLM単体では、なぜその答えになったのかを辿りにくく、ハルシネーションのリスクもあります。 ・エージェントの回答を、検証可能で説明可能な事実に根拠づけるのが難しい ・TrustGraphはナレッジグラフ構築とGraphRAGを組み合わせ、意味的に豊かで検証可能なコンテキストにアクセスできるようにします ・しかも主権的に管理できるプライベート環境で実現します 💡 主な特徴 ・マルチモデルDB(表・KV・ドキュメント・グラフ・ベクトル)とマルチモーダル対応、エンティティ/関係の自動抽出 ・DocumentRAG・GraphRAG・OntologyRAGのパイプラインと、3D GraphVizによる可視化 ・単一/マルチエージェント、ReAct・Plan-then-Execute・Supervisorパターン、MCP統合 ・Context Cores:スキーマ・グラフ・埋め込み・エビデンス・検索ポリシーを束ね、コンテキストをコードのようにバージョン管理 🌍 技術スタック / 使い方 ストレージはCassandra・Qdrant・Garage、メッセージングはPulsar等、LLMはAnthropic/OpenAI/Google等+ローカル推論(vLLM/Ollama等)に対応。npx @trustgraph/configで構成し、ポート8888のUIから利用できます。Apache 2.0ライセンスです。 #GraphRAG# #ナレッジグラフ#
もっと見る
便利だけど知られていないGemini APIの機能 📑 1,000ページのPDF、テキストも図表もまとめて理解。ドキュメント処理の次元が変わります。 Geminiの「ドキュメント処理(Document understanding)」は、最大1,000ページのPDF等をマルチモーダル(テキスト+図表+画像)で理解する機能です。テキスト抽出だけでは得られない深い文書理解を実現します。 📌 タイトル:ドキュメント処理(Document understanding) 🔗 URL: 🧩 概要 PDFや文書の処理といえば、従来はOCRでテキストを抽出するのが主流でした。しかし、図表、グラフ、レイアウト情報まで含めて理解するのは困難でした。Geminiのドキュメント処理は、ページをマルチモーダルに「見て」理解するため、テキストだけでなく図表やレイアウトの情報も含めた回答が可能です。最大1,000ページまで対応。 🛠 使い方 PDFファイルをFiles APIでアップロードするか、インラインでリクエストに含めます。ページ単位でGeminiが視覚的に解釈し、テキスト、表、図、グラフなどを総合的に理解。「この表のデータを集計して」「3章の図の内容を説明して」のような質問に回答できます。 🏗 本番システムへの組み込み方 ・契約書レビュー:数百ページの契約書を丸ごと渡して、特定条項の検索や条件の比較分析を自動化。 ・決算報告書の分析:財務諸表の図表を読み取り、数値の傾向やリスクを自動で抽出・要約。 ・技術文書の理解:設計書やスペックシートの図面・表を含めた質問応答。 ・学術論文の分析:論文のグラフや実験結果の表を理解した上での要約・比較分析。 💡 ユースケース 📋 契約書・法務文書の自動レビュー 💹 決算報告書・財務諸表の分析 🔧 技術仕様書の図面を含む理解 🔬 学術論文のグラフ・表を含む分析 ⚠️ 注意点 スキャンされたPDFの品質が低い場合、読み取り精度が下がる可能性があります。また、1,000ページ対応とはいえ、コストとレイテンシはページ数に比例して増加します。必要なページ範囲を絞って渡す工夫も重要です。機密文書を扱う場合はデータの取り扱いポリシーも確認しましょう。 ✨ 「テキストだけ抽出」の時代から「図表も含めて丸ごと理解」の時代へ。まずは図表の多い文書でその実力を試してみてください。 #Gemini# #LLM#
もっと見る
動画AIは、ブレた・遮蔽された映像も「等しく信じて」推論していました。その盲点に切り込む研究です。 タイトル:Confidence-Aware Tool Orchestration for Robust Video Understanding URL: ❓ 何が問題なの? 💡 Video-LLMは全フレームを等しく信頼できると暗黙に仮定しています(著者の言う「Blind Trust Problem」)。モーションブラーやグレア、遮蔽で映像が劣化しても気づかず、実世界ベンチで15〜30ポイントも精度が落ちます。しかも確信度はほぼ変わらない「静かな失敗」が起きます。 ❓ Robust-TOはどう解くの? 💡 フレーム単位の信頼度を推論の全段階に組み込みます。まず品質プロファイリングでブラー・輝度・遮蔽を採点して信頼できるフレームだけ選び、次にクエリをサブクエリに分解して劣化に強いツールへ振り分け、各ツールは(結果, 確信度)のペアを返します。 ❓ 確信度はどう使うの? 💡 証拠をhigh/medium/lowの3段階に分類。highで結論を出し、mediumは一致時のみ採用、lowは代替手段としてだけ使い、残る不確実性は回答に明記します。確信度-コスト報酬を含むGRPOで学習します。 ❓ どれくらい効くの? 💡 クリーン動画で平均56.4%(Gemini-2.5-Proを+10.6pt)、劣化動画で54.3%(オープンソース最強Video-R1を+5.8pt)。しかもフレームを32→20.7枚に絞り、推論を35%以上高速化しつつ精度+1.6ptも達成しています。 #動画理解# #マルチモーダルAI#
もっと見る