登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 マルチモーダルAI
マルチモーダルAI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
マルチモーダルAI を含む検索結果
マルチモーダルAI(画像と文章を一緒に理解して答えるAI)が「自分で描いた図を本当に見て考えているか」を検証した論文が出た(https://arxiv[.]org/abs/2607.26769)。 GPT-5.5やGemini 3.5 Flashなどの最新モデルは、問題を解く途中で補助線を引いたり対象に印をつけたりと、人間が紙に書き込むような視覚的な操作を自分で生成しながら考えるようになってきた。ただ、その絵が答えを導く助けになっているのか、単なる飾りなのかは、これまできちんと切り分けられていなかった。 研究チームはSee2Thinkという評価の枠組みを作った。幾何・3D空間認識・日常シーンの読み取りなど12カテゴリ、合計1,200問を用意し、AIが「考える→図を描く→描いた結果を見てさらに考える」流れを記録する。実験の一つでは、AIに見せる描画結果をわざと間違ったものにすり替え、AIが本当にその絵に依存しているかも確かめた。 結果はややちぐはぐだった。AIが「どこに何を描くべきか」を選ぶ判断の妥当性(論文ではAction Relevanceと呼ぶ指標)は全体平均で96.4〜98.8%とほぼ満点なのに、実際に描いた絵が指示通り正確に再現されているか(Render Faithfulness)は58.6〜65.6%にとどまる。狙いは正しくても手元が狂う工程こそが最大のボトルネックで、どの条件が一番強いかもモデルごとにバラバラで万能な戦略はなかった。 「指定された麻雀牌を1枚拾う」のようなロボット操作の指示になると、モデルや条件を問わず正答率は0〜4%まで落ち込む。さらに、わざと間違った絵を見せる実験では特に3Dの空間問題で正答率が最大15.5ポイントも落ち込んだ。正確に描けても得点はさほど伸びないのに、間違った絵には引きずられて答えを変えてしまう。「絵を使って考えるAI」も、まだ自分の描いた絵を十分に使いこなせていない、という結果だ。
もっと見る
【新着】マルチモーダルAI「Jev-Omni」が1モデルで4モダリティに対応 動画版のJevはアツい。早速試してみます。 他のOSSは大抵どれか欠けるが、これは全部乗せで推論100ms未満。 ・text/image/audio/videoを1モデルで処理 ・Typed-benchmarksでJevと同水準(開発者主張) ・8×H200で3万件学習、データミックス重視 ・1台のH100で推論100ms未満 ↓詳細
もっと見る
先月新しく発表したマルチモーダル AI モデル【Gemini Omni】 テキストや画像からだけでなく、動画の文脈や物理法則まで深く理解し、高度な動画生成・編集が可能になりました🚀 開発者やクリエイターのみなさんの活用例をご紹介します👇
もっと見る
動画AIは、ブレた・遮蔽された映像も「等しく信じて」推論していました。その盲点に切り込む研究です。 タイトル:Confidence-Aware Tool Orchestration for Robust Video Understanding URL: ❓ 何が問題なの? 💡 Video-LLMは全フレームを等しく信頼できると暗黙に仮定しています(著者の言う「Blind Trust Problem」)。モーションブラーやグレア、遮蔽で映像が劣化しても気づかず、実世界ベンチで15〜30ポイントも精度が落ちます。しかも確信度はほぼ変わらない「静かな失敗」が起きます。 ❓ Robust-TOはどう解くの? 💡 フレーム単位の信頼度を推論の全段階に組み込みます。まず品質プロファイリングでブラー・輝度・遮蔽を採点して信頼できるフレームだけ選び、次にクエリをサブクエリに分解して劣化に強いツールへ振り分け、各ツールは(結果, 確信度)のペアを返します。 ❓ 確信度はどう使うの? 💡 証拠をhigh/medium/lowの3段階に分類。highで結論を出し、mediumは一致時のみ採用、lowは代替手段としてだけ使い、残る不確実性は回答に明記します。確信度-コスト報酬を含むGRPOで学習します。 ❓ どれくらい効くの? 💡 クリーン動画で平均56.4%(Gemini-2.5-Proを+10.6pt)、劣化動画で54.3%(オープンソース最強Video-R1を+5.8pt)。しかもフレームを32→20.7枚に絞り、推論を35%以上高速化しつつ精度+1.6ptも達成しています。 #動画理解# #マルチモーダルAI#
もっと見る
画像を見ながらOCRや検索といった外部ツールを使って答えを出すマルチモーダルAIエージェントの評価を、最終的な正解率だけで済ませるのは足りない、と指摘する論文が出た( 正解にたどり着けたとしても、それが根拠のある推論の結果なのか、途中の誤りがたまたま打ち消し合って正解しただけなのかは、最終的な正誤だけでは見分けがつかない。論文はこうした失敗パターンを4つに整理しているが、なかでも厄介なのが「Phantom Grounding」と呼ぶ現象だ。証拠そのものは正しく引用しているのに、結論に出てくる数字や固有名詞がその証拠には書かれていない、一見もっともらしいのに中身が伴わないケースを指す。 研究チームが提案するLedgerMindは、推論の途中経過を1本のテキストに垂れ流すのをやめ、ツールの出力(OCR結果や検索結果など)を出どころ・種類・信頼度付きの「証拠台帳(Structured Evidence Ledger)」として記録する。以降の推論は台帳に載っている証拠しか引用できないうえ、引用しているだけでは不十分だとして、結論の数字や固有名詞が引用元の証拠と実際に一致しているかまで照合する。簡単な質問には軽い経路、複雑な質問には重い経路へ自動で振り分け、余計な深読みで正しい答えを崩す「考えすぎ」も防ぐ。さらに、間違いに気づいたときの修正も自由に書き直させず、証拠の差し替えやツールの呼び直しなど決まった操作だけに絞っている。自由な書き直しは、直しているつもりで新しい未検証の主張を紛れ込ませやすいためだ。 VTC-Benchというベンチマークでは、Gemini-3-Flashと組み合わせて58.9%(同じモデル単体の素の性能から+12.4ポイント)まで伸ばし、既存手法の最高値を更新している。検証した中で一番性能が低かったKimi-K2.6ほど伸び幅が大きく、あるサブベンチマークでは正解率が19.5%から46.0%(+26.5ポイント)まで跳ね上がった。もっとも興味深いのはアブレーション実験(仕組みを1つずつ外して効果を確かめる実験)で、この証拠台帳を丸ごと外すと正解率が68.9%から53.5%まで急落する。「証拠を引用しろ」と指示するだけでは足りず、構造として引用先を強制する部分こそが効いている、という結果だ。
もっと見る
TL;DR コードを書いて画像や動画を生成するAIは、コードの実行が成功しても見た目の要求を満たしているかは別問題です。この「プログラムと視覚のギャップ」を測る評価手法が提案されました。 タイトル: MaLiang-Harness: A Programmable Path to Image and Video Generation URL: ポイント 🖼️ 状態を保持しながら生成物を検査・修正するステートフルなフレームワーク 🔧 コードの変更と映像の結果を対応づける追跡可能な生成プロセスを導入 🎨 Canvas・SVG・Three.jsなど複数バックエンドを共通プロトコルで統一 📊 画像生成50タスクでGPT-6-Astraが成功率100%・品質基準クリア96.0% 🎬 動画生成13タスクでもGPT-6-Astraが成功率100%・品質基準クリア76.9% ⚠️ DeepSeek系は画像で12〜40%、動画では0%と大きく苦戦 🔍 汎用能力スコアが同じ2モデルでも描画品質の合格率は44%対88%と激しく食い違う 汎用ベンチマークのスコアだけではモデルの実力を測れない、という指摘が特に刺さります。 #マルチモーダルAI# #画像生成#
もっと見る
🎨 「見る」と「創る」を同じモデルの中で育て合わせる、統合視覚AIの新作が登場しました。 タイトル: SenseNova-U1.5: Towards Native Unified Visual Intelligence URL: 🧩 概要 OpenSenseNovaが開発した8B規模のMixture-of-Transformersモデルで、外部の視覚エンコーダやVAEを一切使わず、生のピクセルを直接扱いながら画像理解・推論・生成・編集を1つのモデルでこなします。 ⚙️ 解決する課題 従来の統合モデルは理解系と生成系で別々の潜在空間を経由することが多く、整合性のロスが生じがちでした。理解と生成を共有表現の上で本当に一体化させることを目指しています。 🛠 方法論と提案手法 視覚トークンを2次元特徴フィールドに投影し、隣接する32×32領域間で情報をやり取りしながら再構成する空間デコーダを採用。さらに美的品質・OCR・編集・インフォグラフィックの4専門家をRLで個別に鍛えた後、On-Policy Distillationで1つのモデルへ統合します。 📊 実験結果 GenEval総合0.92、画像編集ベンチマークImgEditで4.59(前作U1は3.90)、ビジネス文書生成BizGenEvalでは前作51.4%から72.2%へ大幅向上と、理解・生成・編集の全方位で前作や競合を上回りました。 #統合マルチモーダルAI# #画像生成#
もっと見る
🦢 TL;DR: 「聞く・話す・割り込む」のタイミングはトップクラス、でもタスク遂行はまだ発展途上。Tencentが音声・映像・エージェントを1つに統合したomni対話モデルを発表しました。 タイトル: Omni Interaction Agent Technical Report(Gander) URL: 📌 ポイント 🧠 「小脳(対話制御)」と「大脳(Claude/Codexで実行)」の二層構造 🎙 音声・映像をチャンク単位でストリーミング処理、外部VAD不要 ✅ ターンテイキング精度100%でGPT-Realtimeの96%を上回る ⚠️ タスク完遂率(Pass@1)は0.400とGPT-Realtimeの0.600に劣る 🔀 音声認識を介さずテキストを直接渡すとPass@1が0.520に改善 🌐 音声×映像の統合でDaily-Omniが単一モダリティ比+19.13pt向上 📦 モデル重み・学習コード・評価ハーネスを公開予定 対話のテンポの良さと、タスクをやり切る正確さは今のところ別物という現実的な結果が興味深いです。 #マルチモーダルAI# #音声対話AI#
もっと見る
TL;DR 視覚生成そのものを推論の媒体として扱う「ネイティブ視覚推論」を、大規模データと検証可能な報酬で訓練・評価できるスイートが登場しました。VLM審判の評価は同一動画で最大92.8%もスコアが揺れることが示されています。 タイトル: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning URL: ポイント 📊 300タスク・125万訓練インスタンス・約347万画像/130万動画の大規模データセット 🎯 HSV色分割やOCRなど古典的CVで属性抽出する決定論的スコアラー、人間一致度0.60以上でGPT-5.5やGemini-3.1-Proを上回る 🌀 予測ノイズと新規ノイズの係数和を保存するCoefficients-Preserving Sampling(CPS)でRL探索を安定化 🚀 外部ベンチマークV-ReasonBenchで10.21→38.22(+28.01pt)と大幅な転移性能を確認 🔬 反事実診断で入力画像削除時に-90%とスコアが激減、視覚軌跡が言語より推論の本質と判明 ✅ 検証可能な報酬によるRLがVLM報酬RLよりインドメインで+7.9%改善 視覚推論の「言語頼み」を脱却し、視覚そのものを訓練・検証可能にする基盤という点が印象的です。 #視覚推論# #マルチモーダルAI#
もっと見る
🧠 「もう画面に映っていない情報」を覚えて行動できますか? 最新のマルチモーダルLLMでも、神経衰弱や3D迷路でボロボロに崩れることが分かりました。 📰 タイトル: Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games 🔗 URL: 💡 概要 MLLMが「過去の見えない観測」を内部に保持して行動できるかを測る新ベンチマーク「RNG-Bench」の提案です。神経衰弱(Matching Pairs)と一人称視点の3D迷路という2つのゲームで、文脈内の信念状態トラッキングだけを切り出して評価します。 🔍 解決する課題 既存ベンチは状態を全部見せたり、エピソード後に「思い出して答える」だけを測りがちでした。本研究は記憶ミスがその後の観測を変えてしまう「思い出して行動する」閉ループ設定に踏み込み、より現実のエージェントに近い難しさを測ります。 🛠 方法論と提案手法 ・ゲームをPOMDP(部分観測マルコフ決定過程)として定式化し、履歴から信念状態を維持する力を要求 ・グリッドサイズ、視覚パターン、テキスト/画像モダリティで難易度を細かく制御 ・2モデルが同一盤面で戦うDuel、真の隠れ状態を注入するOracleを用意 ・通常時とOracle時を比べる「Memory Gap」指標で、忘却と判断ミスを切り分け 📊 ユースケース / 実験結果 10×10神経衰弱でGPT-5.4が62.3%、Gemini-3.1-Proが50.0%、Qwen3.5-397Bが25.3%。13×13迷路ではGemini-3.1-ProがSR50%で首位。Qwen3.5-397Bは4×4で90.6%→12×12で0.7%へ崩壊。行動履歴のテキストを消すとGPT-5.4は約75%性能低下し、履歴の長さより視覚認識が壁になると判明しました。 #マルチモーダルLLM# #AIエージェント#
もっと見る