登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 MLLM
MLLM コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
MLLM を含む検索結果
ファンクラブBlog更新🆙🍑⭐︎ 『うーか飯⭐︎自炊達人への道』 ↪︎ コメントは今度ファンクラブ内でのラジオ動画で読むよ〜♪コメント待ってます☺️ ほんっまにおいしかったこれだけ載せちゃお🍑 お母さんが送ってくれた桃で作りました🥰感謝
もっと見る
VideoChat3が発表された(https://arxiv[.]org/html/2607.14935v1)。南京大学や上海AI研究所などの研究チームによる完全オープンソースの動画理解MLLM(マルチモーダル大規模言語モデル)で、パラメータ数はわずか4Bながら、同規模のQwen3-VL-4Bとの直接比較19項目中18項目で上回っている。 動画理解が難しいのは、静止画と違って動きや前後の文脈まで把握する必要があるからだ。既存モデルの多くはフレームを1枚ずつ独立した画像として処理するため、長尺動画やライブ配信でトークン数(モデルが処理する情報の単位)が爆発的に増えて重くなりがちだった。 そこでVideoChat3は視覚エンコーダー(映像を数値情報に変換する部品)にI3D-ViTを導入した。隣接フレームをまとめて空間・時間の両方向で処理してから時間方向に圧縮し、既存の空間圧縮と組み合わせて映像トークン数を全体で16分の1に減らしている。 さらにライブ配信向けにAdaptive Frame Resolutionという仕組みも入れた。サッカー中継で中盤のパス回しは流し見してゴール前だけ集中するのと同じ発想で、「見送り」「注視準備」「応答」の3状態を切り替えながら重要な瞬間だけ高解像度で処理する。ここの学習設計が面白い。素直に全フレームへ同じ重みで学習させると「見送り」ばかり選んでほとんど応答しなくなり(F1スコア5.8)、逆に状態の切り替わる瞬間だけに絞ると、映像を見なくても直前のパターンから「とりあえず応答する」抜け道を覚えてしまい、当たっていたのは11.8%だけだった(見逃しは少なく再現率97.9%なのに)。両者をバランスさせる工夫で、最終的にF1スコアを35.5まで引き上げている。 ベンチマークでもMotionBenchで61.7点、TempCompassで75.6点とオープンモデル最高スコアを記録し、ストリーミング理解のODVBenchではオンライン動画理解に特化したStreamForestを12.4ポイント上回る72.3を出した。長尺動画の処理も速く、2048フレームの動画ではQwen3-VL比でレイテンシを44.4秒から20.4秒に短縮している。 モデルの重みだけでなく学習コード・学習戦略・約300万件のデータセットまで全部公開しているのも特徴で、再現性を重視した設計思想が伝わってくる。
もっと見る
🧠 「もう画面に映っていない情報」を覚えて行動できますか? 最新のマルチモーダルLLMでも、神経衰弱や3D迷路でボロボロに崩れることが分かりました。 📰 タイトル: Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games 🔗 URL: 💡 概要 MLLMが「過去の見えない観測」を内部に保持して行動できるかを測る新ベンチマーク「RNG-Bench」の提案です。神経衰弱(Matching Pairs)と一人称視点の3D迷路という2つのゲームで、文脈内の信念状態トラッキングだけを切り出して評価します。 🔍 解決する課題 既存ベンチは状態を全部見せたり、エピソード後に「思い出して答える」だけを測りがちでした。本研究は記憶ミスがその後の観測を変えてしまう「思い出して行動する」閉ループ設定に踏み込み、より現実のエージェントに近い難しさを測ります。 🛠 方法論と提案手法 ・ゲームをPOMDP(部分観測マルコフ決定過程)として定式化し、履歴から信念状態を維持する力を要求 ・グリッドサイズ、視覚パターン、テキスト/画像モダリティで難易度を細かく制御 ・2モデルが同一盤面で戦うDuel、真の隠れ状態を注入するOracleを用意 ・通常時とOracle時を比べる「Memory Gap」指標で、忘却と判断ミスを切り分け 📊 ユースケース / 実験結果 10×10神経衰弱でGPT-5.4が62.3%、Gemini-3.1-Proが50.0%、Qwen3.5-397Bが25.3%。13×13迷路ではGemini-3.1-ProがSR50%で首位。Qwen3.5-397Bは4×4で90.6%→12×12で0.7%へ崩壊。行動履歴のテキストを消すとGPT-5.4は約75%性能低下し、履歴の長さより視覚認識が壁になると判明しました。 #マルチモーダルLLM# #AIエージェント#
もっと見る
製造業のAI活用、つまずきの本当の原因は「目(視覚)」ではなく「知識」でした🏭 18種類の最先端モデルを徹底検証して、その事実を突き止めた研究です。 タイトル: FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios URL: 🏭 概要 本研究は、製造現場でマルチモーダルLLM(MLLM)がどこまで実用に耐えるかを、厳密に測るための評価フレームワーク「FORGE」を提案しています。2D画像と3D点群(point cloud)を組み合わせ、型番などの細かいドメイン情報を付与した高品質なデータセットを構築し、18種類の最先端MLLMを横断的に評価しました。 ❓ 解決する課題 製造業はAI活用を急速に進めていますが、その性能を正しく測る基盤が追いついていませんでした。 ・製造現場の高品質なマルチモーダルデータ(実機画像や3D形状)は希少で、評価用データが不足しています ・既存データセットは、型番・構造的な欠陥・組立の正誤といった製造特有の細粒度な意味情報を欠いています そのため、現行のMLLM評価は実際の製造業の要求を反映できていませんでした。 💡 方法論と提案手法 FORGEは、現実的な条件で能力を測るために設計されています。 ・実世界の2D画像と3D点群を含む高品質なマルチモーダルデータで構成します ・正確な型番を含む、製造特有の細粒度ドメイン意味アノテーションを付与します ・評価する中核タスクは3つです ・ワークピース検証(対象部品が正しいものか) ・構造表面検査(表面の欠陥や状態の確認) ・組立検証(組み付けが正しく行われているか) 🌍 ユースケース / 実験結果 検証から、実務に直結する重要な知見が得られました。 ・評価したMLLM群の間で、性能に大きなギャップが存在することが判明しました ・従来の想定に反し、視覚的グラウンディング(画像中の対象を特定する力)はボトルネックの本質ではありませんでした ・真のボトルネックは「ドメイン固有知識の不足」であると結論づけられました ・この知見を裏付けるように、コンパクトな3Bパラメータのモデルを教師ありファインチューニングしたところ、未知の製造シナリオで最大90.8%の相対精度改善を達成しました 巨大な汎用モデルに頼るより、小型モデルを自社の現場データで鍛える方が、検査や品質管理で現実的な解になり得ます。 #製造業AI# #MLLM#
もっと見る
🖼 画像編集のテスト時スケーリングは「どんな編集にも同じ計算予算」を割り当てがちで、無駄だらけでした。難易度に応じて配分し、編集に特化した検証で枝刈りすることで、品質を保ったまま最大2.2倍の高速化を実現した研究です。 タイトル: From Scale to Speed: Adaptive Test-Time Scaling for Image Editing URL: 📝 概要 ADE-CoTは、目的志向の画像編集に特化したテスト時スケーリング手法です。テキストから画像を作る生成向けに作られた従来のImage-CoTをそのまま編集に流用するのではなく、「難易度に応じた資源配分」「編集特化の早期検証」「機会主義的な停止」という3つの戦略を組み合わせ、計算を大きく節約しながら品質を維持します。 ❓ 解決する課題 従来手法には3つのミスマッチがありました。 ・固定のサンプリング予算が、ほとんど改善しない簡単な編集にも計算を浪費する ・汎用のMLLMスコアが、早期スコアは低くても最終的に高得点になるサンプルの約40%を誤って枝刈りしてしまう ・大規模サンプリングが同一の正解を何度も生み、不要な計算を増やす 💡 方法論と提案手法 ・編集の難易度を見て、簡単な編集は最小予算、複雑な編集は探索を拡大します ・ワンステップ・プレビューで、追加のデノイジングなしにノイズ中間状態からクリーンな潜在を推定し、早期検証を信頼できるものにします ・Grounded SAM2で「意図した領域だけが変わったか」を検証し、DINOv2の埋め込みで冗長な候補を除去します ・候補を逐次生成し、意図に合う結果が十分に得られた時点で打ち切る深さ優先の停止を使います 🎯 ユースケース 複雑な姿勢変更、複数オブジェクトの削除や置換、細粒度の領域編集、マルチターンの逐次編集、そして計算制約下での高品質編集に向きます。本番の画像編集APIのように推論コストが効く場面で特に有効です。 📊 実験結果 ・GEdit-Benchで、FLUX.1 KontextがBest-of-N比2.2倍、BAGELが1.8倍、Step1X-Editが2.0倍の高速化を達成しました ・推論効率は固定32サンプル予算で2倍超、結果効率は3つのベンチで4.9倍・2.7倍・2.9倍に向上しました ・「白い服の女性の隣に立つ人を消す」といった難しい複数オブジェクト編集でも、ベースラインの誤認を正しく解決しました #ImageEditing# #DiffusionModels#
もっと見る