登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 統合マルチモーダルAI
統合マルチモーダルAI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
統合マルチモーダルAI を含む検索結果
🎨 「見る」と「創る」を同じモデルの中で育て合わせる、統合視覚AIの新作が登場しました。 タイトル: SenseNova-U1.5: Towards Native Unified Visual Intelligence URL: 🧩 概要 OpenSenseNovaが開発した8B規模のMixture-of-Transformersモデルで、外部の視覚エンコーダやVAEを一切使わず、生のピクセルを直接扱いながら画像理解・推論・生成・編集を1つのモデルでこなします。 ⚙️ 解決する課題 従来の統合モデルは理解系と生成系で別々の潜在空間を経由することが多く、整合性のロスが生じがちでした。理解と生成を共有表現の上で本当に一体化させることを目指しています。 🛠 方法論と提案手法 視覚トークンを2次元特徴フィールドに投影し、隣接する32×32領域間で情報をやり取りしながら再構成する空間デコーダを採用。さらに美的品質・OCR・編集・インフォグラフィックの4専門家をRLで個別に鍛えた後、On-Policy Distillationで1つのモデルへ統合します。 📊 実験結果 GenEval総合0.92、画像編集ベンチマークImgEditで4.59(前作U1は3.90)、ビジネス文書生成BizGenEvalでは前作51.4%から72.2%へ大幅向上と、理解・生成・編集の全方位で前作や競合を上回りました。 #統合マルチモーダルAI# #画像生成#
もっと見る
🦢 TL;DR: 「聞く・話す・割り込む」のタイミングはトップクラス、でもタスク遂行はまだ発展途上。Tencentが音声・映像・エージェントを1つに統合したomni対話モデルを発表しました。 タイトル: Omni Interaction Agent Technical Report(Gander) URL: 📌 ポイント 🧠 「小脳(対話制御)」と「大脳(Claude/Codexで実行)」の二層構造 🎙 音声・映像をチャンク単位でストリーミング処理、外部VAD不要 ✅ ターンテイキング精度100%でGPT-Realtimeの96%を上回る ⚠️ タスク完遂率(Pass@1)は0.400とGPT-Realtimeの0.600に劣る 🔀 音声認識を介さずテキストを直接渡すとPass@1が0.520に改善 🌐 音声×映像の統合でDaily-Omniが単一モダリティ比+19.13pt向上 📦 モデル重み・学習コード・評価ハーネスを公開予定 対話のテンポの良さと、タスクをやり切る正確さは今のところ別物という現実的な結果が興味深いです。 #マルチモーダルAI# #音声対話AI#
もっと見る
AIエージェントの回答を「検証可能で説明できる事実」に根拠づける——ナレッジグラフ+GraphRAG+エージェントのフルスタックをまるごとオープンソースで提供する基盤です🕸️ タイトル: trustgraph-ai/trustgraph URL: 🕸️ 概要 AIエージェントのためのオープンソースのセマンティック・デプロイメント基盤です。コアは「コンテキストグラフ」(ドメイン知識を構造化しクエリ可能にした表現)。コンテキストグラフ・メモリ・検索・オーケストレーション・推論を、決定論的なエージェント向けにフルスタックで提供します。 ❓ 解決する課題 LLM単体では、なぜその答えになったのかを辿りにくく、ハルシネーションのリスクもあります。 ・エージェントの回答を、検証可能で説明可能な事実に根拠づけるのが難しい ・TrustGraphはナレッジグラフ構築とGraphRAGを組み合わせ、意味的に豊かで検証可能なコンテキストにアクセスできるようにします ・しかも主権的に管理できるプライベート環境で実現します 💡 主な特徴 ・マルチモデルDB(表・KV・ドキュメント・グラフ・ベクトル)とマルチモーダル対応、エンティティ/関係の自動抽出 ・DocumentRAG・GraphRAG・OntologyRAGのパイプラインと、3D GraphVizによる可視化 ・単一/マルチエージェント、ReAct・Plan-then-Execute・Supervisorパターン、MCP統合 ・Context Cores:スキーマ・グラフ・埋め込み・エビデンス・検索ポリシーを束ね、コンテキストをコードのようにバージョン管理 🌍 技術スタック / 使い方 ストレージはCassandra・Qdrant・Garage、メッセージングはPulsar等、LLMはAnthropic/OpenAI/Google等+ローカル推論(vLLM/Ollama等)に対応。npx @trustgraph/configで構成し、ポート8888のUIから利用できます。Apache 2.0ライセンスです。 #GraphRAG# #ナレッジグラフ#
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る
感染症の流行を数分で予測できたら、人道支援の現場はどれほど変わるか。 タイトル: Planetary prediction engine: Automating global models via Earth AI URL: Googleが発表したPlanetary Prediction Engine(PPE)は、自然言語クエリから地球規模の予測モデルを自動構築するシステムです。公衆衛生・食料安全保障・感染症などの課題に対し、従来は専門エンジニアが数週間かけていたデータキュレーション〜モデル構築を数分で完結させます。 注目ポイント 🌍 3段階の自動パイプライン——データ選択からモデルまで 自然言語クエリを地理的制約に変換してData Commons・Google Earth Engineから共変量を取得(ステージ1)、Population Dynamics Foundation ModelsとAlphaEarthの埋め込みと融合(ステージ2)、正則化線形・勾配ブースティング・MLPを横断的に探索(ステージ3)。各ステージに「Feature Gate(リーケージ防止)」と「Overfitting Guard Protocol(過学習防止)」が組み込まれています。 🔬 マルチモーダル融合が全実験で単独モデルを上回る 構造化された統計的共変量と基盤モデルの潜在表現を組み合わせることで、どちらか単独では捉えきれない情報を統合します。この融合効果はすべての実験で確認されており、地理空間予測における新たなアーキテクチャの優位性を示しています。 📊 3つのドメインで実証された精度向上 ・米国CDC健康指標21種: R² 76.8% vs ベースライン60.0% ・ナイジェリア食料安全保障: R² 66.1% vs ベースライン31.5%(精度2倍超) ・コンゴ民主共和国エボラ予測: Recall@10 83.3%(Bayesianベースライン比+10.3pp) 専門的なエンジニアリングチームを持たない人道支援組織や研究者が、緊急時に数分で意思決定の根拠を得られる——この「民主化」こそがPPEの最大のインパクトです。 #地球科学AI# #公衆衛生#
もっと見る
# Weaviateの機能と実践的な使い方 🚀 埋め込みAPIの呼び出しコードをアプリから消したいと思ったことはありませんか。Weaviateのモデルプロバイダ統合を使えば、ベクトル化も生成もリランクも、コレクション設定に書くだけで自動的に動きます。 📌 タイトルと機能のURL タイトル: Model provider integrations URL: 📝 概要 Weaviateは、OpenAI・Cohere・Google・AWS・Azure OpenAI・Mistral・Anthropic・Hugging Face・Ollama など20以上のモデルプロバイダと統合しています。これらを「投入時の自動埋め込み」「クエリ文の自動埋め込み」「RAGの生成」「検索結果のリランク」に組み込めます。アプリ側で埋め込みAPIを呼んでベクトルを渡すコードが不要になるのが最大の利点です。 🔧 機能の説明 統合は大きく次の3つの役割に分かれます。 ・Vectorizer(埋め込み): テキストやマルチモーダルのベクトル化を担当します。 ・Generative(生成): RAGパイプライン向けのテキスト生成を担当します。 ・Reranker(リランク): 検索結果の並べ替えを担当します(Cohere、Jina AI、NVIDIA、Voyage AI などが提供)。 提供形態も2種類あります。API型プロバイダ(OpenAI、Google、Cohere、AWS Bedrock など)は外部APIを呼び出し、ローカルホスト型(Ollama、Hugging Face Transformers、Model2vec)は自分のインフラ上で動かします。API型モジュールは v1.33 以降は既定で有効です。 🛠 実践的な使い方 ・コレクション作成時に `Configure.Vectors`(旧 `Configure.Vectorizer`)で埋め込みプロバイダを指定すると、投入時もクエリ時も自動でベクトル化されます。 ・生成は `Configure.Generative` でプロバイダを指定し、検索結果に対してRAGを実行します。 ・リランカーは `Configure.Reranker` で指定します。 ・自動ベクトル化の対象は `text` / `text[]` 型のプロパティで、プロパティ名をアルファベット順に並べて連結し、必要に応じてコレクション名を先頭に付けてからモデルに送ります(プロパティ単位で対象外にも設定可能)。 🎯 ユースケース ・社内文書検索: 投入時に本文を自動でベクトル化し、検索時はクエリ文を同じモデルで自動ベクトル化して整合させます。 ・モデルの差し替え: ベンダーやモデルを変えたいとき、コレクション設定の変更だけで対応できます。 ・閉域要件: Ollama などローカルホスト型を使えば、データを外部に出さずに埋め込み生成まで完結します。 ・RAGチャット: 検索と生成を同一の設定内で組み合わせ、外部のオーケストレーションを最小化できます。 ⚠️ 注意点 ・API型プロバイダはAPIキーが必須で、利用に応じた課金が発生します。 ・レート制限は各プロバイダのポリシーに従います。大量投入時は注意が必要です。 ・v1.27 より前のバージョンでは、連結した文字列が小文字化されてからモデルに送られます。 ・v1.33 より前ではAPI型モジュールを使うため `ENABLE_API_BASED_MODULES` を有効化する必要があります。 #Weaviate# #Embeddings#
もっと見る
📚 リポジトリ全体のドキュメントを、図つきで自動生成。最大140万行・8言語に対応し、DeepWikiを上回る品質を出すAIフレームワークCodeWikiです(ACL 2026採択)。 タイトル: FSoft-AI4Code/CodeWiki URL: 📦 概要 CodeWikiは、ソフトウェアリポジトリ全体に対して包括的なドキュメントを自動生成する、AI駆動のフレームワークです。単純なAPIリファレンスにとどまらず、アーキテクチャ図・データフロー図・シーケンス図・散文の説明を含む「システムレベル」の文書を作ります。大規模・多言語のコードベースで、ドキュメントを最新かつ完全に保つという課題に取り組みます。 ❓ 解決する課題 従来のドキュメントツールはスケールと文脈の扱いが苦手でした。CodeWikiは、モジュール間の相互依存の文書化、規模を保ったままのアーキテクチャ文脈の維持、孤立した部品ではなくシステム全体の相互作用を捉えること、という3つの核心課題に取り組みます。 🛠 方法論と提案手法 3段階で動作します。 ・階層的分解:動的計画法に着想を得たアルゴリズム的クラスタリングで、コードベースを一貫したモジュールに分割します ・再帰的マルチエージェント処理:複雑なモジュールにはタスクを動的に委譲する適応的なエージェントシステムを使います ・マルチモーダル合成:テキストと視覚成果物(Mermaid図)を統合し、図はNode.jsで検証します ・Python・Java・JavaScript・TypeScript・C・C++・C#・Kotlinに対応し、Claude# CodeやCodex CLI経由でトークン課金なしに実行できます 🎯 ユースケース 大規模・多言語コードの「生きたドキュメント」生成、新メンバーのオンボーディング資料、GitHub Pages互換のインタラクティブなHTML出力などに使えます。 📊 実験結果 ・独自評価CodeWikiBenchで、高水準言語(Python、JS)が79.14%、マネージド言語(C#、Java)が68#.84%の品質スコアを記録しました ・DeepWiki比で+4.73ポイント改善し、22.9万行のOpenHandsプロジェクトで82.45%を達成しました ・GitHubスター1.2k、フォーク193、ACL 2026採択で、8.6万〜140万行のコードベースを扱えます ・リポジトリ自身のドキュメントもCodeWikiで生成されており、その実力を体現しています #AIエージェント# #DevTools#
もっと見る
「統合的理解」「総合的発揮」 目標の方向性に 文科省は4日、中央教育審議会の教育課程企画特別部会に、次期学習指導要領の審議まとめに向けた検討案を示した。
もっと見る