登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 空間推論
空間推論 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
空間推論 を含む検索結果
【ちょっと長文】(日本語は中国語の次) 我的追蹤者裡也有不少台灣人,大家如果有空可以來看看,但記得先深呼吸一下,再認識不同角度的解讀喔😅 tag我,希望我看投稿,看一看突然的暴言攻擊真的有點太刺激了…… 💦對方可以暴言,我選擇不看就好。可以封鎖我,眼不見為淨,生活會平靜一點。 ◆關於阪急這件事: 台灣人寄出的信件內容算是理性,沒有攻擊字句。跨平台分享發生這事情,如果有同感的人想加入的話,自己判斷,沒有強迫大家。做法有改善空間,歡迎理性討論。 強調「如同小粉紅、干涉內政、拉低台灣人形象」,搭配上針對我的難聽字句,綜合起來,我是覺得已經不是在針對事情本身想進行溝通了。 支持台灣,同時也想更了解台灣人怎麼想、怎麼感受,我蠻推薦去Threads看看台灣人的投稿(超多人使用Threads,可以獲得更廣泛的聲音)。向台灣人發問,也會得到很多回應~(長住台灣也是一個方式w) 網路暴言我就不仔細看了。 明天我還活不活著,說這些話的人也不會在意。 我把時間拿去睡覺,明天繼續當一條活龍✌️ 私のフォロワーにも台湾人の方がたくさんいるので、違う角度からの解釈を知るきっかけになるかなと思います。よかったら見てみてください!ただ、まず深呼吸してからね〜 tagされて投稿を見に来たら、突然の暴言攻撃が本当にちょっと刺激強すぎました……💦 相手が暴言を吐くのは自由ですが、私は見ない選択をします。ブロックしていただいても構いませんよ。目に入らなければ生活が穏やかになります。 ◆阪急の件について: 台湾の方々が送ったお問い合わせの内容は理性的で、攻撃的な言葉は使われていません。この件をThreads以外のプラットフォームで共有するのは、同感する人が自分で判断して参加したい場合は自由ですが、強制ではありません。方法に改善の余地はあると思いますので、理性的に議論できればと思います。 ただ、「小粉紅のような行為」「内政干渉」「台湾人のイメージを下げる」といった点を強調し、私個人にもきつい言葉を向けられたことで、もう事柄そのものについて理性的にコミュニケーションを取る段階ではなくなっていると感じます。 台湾を応援するなら、台湾人がどう思っているか、どう感じているかをより理解したい場合、Threadsで台湾人の投稿をたくさん見てみることをおすすめしますよ(Threadsを使っている台湾人が本当に多いので、より幅広い声に触れられます)。台湾人に直接質問したりすると、たくさん返事が返ってきますよ〜 (長く台湾に住むのも一つの方法ですねw) ネット上の暴言や攻撃はもう細かく見ませんよ。 明日私が生きていようがいまいが、これを言った人たちは気にしないでしょう。 私はその時間を睡眠に充てて、明日も元気に頑張ります⸜(◍´˘`◍)⸝
もっと見る
動画生成モデルは「正しい映像を作れる」のか、それとも「もっともらしく見える映像を作れる」だけなのか。 これは似ているようで本質的に異なる問いです。物体を正しく配置し物理法則を守りながら複数ステップのタスクを解くこと——これを「視覚的知性(Visual Grounded Intelligence)」と呼ぶならば、現在のモデルはそれを持っているでしょうか。VGI-Benchはその問いに数字で答えます。 27タスク810インスタンスのベンチマークで9つの動画モデルを評価した結果、最強モデルのSeedance 2.0でも全体スコアは51.0%にとどまりました。物理崩壊(非現実的な変形・物体の貫通)、ルール違反(もっともらしい最終状態を出しながら制約を無視)、物体不整合(時間をまたいだ一貫性の喪失)という3つの失敗モードが繰り返し現れます。オープンソース最高のHunyuanVideoは19.1%と商用モデルを大きく下回りました。 より深刻なのは、デノイジング過程の分析が明らかにしたことです。生成中間ステップでの自己修正は全体の1%未満。「誤り→別の誤り」への遷移がデノイジング中盤で23.1%に達しており、後期デノイジングは初期に固定された仮説を磨くだけで誤りを直せていません。さらに、1M合成サンプルによるファインチューニングは計画・空間スキルを改善する一方で時間的・物理的能力を劣化させるというトレードオフも確認されました。VGI-Benchは視覚推論という軸で動画生成の限界を照らし出しています。 タイトル: VGI-Bench: Probing Visual Intelligence in Video Generation Models URL: #動画生成# #視覚推論#
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る
道案内AIが路地の角を曲がれても、都市を横断できるとは限りません。その差を実スケールの香港で測りました。 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 🏙️ 概要 MLLMは短距離タスクや視覚認識で高い性能を示してきましたが、「局所での強さが広域行動に転化するか」は未検証でした。UrbanGroundは、香港の地理空間データ(OSM・衛星地図)からUnity上に構築した実スケール3D都市シミュレーションで、MLLMの空間エージェント能力を体系的に評価します。810件の人手検証済みタスクを5段階の評価ラダーに配置しています。 🔍 解決する課題 既存の空間推論ベンチマークはほとんどが小規模・合成環境・短距離タスクに留まっており、都市スケールの複合的な空間推論を問うものがありませんでした。天候変動・道路閉鎖・歩行者群衆といった動的変化への対応も問われていませんでした。 ⚙️ 方法論 フレームワークは3層構成(地理空間層・シミュレーション層・エージェント層)で、エージェントは一人称視点映像とインタラクティブマップを入力として受け取ります。評価は5段階ラダーで段階的に複雑化します。 ・Level 1: 視覚認識・方向判断・能動的探索 ・Level 2: 短距離/長距離/指示付きナビゲーション ・Level 3: 説明文からの暗黙的目的地推論 ・Level 4: スケジューリング・経路最適化 ・Level 5: 道路閉鎖・歩行者への動的適応 📊 実験結果 視覚認識は77〜93%と比較的高い一方、方向判断は23〜58%と弱く、短距離ナビゲーション成功率〜70%が長距離ではほぼゼロに崩壊します。天候・照明変化でQA精度が5〜20ポイント低下し、歩行者との衝突率は全モデルで75%超でした。GPT-5.5とKimi-K3が最も強力でしたが、長距離・動的環境での失敗パターンはどのモデルも同様です。 核心的知見は「局所能力は広域探索に合成されない」こと。エージェントは目に見える範囲は適切に動けても、それを超えた空間状態の維持や無効ルートの計画修正ができないことが実証されました。 #MLLMs# #EmbodiedAI#
もっと見る
「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。 タイトル: PhiZero: A World Model Built Around Physical Language ❓ 「物理言語(Physical Language)」とは何ですか? 💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。 ❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか? 💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。 ❓ 具体的にどんな性能を達成しましたか? 💡 6つのベンチマーク全てで最高水準の結果を出しました。 ・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新) ・WorldModelBench 物理準拠・常識・総合で全て最高スコア ・因果関係理解YoCausal:集約ランク2.0(最高) ・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1) ❓ ロボティクスや自動運転への応用はどうなりますか? 💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。 #WorldModel# #EmbodiedAI#
もっと見る
マルチエージェントの協調、毎回テキストでやり取りするのは高コストでした🔄 協調そのものを「潜在空間の再帰」でスケールさせる発想が新しいです。 タイトル: Recursive Multi-Agent Systems URL: 🔄 概要 複数エージェントの協調を、逐次的なテキスト交換ではなく、統一された潜在空間上の再帰的計算として捉える枠組みRecursiveMASの提案です。異種のエージェントをRecursiveLinkモジュールで接続し、潜在的な思考の生成と状態転送を可能にします。 ❓ 解決する課題 マルチエージェントシステム(MAS)は通常テキストベースの通信に依存します。 ・エージェント同士が自然言語でやり取りすると、トークンを大量に消費し計算コストが高い ・「協調そのものを再帰でスケールできないか」という問いが出発点でした 💡 方法論と提案手法 ・システム全体を潜在空間上の再帰的計算として定式化します ・RecursiveLinkモジュールが異種エージェント間を軽量に接続し、再帰ラウンドをまたいだ勾配ベースの貢献度割り当てを行います ・最適化は内側・外側のループ学習で実施し、理論的な安定性も保ちます 📊 実験結果 数学・科学・医療・検索・コード生成にまたがる9ベンチマークで、4つの協調パターンを検証しました。 ・平均精度が8.3%向上 ・推論が1.2倍〜2.4倍に高速化 ・トークン使用量を34.6%〜75.6%削減 精度を上げながら、速度とコストを同時に大きく改善しています。 #マルチエージェント# #LLM#
もっと見る
🧠 「エージェントに正確な業務文脈をどう渡すか」への一つの答え。既存データからオントロジーと知識グラフを自動で作り、MCPで供給するOSSです。 タイトル: Context Ontology Accelerator (aws/context-ontology-accelerator) URL: AWSが公開した、AIエージェントに検証済みのビジネス文脈を与えるセマンティックなコンテキスト層。注目ポイントは3つです。 🔎 Scan→Model→Serveの3段パイプライン 多様なデータ源に接続してスキーマ発見・文書取り込み(Scan)、形式オントロジーと統一知識グラフを構築(Model)、VKGのSPARQLフェデレーションとMCPで公開(Serve)。手動の知識工学に頼らず既存データから意味構造を導きます。 ✅ 推論エンジンで整合性を検証 HermiTやELKでオントロジーの一貫性を検証し、形式制約に基づくルール検証が可能。エージェントが「学習データの記憶」でなく検証済みの業務ルールを問い合わせられます。 🏗 AWSネイティブで実運用志向 AWS CDKでデプロイ、Ontopを使ったVKG、名前空間ごとのRBAC(owner/maintainer/data-steward/data-analyst)。API設計はSmithy、UIはReact+Cloudscape。 説明可能性を保ちつつ、エージェントを検証済みの文脈で動かす土台になりそうです。 #KnowledgeGraph# #AIエージェント#
もっと見る
RAGの「精度を上げると遅くなる」ジレンマに、トピックを“方位磁針”として使う発想で挑む研究です🧭 タイトル: MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval URL: 🧭 概要 トピックレベルのシグナルを「意味的なコンパス」として使い、関連する根拠を段落(パラグラフ)レベルで選び出す、メタデータ誘導型の検索フレームワークです。精度と効率を同時に高めることを狙います。 ❓ 解決する課題 RAGには、検索の精度と効率のトレードオフがあります。 ・細かいチャンクは精度が上がるが、候補が増えてレイテンシとコストが増大します ・大きいチャンクは候補が減るが、複数トピックの混在で意味的ノイズが生まれます 特に大規模データへの高速・高精度検索が要るディープリサーチで顕著です。 💡 方法論と提案手法 ・チャンクの表現を、同一の埋め込み空間内でトピックメタデータによって強化します ・LLM教師蒸留で、軽量なリトリーバーを訓練します ・これにより、推論時に追加のLLM呼び出しなしで「トピックを意識した検索」を実現します メタデータと密な埋め込みを組み合わせ、軽量リトリーバーに蒸留するのが核心です。 📊 実験結果 ・情報効率:6つのベンチマークで平均8.24%改善 ・レイテンシ:最も強力な効率重視RAGベースラインより5倍以上低い ・コードは公開リポジトリで提供 推論時の追加LLM呼び出しなしで、この精度と速度を両立しています。 #RAG# #検索#
もっと見る