登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 spatial
spatial コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
spatial を含む検索結果
ディープラーニングを利用したフレーム補間技術RIFEとアップスケーリング技術MetalFX Spatialを利用し高負荷なMacゲームをより滑らか&鮮明にプレイできるようにするアプリ「Adrenaline」がリリース&8月31日まで無料配布中。
もっと見る
【最新】空間理解 #AI×##XR# で現場DXを加速🥽 ナレッジワークス(株)が、「Spatial AI 導入・PoC支援サービス」を提供開始。 カメラ映像やLiDARデータをAIが解析し、XRデバイス上に必要な情報を表示。 企業ごとの環境や業務フローに合わせたシステムを構築する。 @knowledge_works
もっと見る
世界最高峰のクリエイティブ・デザインアワード『D&AD Awards 2026』の「Spatial Design(空間デザイン)」部門において、BMSG 5周年記念プロジェクト「BLACK RECORDS」が「Wood Pencil」を受賞いたしました。 🔗 #BMSG# @dandad
もっと見る
#あいみょん10th# ☁️ ☁️ ☁️ ☁️ ☁️ ☁️ ☁️ ☁️ AIMYON 10th Anniversary contents #03# AIMYON Spatial Audio Collection ☁️ ☁️ ☁️ ☁️ ☁️ ☁️ ☁️ ☁️ これまでのあいみょんの楽曲が、 ドルビーアトモスによる空間オーディオ配信! ぜひチェックしてください🎧
もっと見る
道案内AIが路地の角を曲がれても、都市を横断できるとは限りません。その差を実スケールの香港で測りました。 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 🏙️ 概要 MLLMは短距離タスクや視覚認識で高い性能を示してきましたが、「局所での強さが広域行動に転化するか」は未検証でした。UrbanGroundは、香港の地理空間データ(OSM・衛星地図)からUnity上に構築した実スケール3D都市シミュレーションで、MLLMの空間エージェント能力を体系的に評価します。810件の人手検証済みタスクを5段階の評価ラダーに配置しています。 🔍 解決する課題 既存の空間推論ベンチマークはほとんどが小規模・合成環境・短距離タスクに留まっており、都市スケールの複合的な空間推論を問うものがありませんでした。天候変動・道路閉鎖・歩行者群衆といった動的変化への対応も問われていませんでした。 ⚙️ 方法論 フレームワークは3層構成(地理空間層・シミュレーション層・エージェント層)で、エージェントは一人称視点映像とインタラクティブマップを入力として受け取ります。評価は5段階ラダーで段階的に複雑化します。 ・Level 1: 視覚認識・方向判断・能動的探索 ・Level 2: 短距離/長距離/指示付きナビゲーション ・Level 3: 説明文からの暗黙的目的地推論 ・Level 4: スケジューリング・経路最適化 ・Level 5: 道路閉鎖・歩行者への動的適応 📊 実験結果 視覚認識は77〜93%と比較的高い一方、方向判断は23〜58%と弱く、短距離ナビゲーション成功率〜70%が長距離ではほぼゼロに崩壊します。天候・照明変化でQA精度が5〜20ポイント低下し、歩行者との衝突率は全モデルで75%超でした。GPT-5.5とKimi-K3が最も強力でしたが、長距離・動的環境での失敗パターンはどのモデルも同様です。 核心的知見は「局所能力は広域探索に合成されない」こと。エージェントは目に見える範囲は適切に動けても、それを超えた空間状態の維持や無効ルートの計画修正ができないことが実証されました。 #MLLMs# #EmbodiedAI#
もっと見る
VLM(画像を見て言葉で答える大規模言語モデル)に専門ツールを使わせて学ばせたあと、使い方ごと本体に染み込ませてツールを手放せるようにする学習手法SpatialCLIが発表された(https://arxiv[.]org/html/2607.27703v1)。 VLMは「机の上で一番遠いクマのぬいぐるみはどれか」のような課題全体の理解は得意だが、実際の距離を正確に測るのは苦手。SAM 3(輪郭を切り出す専門モデル)やDepth Anything 3(奥行きを推定する専門モデル)は精密だが、どのクマを見ればいいかという文脈判断ができない。しかもこうした専門ツールは呼び出すたびに時間がかかり、学習時点の計測では1回あたり平均2.916秒だったという。 SpatialCLIの名前は、位置特定・輪郭抽出・奥行き・姿勢推定という4つの専門ツールをVLMに呼び出させるCall、お手本の成功例と強化学習(GRPO)でツールの選び方を磨くLearn、ツールを使って解けた過程を文章に変換しツールなしでも同じ結論に辿り着けるよう学習し直すInternalizeという3段階に由来する。ツールを使う学習と使わない学習を同時に行うため、ツールの使い方を忘れずに専門能力だけをモデル本体に取り込める。 新設した516問のベンチマークSpatialCLI-Benchは、フロンティアモデルのGPT-5.6 Solでも正答率48.8%にとどまる難問揃い。Qwen3-VL-8B(80億パラメータ)にSpatialCLIを適用すると、ツールなしで35.3%から72.7%、ツールありでは91.3%まで伸びた。視点を変えながら空間関係を捉える力を測る別のベンチマークMindCubeでも29.3%から84.6%(ツールあり)に達し、同じ条件のGPT-5.6 Sol(72.1%)を上回っている。 ツールを使わせて学ばせてから、学んだことを染み込ませて手放させる。この順番が、身体を持つAIが現実世界の空間を扱えるようになる道筋の一つになりそうだ。
もっと見る
#PGM東京2026# お邪魔してきました。 数人の方と御挨拶そして・・・ P.S.S.P. mixer - Parallel Spatial Sound Processingを共同開発しましたF.P.C.(Fujiwara Project Concept)藤原氏とお久しぶりの御挨拶。ホームページの素材も撮影出来ました。今後ともよろしくお願いいたします。
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る
TL;DR: 長期エージェントの3大問題(誤差蓄積・コンテキスト腐敗・状態消失)を、Manager-Execute-Audit(MEA)ループで構造的に解決。WeaveBenchで51.8%→80.7%を達成しました。 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks ポイント 🔧 Manager: 実行軌跡の外でタスク状態を明示管理。ゴール・受け入れ基準・制約を含む「サブタスクコントラクト」を生成する ⚡ Executor: 過去の軌跡を持ち込まない、バジェット有界の新鮮コンテキストで各サブタスクを実行する 🔍 Auditor: 実行後に読み取り専用で独立検査。完了・整合性・状態更新を3分類でレポートし、ラウンド間の永続メモリとして機能する 🖥️ GUI/CLIハイブリッド: Managerがタスクに応じてインターフェースを選択。AgentAdapterでClaude Code・Codex CLI等を差し替え可能 📊 WeaveBench: PassRate 51.8%→80.7%、Design+60pp・Spatial/3D+50ppの大幅改善 🤖 OSWorld 2.0: Qwen 3.7-Plusで2.8%→8.3%(3倍)、Claude Opus 4.7で20.6%→35.3% 💻 Terminal-Bench: 69.7%→77.2%、かつトークン消費24%減(オーバーヘッドなし) 💡 Manager cost: 総トークンのたった2〜8%。Auditorが19〜38%でほとんどの追加コストを担う 「エージェント能力はモデル単体でなく、モデル+ハーネス全体の性質」——この視点が長期エージェント設計の出発点になると思います。 #AIAgents# #LLM#
もっと見る
🖐️ AIエージェントが「指差す」だけでなく、形を描き、動きを模倣し、発言を強調する手を持ったらどうなるでしょうか。XR空間でのエージェント会話に関する研究です。 タイトル: AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR URL: ❓ なぜ音声だけのエージェントでは足りないのでしょうか 💡 従来の2Dバウンディングボックス表示はフラットな画面向けで、Android XRのようなイマーシブ環境には合いません。人間の会話で手が果たす「指差す・描写する・強調する」役割が抜け落ちてしまいます。 ❓ どうやってジェスチャーを生成しているのでしょうか 💡 環境認識モジュールが物体を3Dレジストリに登録し、LLMがユーザーの発話に応じて「GestureEvent」を生成。ワード単位のタイムスタンプでTTSとアニメーションを同期させ、発話と手の動きがぴったり合った共話ジェスチャーを実現しています。 ❓ 実際に効果はあったのでしょうか 💡 12名の被験者内比較研究で、蘭のケアや3Dプリンタ操作タスクを実施したところ、物体の位置特定や方向参照が有意に容易になり(p<0.05)、複雑な手順のフォローもしやすくなったと報告されています。安全警告のジェスチャーと視覚効果の組み合わせも高く評価されました。 ❓ ユーザーはどう感じたのでしょうか 💡 「パートナーが導いてくれているような感覚」という声があり、ツール検索的な体験から体現化された対話へと感覚がシフトしたことが分かっています。 #XR# #AIエージェント#
もっと見る