登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Perceptor
Perceptor コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Perceptor を含む検索結果
肉眼では認識できない怪異を追うホラーゲーム『Perceptum』2027年春リリース。頼れる武器は手鏡と聴覚だけ 常に“なにかがいる”かのような重圧の中、屋敷を探索。手鏡は目に見えない重要な手がかりも、“見てはいけないもの”も映し出す。
もっと見る
📹 終わりのない映像ストリームの中で、どの瞬間が後で重要になるかは誰にも分かりません。その難問に正面から答えたモデルです。 タイトル: OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction URL: 🧠 概要 ライブ映像を扱うLLMが、観測した内容を再利用可能な「事実の記憶」に変えながら、適切なタイミングで能動的に応答するための手法です。4Bという小さなモデルで、8つのストリーミング映像ベンチマークすべてで最高スコアを達成しました。 🔥 解決する課題 過去の視覚トークンを保持する方式は、限られたコンテキストを直近の観測と奪い合い、リアルタイムの知覚を弱めてしまいます。かといって直近だけを残せば、昔の出来事は失われます。さらに「沈黙」のラベルばかりが続くため、いつ応答すべきかの学習も偏りがちでした。 💡 方法論と提案手法 鍵は、能動的な生成を「ユーザーへの応答」だけでなく「証拠を事実記録に変換する行為」とも捉え直した点にあります。 ・PHCM: 視覚ウィンドウは直近のみに保ったまま、観測内容を時刻付きのテキスト記録として書き出し、元フレームが消えた後も文脈として残します ・PSTL: 出力を開始する全アンカーの教師信号を残しつつ、状態変化と持続の代表例だけを選んで学習します 📊 実験結果 ・OVOBenchで72.1、ProactiveVQAで48.7を記録し、11BのMOSS-VL-Realtimeを4Bで上回りました ・記憶指標ASIは、全履歴を保持する方式を4.0ポイント上回りながら、リアルタイム知覚でも勝っています ・PSTLは状態トークンの27.5%しか教師づけしないのに、密な教師づけを超えました。同じ27.5%でもランダム選択では伸びず、選び方そのものが効いています ・コンテキスト長は全履歴比で93.1%削減、初回応答までの時間は4.560秒から0.124秒へ短縮されました #動画理解# #マルチモーダルLLM#
もっと見る
道案内AIが路地の角を曲がれても、都市を横断できるとは限りません。その差を実スケールの香港で測りました。 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 🏙️ 概要 MLLMは短距離タスクや視覚認識で高い性能を示してきましたが、「局所での強さが広域行動に転化するか」は未検証でした。UrbanGroundは、香港の地理空間データ(OSM・衛星地図)からUnity上に構築した実スケール3D都市シミュレーションで、MLLMの空間エージェント能力を体系的に評価します。810件の人手検証済みタスクを5段階の評価ラダーに配置しています。 🔍 解決する課題 既存の空間推論ベンチマークはほとんどが小規模・合成環境・短距離タスクに留まっており、都市スケールの複合的な空間推論を問うものがありませんでした。天候変動・道路閉鎖・歩行者群衆といった動的変化への対応も問われていませんでした。 ⚙️ 方法論 フレームワークは3層構成(地理空間層・シミュレーション層・エージェント層)で、エージェントは一人称視点映像とインタラクティブマップを入力として受け取ります。評価は5段階ラダーで段階的に複雑化します。 ・Level 1: 視覚認識・方向判断・能動的探索 ・Level 2: 短距離/長距離/指示付きナビゲーション ・Level 3: 説明文からの暗黙的目的地推論 ・Level 4: スケジューリング・経路最適化 ・Level 5: 道路閉鎖・歩行者への動的適応 📊 実験結果 視覚認識は77〜93%と比較的高い一方、方向判断は23〜58%と弱く、短距離ナビゲーション成功率〜70%が長距離ではほぼゼロに崩壊します。天候・照明変化でQA精度が5〜20ポイント低下し、歩行者との衝突率は全モデルで75%超でした。GPT-5.5とKimi-K3が最も強力でしたが、長距離・動的環境での失敗パターンはどのモデルも同様です。 核心的知見は「局所能力は広域探索に合成されない」こと。エージェントは目に見える範囲は適切に動けても、それを超えた空間状態の維持や無効ルートの計画修正ができないことが実証されました。 #MLLMs# #EmbodiedAI#
もっと見る
AIに空間を「言葉で考えさせる」のは逆効果かもしれません🧭 見えない視点を頭の中で“想像”させる新しいアプローチの登場です。 タイトル: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models URL: 🧭 概要 視覚言語モデル(VLM)の空間推論を強化する「Imaginative Perception Tokens(IPT、想像的知覚トークン)」の提案です。空間的な論理を言語に押し込めるのではなく、「異なる配置で何が見えるか」という知覚を中間表現として保持します。 ❓ 解決する課題 VLMは、見えていない視点からの見え方、遮蔽された経路、複数の部分観測の統合といった空間推論が苦手です。従来はテキストの思考連鎖で解こうとしましたが、視覚的な推論を言語だけに押し込めるのは無理があり、性能が頭打ちでした。 💡 方法論と提案手法 ・統合型VLMのBAGELをバックボーンに、IPTによる教師あり学習で訓練します ・3つのタスクを定式化:視点取得(PET)、経路追跡(PT)、多視点カウント(MVC) ・約20,000例のデータセットを構築(正解・回答・評価指標つき) 「もしこう動いたらこう見える」という知覚そのものを中間表現として扱うのが核心です。 📊 実験結果 ・多視点カウント(MVC)でIPT利用により精度が3.4%向上 ・経路追跡(PT)でクローズドソースモデルと競争力ある性能 ・IPT教師あり学習はテキスト思考連鎖(CoT)を上回る ・逆にテキストCoTは空間推論性能を大きく劣化させると判明 #空間推論# #マルチモーダルLLM#
もっと見る