📹 終わりのない映像ストリームの中で、どの瞬間が後で重要になるかは誰にも分かりません。その難問に正面から答えたモデルです。
タイトル: OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
URL:
🧠 概要
ライブ映像を扱うLLMが、観測した内容を再利用可能な「事実の記憶」に変えながら、適切なタイミングで能動的に応答するための手法です。4Bという小さなモデルで、8つのストリーミング映像ベンチマークすべてで最高スコアを達成しました。
🔥 解決する課題
過去の視覚トークンを保持する方式は、限られたコンテキストを直近の観測と奪い合い、リアルタイムの知覚を弱めてしまいます。かといって直近だけを残せば、昔の出来事は失われます。さらに「沈黙」のラベルばかりが続くため、いつ応答すべきかの学習も偏りがちでした。
💡 方法論と提案手法
鍵は、能動的な生成を「ユーザーへの応答」だけでなく「証拠を事実記録に変換する行為」とも捉え直した点にあります。
・PHCM: 視覚ウィンドウは直近のみに保ったまま、観測内容を時刻付きのテキスト記録として書き出し、元フレームが消えた後も文脈として残します
・PSTL: 出力を開始する全アンカーの教師信号を残しつつ、状態変化と持続の代表例だけを選んで学習します
📊 実験結果
・OVOBenchで72.1、ProactiveVQAで48.7を記録し、11BのMOSS-VL-Realtimeを4Bで上回りました
・記憶指標ASIは、全履歴を保持する方式を4.0ポイント上回りながら、リアルタイム知覚でも勝っています
・PSTLは状態トークンの27.5%しか教師づけしないのに、密な教師づけを超えました。同じ27.5%でもランダム選択では伸びず、選び方そのものが効いています
・コンテキスト長は全履歴比で93.1%削減、初回応答までの時間は4.560秒から0.124秒へ短縮されました
#
動画理解# #
マルチモーダルLLM#