Register and share your invite link to earn from video plays and referrals.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
Joined May 2026
280 Following    421 Followers
📹 終わりのない映像ストリームの中で、どの瞬間が後で重要になるかは誰にも分かりません。その難問に正面から答えたモデルです。 タイトル: OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction URL: 🧠 概要 ライブ映像を扱うLLMが、観測した内容を再利用可能な「事実の記憶」に変えながら、適切なタイミングで能動的に応答するための手法です。4Bという小さなモデルで、8つのストリーミング映像ベンチマークすべてで最高スコアを達成しました。 🔥 解決する課題 過去の視覚トークンを保持する方式は、限られたコンテキストを直近の観測と奪い合い、リアルタイムの知覚を弱めてしまいます。かといって直近だけを残せば、昔の出来事は失われます。さらに「沈黙」のラベルばかりが続くため、いつ応答すべきかの学習も偏りがちでした。 💡 方法論と提案手法 鍵は、能動的な生成を「ユーザーへの応答」だけでなく「証拠を事実記録に変換する行為」とも捉え直した点にあります。 ・PHCM: 視覚ウィンドウは直近のみに保ったまま、観測内容を時刻付きのテキスト記録として書き出し、元フレームが消えた後も文脈として残します ・PSTL: 出力を開始する全アンカーの教師信号を残しつつ、状態変化と持続の代表例だけを選んで学習します 📊 実験結果 ・OVOBenchで72.1、ProactiveVQAで48.7を記録し、11BのMOSS-VL-Realtimeを4Bで上回りました ・記憶指標ASIは、全履歴を保持する方式を4.0ポイント上回りながら、リアルタイム知覚でも勝っています ・PSTLは状態トークンの27.5%しか教師づけしないのに、密な教師づけを超えました。同じ27.5%でもランダム選択では伸びず、選び方そのものが効いています ・コンテキスト長は全履歴比で93.1%削減、初回応答までの時間は4.560秒から0.124秒へ短縮されました #動画理解# #マルチモーダルLLM#
Show more