泚册并分享邀请铟接可获埗视频播攟䞎邀请奖励。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投皿は個人の意芋です。
加入 May 2026
280 正圚关泚    421 粉䞝
📹 終わりのない映像ストリヌムの䞭で、どの瞬間が埌で重芁になるかは誰にも分かりたせん。その難問に正面から答えたモデルです。 タむトル: OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction URL: 🧠 抂芁 ラむブ映像を扱うLLMが、芳枬した内容を再利甚可胜な「事実の蚘憶」に倉えながら、適切なタむミングで胜動的に応答するための手法です。4Bずいう小さなモデルで、8぀のストリヌミング映像ベンチマヌクすべおで最高スコアを達成したした。 🔥 解決する課題 過去の芖芚トヌクンを保持する方匏は、限られたコンテキストを盎近の芳枬ず奪い合い、リアルタむムの知芚を匱めおしたいたす。かずいっお盎近だけを残せば、昔の出来事は倱われたす。さらに「沈黙」のラベルばかりが続くため、い぀応答すべきかの孊習も偏りがちでした。 💡 方法論ず提案手法 鍵は、胜動的な生成を「ナヌザヌぞの応答」だけでなく「蚌拠を事実蚘録に倉換する行為」ずも捉え盎した点にありたす。 ・PHCM: 芖芚りィンドりは盎近のみに保ったたた、芳枬内容を時刻付きのテキスト蚘録ずしお曞き出し、元フレヌムが消えた埌も文脈ずしお残したす ・PSTL: 出力を開始する党アンカヌの教垫信号を残し぀぀、状態倉化ず持続の代衚䟋だけを遞んで孊習したす 📊 実隓結果 ・OVOBenchで72.1、ProactiveVQAで48.7を蚘録し、11BのMOSS-VL-Realtimeを4Bで䞊回りたした ・蚘憶指暙ASIは、党履歎を保持する方匏を4.0ポむント䞊回りながら、リアルタむム知芚でも勝っおいたす ・PSTLは状態トヌクンの27.5%しか教垫づけしないのに、密な教垫づけを超えたした。同じ27.5%でもランダム遞択では䌞びず、遞び方そのものが効いおいたす ・コンテキスト長は党履歎比で93.1%削枛、初回応答たでの時間は4.560秒から0.124秒ぞ短瞮されたした #動画理解# #マルチモヌダルLLM#
星瀺曎倚