TL;DR 質問を待たず、毎秒「黙る/話す/委譲する」を自分で決める8BのビジョンファーストVLM。監視・実況・翻訳など“タイミングが命”のタスクで、DoubaoやGeminiに人手評価で勝ち越しました👀
タイトル: JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence
URL:
ポイント
🟢 毎秒3値判断:(見守り)/(発話)/(背景処理へ委譲)をモデル内部で決める
🎞️ AdaCodecで予測符号化:シーン変化時だけフルViTトークン、間は約16トークンに圧縮し無限ストリームを処理
⏱️ 時間認識:経過時間マーカー(例 <4.0 seconds>)と1Hzサンプリングで秒単位に応答を紐付け
🧠 記憶階層:短期100秒→中期500秒→長期7,500秒、vLLMプレフィックスキャッシュで2時間超もサブ秒
📊 学習:沈黙を第一級カテゴリ化、重み付きFT+GRPO(誤報や遅延を罰則化)、400万超の時刻整列クリップ
🏆 6シナリオ58ケースの人手評価で総合勝率 Doubao比77.6%/Gemini比87.9%、アラートは満点
✨ 未学習の創発能力:画面変化のユーザー誘導やスライドからの即興プレゼンも観測
「いつ話すか」を外部トリガーでなくモデルの中に持たせる設計が、常時稼働の見守りプロダクトに効きそうだと感じます。
#
マルチモーダル# #
リアルタイムAI#