🦢 TL;DR: 「聞く・話す・割り込む」のタイミングはトップクラス、でもタスク遂行はまだ発展途上。Tencentが音声・映像・エージェントを1つに統合したomni対話モデルを発表しました。
タイトル: Omni Interaction Agent Technical Report(Gander)
URL:
📌 ポイント
🧠 「小脳(対話制御)」と「大脳(Claude/Codexで実行)」の二層構造
🎙 音声・映像をチャンク単位でストリーミング処理、外部VAD不要
✅ ターンテイキング精度100%でGPT-Realtimeの96%を上回る
⚠️ タスク完遂率(Pass
@1)は0.400とGPT-Realtimeの0.600に劣る
🔀 音声認識を介さずテキストを直接渡すとPass
@1が0.520に改善
🌐 音声×映像の統合でDaily-Omniが単一モダリティ比+19.13pt向上
📦 モデル重み・学習コード・評価ハーネスを公開予定
対話のテンポの良さと、タスクをやり切る正確さは今のところ別物という現実的な結果が興味深いです。
#
マルチモーダルAI# #
音声対話AI#