「話しかけられてから答える」音声AIは終わり。音・環境・指示を聞き続けて自分から動くモデルの登場です🎧
タイトル: Audio Interaction Model
URL:
🎧 概要
常時稼働でリアルタイムに動く統合型の音声言語モデル(LALM)です。「知覚→判断→応答」のループを回し続け、音・環境音・ユーザー指示を同時に聞きながら、ストリームの意味理解に基づいて動的に応答します。
❓ 解決する課題
現在のLALMの多くはオフラインで、ストリーミングASRや音声チャットを個別にこなすだけでした。現実の対話には、リアルタイムに同時に聞いて、その場で反応する常時稼働型のモデルが必要です。
💡 方法論と提案手法
核心は「知覚→判断→応答」ループを具現化したSoundFlowフレームワークです。
・ストリーミングネイティブなデータ構築
・理解を意識した訓練
・非同期・低遅延の推論で安定したリアルタイム対話
データはStreamAudio-2M(260万件)で、7つの基礎能力・28サブタスクをカバー。能動的介入を測るProactive-Sound-Benchも用意しました。
📊 実験結果 / ユースケース
・8つのベンチマークで競争力ある性能を維持
・オフラインLALMでは不可能だったリアルタイムASR、ストリーミング音声指示追従、能動的介入を実現
常時稼働の音声アシスタントやリアルタイム対話、能動的な音声サポートに活用できます。
#
音声AI# #
LALM#