登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 音声AI
音声AI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
音声AI を含む検索結果
【現場の声で、組織をDX】音声AI「モコボイス」が「JAPAN FUTURE GATE」に出展!
【#日経クロストレンド# FORUM 2026】 #梶裕貴# が登壇させていただきます🗣️ 『音声AIで生み出すIP新事業の可能性』 日時:7月29日(水)13:20〜14:30 場所:東京コンベンションホール(京橋)ルームA 受講費:無料(事前登録)
もっと見る
🎼 テキスト・画像・音声・動画が入り混じる難タスクを、専門サブエージェントに分解して並列で解く——巨大単体モデルより「適材適所のチーム」が勝つことを示した研究です。 タイトル: Orchestra-o1: Omnimodal Agent Orchestration URL: 💡 概要 Orchestra-o1は、複数モダリティが同時に絡むタスクを、高レベルのオーケストレーションと低レベルのツール実行に分離して解く階層型エージェント枠組みです。モダリティに応じてサブエージェントを専門化し、並列実行で効率を高めます。 ⚠️ 解決する課題 既存のオーケストレーションは扱えるモダリティが限られ、テキスト・画像・音声・動画が共存して相互作用するシナリオに汎化できませんでした。 🛠 方法論と提案手法 ・バックエンドを「スキルベクトル+コスト/レイテンシ」で表し、コスト考慮で選択 ・知覚系(画像/音声/動画解析)と行動系(検索/閲覧/コード実行)のツールを割り当て ・サブゴールの潜在依存グラフを作り独立タスクを並列実行 ・学習はDA-GRPO:最終回答でなくステップ単位を評価し、decision quality(0.6)を重視した多次元ルーブリック報酬で意思決定を整合 📊 実験結果(独自ベンチOmniGAIA) ・Orchestra-o1-GPT-5が72.8%で、2位のGemini-3-Proを10.3ポイント上回り最高 ・オープンソースのOrchestra-o1-8B(Qwen3-8Bベース)は30.0%でOSS最高 ・精度72.8%をコスト341.6で達成し、低精度な比較手法より安く高精度 ・難易度別はEasy80.3%/Medium75.0%/Hard56.4% #AIエージェント# #マルチモーダル#
もっと見る
ByteDanceの音声生成AI 「Seed Audio 1.0」 使用感はこんな感じでした! ・Seedance2.0での音声出力より日本語が安定 ・セリフに沿って感情表現を微妙に合わせてくれる ・音声と画像は同時にリファレンス不可 ・音声のリファレンスの精度が高い(Max30秒) ・高い声だと機械音っぽい感じが出やすい 用途にもよりますが、ElevenLabsより使いやすいかもしれないです…👀 またじっくり検証してみます!
もっと見る
生成AIで音声コンテンツを"毎日"配信し続けるのは、想像以上に泥臭い。 TTSの出力揺らぎ、生成コスト、ユーザーの飽き——『わたしのラジオ』開発の裏側をまとめました📻 #ヘルステック# #音声AI# #テオリア# #テオリアテクノロジーズ#
もっと見る
「話しかけられてから答える」音声AIは終わり。音・環境・指示を聞き続けて自分から動くモデルの登場です🎧 タイトル: Audio Interaction Model URL: 🎧 概要 常時稼働でリアルタイムに動く統合型の音声言語モデル(LALM)です。「知覚→判断→応答」のループを回し続け、音・環境音・ユーザー指示を同時に聞きながら、ストリームの意味理解に基づいて動的に応答します。 ❓ 解決する課題 現在のLALMの多くはオフラインで、ストリーミングASRや音声チャットを個別にこなすだけでした。現実の対話には、リアルタイムに同時に聞いて、その場で反応する常時稼働型のモデルが必要です。 💡 方法論と提案手法 核心は「知覚→判断→応答」ループを具現化したSoundFlowフレームワークです。 ・ストリーミングネイティブなデータ構築 ・理解を意識した訓練 ・非同期・低遅延の推論で安定したリアルタイム対話 データはStreamAudio-2M(260万件)で、7つの基礎能力・28サブタスクをカバー。能動的介入を測るProactive-Sound-Benchも用意しました。 📊 実験結果 / ユースケース ・8つのベンチマークで競争力ある性能を維持 ・オフラインLALMでは不可能だったリアルタイムASR、ストリーミング音声指示追従、能動的介入を実現 常時稼働の音声アシスタントやリアルタイム対話、能動的な音声サポートに活用できます。 #音声AI# #LALM#
もっと見る
【正式リリース】診察中の会話からカルテを自動生成🏥 (株)ADVATECは、音声AI医療カルテ作成支援サービス「コエカル」を提供開始。 診察中の会話をAIが解析し、SOAP形式のカルテを自動作成。過去の診療履歴を活用したサマリーや紹介状の自動生成にも対応。 @coekar_j
もっと見る
✨まいど!相場の福の神・藤本誠之です✨ DXからさらに一歩進んだ「製造AX」に注目⚙️ 政府後押しの“AI中心ファクトリー構想”が本格始動です! この中でワタクシ藤本が特に注目したのが👇 🎯サイエンスアーツ <4412>  現場音声×AIで製造現場の効率化を実現! 🎯ピーバンドットコム <3559>  「P板.com」×「GUGEN Hub」でものづくりをつなぐDX推進企業! AIと製造の融合=“製造AX”はこれからの成長テーマ💡 国策と企業の動きがリンクする、この流れ、個人投資家として見逃せませんね! #相場の福の神# #株投資# #個人投資家# #ニュース紹介# #AI関連# #製造AX# #サイエンスアーツ# #ピーバンドットコムDXは新ステージ突入、「製造AX」が描く未来図と関連株# <株探トップ特集> | 特集 - 株探ニュース
もっと見る
便利だけど知られていないGemini APIの機能 🔑 ブラウザからLive APIに直接つなぎたい。でもAPIキーは露出させたくない。 Geminiの「エフェメラルトークン(Ephemeral tokens)」は、短命の使い捨てトークンを発行してクライアントから安全にLive APIへ接続する仕組みです。メインのAPIキーをフロントエンドに渡す必要がなくなります。 📌 タイトル:エフェメラルトークン(Ephemeral tokens) 🔗 URL: 🧩 概要 Live API(リアルタイム音声/動画)をブラウザやモバイルアプリから直接使う場合、APIキーをクライアントに渡すとセキュリティリスクになります。Ephemeral tokensは、サーバー側でメインAPIキーを使って短命トークンを発行し、クライアントはそのトークンで接続する仕組みです。トークンは短時間で失効するため、万が一漏洩しても被害を最小限に抑えられます。 🛠 使い方 バックエンドサーバーでGemini APIにエフェメラルトークンの発行をリクエストします。返されたトークンをフロントエンドに渡し、クライアントはそのトークンでLive APIのWebSocketに接続。トークンは数分で失効するため、必要に応じて再発行する仕組みを組み込みます。 🏗 本番システムへの組み込み方 ・ブラウザ音声チャット:Webアプリからリアルタイム音声会話を提供。サーバーを中継せず直接接続することで低レイテンシを実現。 ・モバイル音声アシスタント:スマホアプリから直接Live APIに接続。APIキーはサーバーに保持したまま。 ・ライブ配信連携:配信プラットフォームのフロントエンドからリアルタイム翻訳やキャプション生成。 ・対面接客AI:タブレット端末からLive APIに接続して、店頭での音声アシスタントを構築。 💡 ユースケース 🎙️ ブラウザからのリアルタイム音声チャット 📱 モバイルアプリの音声AI連携 🎬 ライブ配信のリアルタイム処理 🏪 店頭タブレットの音声アシスタント ⚠️ 注意点 トークンの有効期限は短いため、長時間セッションでは途中でトークンの再発行が必要です。トークン発行のバックエンドは必ず認証を入れ、不正なトークン発行を防いでください。また、トークン発行自体のレート制限も考慮しましょう。 ✨ クライアント直接接続でレイテンシを下げつつ、APIキーの安全性も確保。リアルタイムAI体験の構築に欠かせない仕組みです。 #Gemini# #LLM#
もっと見る