登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 音声LLM
音声LLM コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
音声LLM を含む検索結果
TL;DR 音声LLMのエンコーダを18層から14層まで削っても精度がほぼ落ちない、XPengの圧縮手法「X-AuT」が公開されました。むしろ16層構成では精度が向上しています。 タイトル: X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation URL: ポイント ✂️ 音声エンコーダの層を18→16→14と段階的に削減する「プログレッシブプルーニング」を採用しています 🔍 個々の層の削減スコアだけでは最適なペアが分からず、層同士の相互作用まで評価しているのが面白い点です 🎓 0.6Bの学生モデルを1.7Bの大きな教師モデルで蒸留する「クロススケール蒸留」で自己蒸留より大きく精度を改善しています 📈 16層構成ではパラメータ10.35%削減しつつマクロ平均エラー率5.61%→5.27%に改善 📉 14層構成でもパラメータ20.70%削減で精度低下はわずか+0.14ptに抑えられています 🚗 車載チップ上でエンコーダ処理時間を21.4%、全体レイテンシを4.7%削減しています 🔓 コードとモデルはGitHub・Hugging Faceで公開済み(CC BY-NC 4.0) 層を削るだけでなく「どう賢く削って回復させるか」の設計がよく練られていると感じました。 #音声LLM# #モデル圧縮#
もっと見る
便利だけど知られていないOpenAI APIの機能 🛡 ユーザーが入力したコンテンツ、有害な内容が混ざっていないか心配ではありませんか? OpenAIの「Moderation(モデレーション)」は、テキストの有害性を判定する無料のエンドポイントです。暴力、ヘイト、セクシャルなコンテンツなどを検出し、安全なアプリケーション構築に役立ちます。 📌 タイトル:Moderation(モデレーション) 🔗 URL: 🧩 概要 ユーザー生成コンテンツを扱うアプリケーションでは、有害なコンテンツの検出が不可欠です。Moderation APIはテキストを複数のカテゴリ(暴力、ヘイトスピーチ、自傷行為、セクシャルコンテンツなど)で分析し、各カテゴリのスコアとフラグを返します。無料で利用でき、LLMの入出力両方のフィルタリングに使えます。 🛠 使い方 テキストをModeration APIのエンドポイントに送信するだけ。レスポンスには各カテゴリの判定結果(フラグ)とスコア(確信度)が含まれます。閾値はアプリケーションの要件に合わせてカスタマイズ可能。LLMのリクエスト前(入力フィルタ)と後(出力フィルタ)の両方に挟むことで、二重の安全ネットになります。 🏗 本番システムへの組み込み方 ・UGCプラットフォーム:投稿前にモデレーションを通し、有害コンテンツをブロックまたはレビューキューに。 ・チャットアプリの安全層:ユーザー入力をLLMに渡す前にチェック。有害な入力を事前に弾く。 ・LLM出力のフィルタ:モデルの出力をユーザーに返す前にモデレーション。意図しない有害出力をキャッチ。 ・コンテンツ管理ツール:既存コンテンツを一括スキャンし、ポリシー違反のものを検出。 💡 ユースケース 📝 ユーザー投稿コンテンツのフィルタリング 🤖 LLMの入出力の安全チェック 🔍 既存コンテンツのポリシー違反スキャン 💬 チャットアプリの有害メッセージ検出 ⚠️ 注意点 モデレーションは完璧ではなく、偽陽性(問題ないのに有害判定)や偽陰性(有害なのに見逃し)が発生します。厳しい閾値はUXを損ない、緩い閾値はリスクを残します。アプリケーションの特性に合わせて閾値を調整し、エッジケースは人間のレビューで補完する設計が重要です。また、テキスト以外(画像、音声)のモデレーションは別途対応が必要です。 ✨ 安全なAIアプリの土台は「入口と出口のフィルタ」。無料で使えるので、まずはLLMの入出力にモデレーションを挟んでみてください。 #OpenAI# #LLM#
もっと見る
📖記事ご紹介📖 #Qiita# で「#さくらのAIEngine」3#,000リクエスト使い切りチャレンジを開催中✨️ 今回は、uist1idrju3iさんがVPSでHermesAgentを24時間運用❗️ LLM・音声機能に加え、受信ポートを開けない構成やコンテナ隔離まで解説👇️
もっと見る
ローカルLLMの次は、ローカルで「考えて動く」AIへ。 @arduino VENTUNO Qは、 ・センサーで感知する ・ローカルAIで判断する ・機器を動かす という流れを1枚のボードで構築。 NPUとリアルタイム制御用MCUを組み合わせ、LLM、VLM、音声認識などもオフラインで実行可能。
もっと見る
ほぼ24時間(実際は寝てる間以外のほとんど)、ローカルのPCで音声文字起こしのLLMをインストールして、動かして、都度Notionに保存して、私の秘書エージェントに繋ぐことに成功した!! これで、位置情報、パソコンの画面、音声全てを常にNotionエージェントに送り続けて、動かせるようになった。
もっと見る
ネイティブアプリから会話サポートやライブ翻訳、テレプロンプトのUIを呼び出せた。音声入力したテキストをApple IntellingenceなどのローカルLLMを使って翻訳して会話サポートのUIに流し込むこともできる。
もっと見る
【発表】PLaMo翻訳の利用上限を大幅に引き上げたProプランを提供開始しました。加えて、Liteプランのファイル翻訳件数上限も大きく引き上げました。ライブ音声翻訳と英文添削も新たに追加され、コスト効率の高い翻訳特化型の国産LLMで日々の翻訳を強力にサポートします。
もっと見る
🖐️ AIエージェントが「指差す」だけでなく、形を描き、動きを模倣し、発言を強調する手を持ったらどうなるでしょうか。XR空間でのエージェント会話に関する研究です。 タイトル: AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR URL: ❓ なぜ音声だけのエージェントでは足りないのでしょうか 💡 従来の2Dバウンディングボックス表示はフラットな画面向けで、Android XRのようなイマーシブ環境には合いません。人間の会話で手が果たす「指差す・描写する・強調する」役割が抜け落ちてしまいます。 ❓ どうやってジェスチャーを生成しているのでしょうか 💡 環境認識モジュールが物体を3Dレジストリに登録し、LLMがユーザーの発話に応じて「GestureEvent」を生成。ワード単位のタイムスタンプでTTSとアニメーションを同期させ、発話と手の動きがぴったり合った共話ジェスチャーを実現しています。 ❓ 実際に効果はあったのでしょうか 💡 12名の被験者内比較研究で、蘭のケアや3Dプリンタ操作タスクを実施したところ、物体の位置特定や方向参照が有意に容易になり(p<0.05)、複雑な手順のフォローもしやすくなったと報告されています。安全警告のジェスチャーと視覚効果の組み合わせも高く評価されました。 ❓ ユーザーはどう感じたのでしょうか 💡 「パートナーが導いてくれているような感覚」という声があり、ツール検索的な体験から体現化された対話へと感覚がシフトしたことが分かっています。 #XR# #AIエージェント#
もっと見る
便利だけど知られていないGemini APIの機能 🔑 ブラウザからLive APIに直接つなぎたい。でもAPIキーは露出させたくない。 Geminiの「エフェメラルトークン(Ephemeral tokens)」は、短命の使い捨てトークンを発行してクライアントから安全にLive APIへ接続する仕組みです。メインのAPIキーをフロントエンドに渡す必要がなくなります。 📌 タイトル:エフェメラルトークン(Ephemeral tokens) 🔗 URL: 🧩 概要 Live API(リアルタイム音声/動画)をブラウザやモバイルアプリから直接使う場合、APIキーをクライアントに渡すとセキュリティリスクになります。Ephemeral tokensは、サーバー側でメインAPIキーを使って短命トークンを発行し、クライアントはそのトークンで接続する仕組みです。トークンは短時間で失効するため、万が一漏洩しても被害を最小限に抑えられます。 🛠 使い方 バックエンドサーバーでGemini APIにエフェメラルトークンの発行をリクエストします。返されたトークンをフロントエンドに渡し、クライアントはそのトークンでLive APIのWebSocketに接続。トークンは数分で失効するため、必要に応じて再発行する仕組みを組み込みます。 🏗 本番システムへの組み込み方 ・ブラウザ音声チャット:Webアプリからリアルタイム音声会話を提供。サーバーを中継せず直接接続することで低レイテンシを実現。 ・モバイル音声アシスタント:スマホアプリから直接Live APIに接続。APIキーはサーバーに保持したまま。 ・ライブ配信連携:配信プラットフォームのフロントエンドからリアルタイム翻訳やキャプション生成。 ・対面接客AI:タブレット端末からLive APIに接続して、店頭での音声アシスタントを構築。 💡 ユースケース 🎙️ ブラウザからのリアルタイム音声チャット 📱 モバイルアプリの音声AI連携 🎬 ライブ配信のリアルタイム処理 🏪 店頭タブレットの音声アシスタント ⚠️ 注意点 トークンの有効期限は短いため、長時間セッションでは途中でトークンの再発行が必要です。トークン発行のバックエンドは必ず認証を入れ、不正なトークン発行を防いでください。また、トークン発行自体のレート制限も考慮しましょう。 ✨ クライアント直接接続でレイテンシを下げつつ、APIキーの安全性も確保。リアルタイムAI体験の構築に欠かせない仕組みです。 #Gemini# #LLM#
もっと見る
便利だけど知られていないGemini APIの機能 📁 同じファイル、毎回アップロードし直していませんか?一度上げれば何度でも使えます。 GeminiのFiles APIは、ファイルをアップロードして複数のリクエストで再利用できる機能です。毎回ファイルを添付し直す必要がなくなり、効率的なファイル活用が可能になります。 📌 タイトル:Files API 🔗 URL: 🧩 概要 大きなファイルや同じファイルを何度も使うケースで、毎回リクエストにインラインで含めるのは非効率です。Files APIはファイルをGoogleにアップロードし、返されるURIで以降のリクエストから参照できます。画像、動画、PDF、音声など様々な形式に対応。アップロード済みファイルはサーバー側に保持されるため、転送の重複を省けます。 🛠 使い方 media.upload エンドポイントにファイルをアップロードします。返されたファイルURIを、generateContentリクエストのfileData部分に指定するだけ。アップロード済みファイルの一覧取得や削除も可能です。ファイルには有効期限があり、期限後は自動削除されます。 🏗 本番システムへの組み込み方 ・マルチモーダル分析:大きな動画や音声ファイルを一度アップし、「要約して」「翻訳して」「この部分を説明して」と複数回の分析を実行。 ・ドキュメントレビュー:レビュー対象のPDFをアップロードし、複数の観点(品質、正確性、スタイル等)から順にチェック。 ・教育コンテンツ:教材ファイルをアップし、生徒ごとに異なる質問をしても同じファイルを参照。 ・画像カタログ分析:商品画像をアップして、説明文生成、タグ付け、品質チェックを順番に実行。 💡 ユースケース 🎬 大きな動画/音声の複数観点分析 📄 ドキュメントの多角的レビュー 🎓 共通教材に対する個別Q&A 🛒 商品画像の一括多用途処理 ⚠️ 注意点 アップロードファイルには有効期限(通常48時間)があり、それを超えると自動削除されます。長期的に使うファイルは自前のストレージで管理し、必要時に再アップする設計にしましょう。また、ファイルの合計容量にも制限があるため、不要なファイルは定期的に削除してください。 ✨ ファイルの「アップロード→参照」パターンを覚えるだけで、マルチモーダルの使い勝手が格段に上がります。まずは大きめのPDFや動画で試してみてください。 #Gemini# #LLM#
もっと見る