推荐这份清单,几个新出的 TTS 和实时语音工具。
首个专门的开源 TTS 模型来了,WebRTC SDK 也开源了——从模型到基础设施,都有东西在动。
Voice Agent 领域的几个新发布和工具。
1. Qwen3-TTS(新)
阿里 Qwen 团队发布的开源 TTS 模型。目前细节不多但值得标记——Qwen 系列在语音方向上的第一个专门 TTS 模型,不再是通用 LLM 的附加功能。
GitHub:
2. MOSS-TTS / MOSS-TTS-Nano
OpenMOSS 团队发布的两个 TTS 模型。Nano 版本主打轻量和本地部署,适合嵌入式和边缘设备场景。
GitHub:
3. LLMRTC — 开源实时语音/视觉 Agent SDK
纯 TypeScript 的开源 SDK,用于构建实时语音和视觉 AI agent。基于 WebRTC,直接支持浏览器端和 Node.js。适合想自己搭建类似 ChatGPT Voice Mode 或 Gemini Live 体验的开发者。
GitHub:
4. Building Enterprise Realtime Voice Agents from Scratch
一篇从零构建企业级实时语音 Agent 的技术教程。覆盖了 WebRTC 信令、STT 选型(Whisper vs Deepgram vs 自建)、LLM 延迟优化、TTS 流式输出、以及生产环境的断线重连和状态恢复。
5. Voice Agent Latency Optimization 最佳实践
社区维护的语音 Agent 延迟优化指南。核心发现:端到端延迟的主要瓶颈往往不在模型推理,而在 audio chunking 策略和 VAD(Voice Activity Detection)参数调优。一个常被忽略的优化点是服务端音频缓冲区大小——默认 20ms 的帧长在某些网络条件下会导致不必要的等待。
GitHub:voice-agent-examples
#
VoiceAgent# #
TTS# #
WebRTC#