注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 VoiceAgent
VoiceAgent 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 VoiceAgent 的推特
推荐这份清单,几个新出的 TTS 和实时语音工具。 首个专门的开源 TTS 模型来了,WebRTC SDK 也开源了——从模型到基础设施,都有东西在动。 Voice Agent 领域的几个新发布和工具。 1. Qwen3-TTS(新) 阿里 Qwen 团队发布的开源 TTS 模型。目前细节不多但值得标记——Qwen 系列在语音方向上的第一个专门 TTS 模型,不再是通用 LLM 的附加功能。 GitHub: 2. MOSS-TTS / MOSS-TTS-Nano OpenMOSS 团队发布的两个 TTS 模型。Nano 版本主打轻量和本地部署,适合嵌入式和边缘设备场景。 GitHub: 3. LLMRTC — 开源实时语音/视觉 Agent SDK 纯 TypeScript 的开源 SDK,用于构建实时语音和视觉 AI agent。基于 WebRTC,直接支持浏览器端和 Node.js。适合想自己搭建类似 ChatGPT Voice Mode 或 Gemini Live 体验的开发者。 GitHub: 4. Building Enterprise Realtime Voice Agents from Scratch 一篇从零构建企业级实时语音 Agent 的技术教程。覆盖了 WebRTC 信令、STT 选型(Whisper vs Deepgram vs 自建)、LLM 延迟优化、TTS 流式输出、以及生产环境的断线重连和状态恢复。 5. Voice Agent Latency Optimization 最佳实践 社区维护的语音 Agent 延迟优化指南。核心发现:端到端延迟的主要瓶颈往往不在模型推理,而在 audio chunking 策略和 VAD(Voice Activity Detection)参数调优。一个常被忽略的优化点是服务端音频缓冲区大小——默认 20ms 的帧长在某些网络条件下会导致不必要的等待。 GitHub:voice-agent-examples #VoiceAgent# #TTS# #WebRTC#
显示更多
收到邮件,x 可以通过 x voice agent builder 免费领个手机号码。但我领一直报错,有领成功的吗?
新视频发布 《半小时用 AI 做一个口语外教| voice agent 教程》 你可能看多了 vibe coding 官网的教程,但可能很少会看到语音智能体的教程,跟着视频会发现非常简单。 本期视频做了些简单科普,如果你想入门语音智能体,那么这期视频可能对你很有帮助。 PS: 本期视频用的是 @AgoraIO 的服务!
显示更多
0
44
34
3
转发到社区