註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 TTS
TTS 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 TTS 的搜尋結果
@cryptoresetlife Qwen3-TTS-12Hz-1.7B-Base-8bit, 本地克隆任何人的声音,只需5秒样本。 出声速度比走网络豆包语音快, 在Mac Studio 512g下实测首音频延迟大约200ms, 效果也是跟sota相比有过之而无不及。
顯示更多
Fish Audio 把自家最强 TTS(S2.1-Pro)放出来 API 目前可以免费使用
推荐这份清单,几个新出的 TTS 和实时语音工具。 首个专门的开源 TTS 模型来了,WebRTC SDK 也开源了——从模型到基础设施,都有东西在动。 Voice Agent 领域的几个新发布和工具。 1. Qwen3-TTS(新) 阿里 Qwen 团队发布的开源 TTS 模型。目前细节不多但值得标记——Qwen 系列在语音方向上的第一个专门 TTS 模型,不再是通用 LLM 的附加功能。 GitHub: 2. MOSS-TTS / MOSS-TTS-Nano OpenMOSS 团队发布的两个 TTS 模型。Nano 版本主打轻量和本地部署,适合嵌入式和边缘设备场景。 GitHub: 3. LLMRTC — 开源实时语音/视觉 Agent SDK 纯 TypeScript 的开源 SDK,用于构建实时语音和视觉 AI agent。基于 WebRTC,直接支持浏览器端和 Node.js。适合想自己搭建类似 ChatGPT Voice Mode 或 Gemini Live 体验的开发者。 GitHub: 4. Building Enterprise Realtime Voice Agents from Scratch 一篇从零构建企业级实时语音 Agent 的技术教程。覆盖了 WebRTC 信令、STT 选型(Whisper vs Deepgram vs 自建)、LLM 延迟优化、TTS 流式输出、以及生产环境的断线重连和状态恢复。 5. Voice Agent Latency Optimization 最佳实践 社区维护的语音 Agent 延迟优化指南。核心发现:端到端延迟的主要瓶颈往往不在模型推理,而在 audio chunking 策略和 VAD(Voice Activity Detection)参数调优。一个常被忽略的优化点是服务端音频缓冲区大小——默认 20ms 的帧长在某些网络条件下会导致不必要的等待。 GitHub:voice-agent-examples #VoiceAgent# #TTS# #WebRTC#
顯示更多
通义发布 Qwen-Audio-3.0-TTS 语音模型 一段参考音能说 16 种语言和 20 种方言 首包延迟做到 300 毫秒级 同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
顯示更多
0
34
90
13
轉發到社區
生成的质量真心不错,需要TTS的可以试试。 Spark-TTS 核心特点: 基于LLM的高效TTS系统:完全基于Qwen2.5构建,无需额外生成模型 零样本声音克隆:无需特定训练数据即可复制说话者声音 双语支持:同时支持中文和英文,跨语言场景表现优秀 可控语音生成:可调整性别、音高、语速等参数创建自定义声音 技术亮点: 直接从LLM预测的代码重建音频,简化处理流程 支持Nvidia Triton推理服务,适合生产环境部署 性能优异,在L20 GPU上实时因子(RTF)低至0.0704 #AI# #AIAgent#
顯示更多
上海交通大学开源 F5-TTS 语音生成模型。该模型基于 10 万小时数据训练,支持中英多语言合成。技术特性包含 Zero-shot 声音克隆、基于总时长的速度控制、情感表现控制及长文本合成。支持商用。
顯示更多
0
22
62
4
轉發到社區
今天800兄弟们看值不值☄️☄️☄️
0
0
1K
202
轉發到社區