🔊 不用显卡、一个 pip 就能跑的语音合成来了,还是法国 AI 实验室 Kyutai 开源的。
GitHub 拿下 6.2K star,模型只有 1 亿参数,却能在 MacBook Air M4 上跑到 6 倍实时速度,只吃 2 个 CPU 核。
以前想给自己的东西加个文字转语音,要么调云 API 按量掏钱、数据还得往外传,要么本地跑个大模型没块好显卡根本带不动。
pocket-tts 把门槛砍到地板:一句 uvx pocket-tts generate 就出音频,第一段声音大概 200 毫秒就来,还支持声音克隆,英法德意西葡多种语言,甚至能塞进浏览器里直接跑。
文本再长也不怕,它能边读边流式往外吐音频。
GitHub:
显示更多