最近中文推里,
@Zesee 的数字人skill 太火了
如果你也想使用这个Skill, 算了一遍成本才发现,从声音克隆、配音到人物视频生成,每一层都在收费。10 秒视频要花 $1 左右。
本着独立开发者精神,能省则省的思路。
我就在想有没有本机部署模型的平替方案?
今天花了 4 个小时,总算找到了。
声音部分:改成本地运行 Qwen3-TTS 模型,用一段自己的录音生成后续口播 wav文件。
视频目前仍然使用 HeyGen: 但我已经找到代替方案 LongCat-Video-Avatar 1.5 模型(待测试)。
我发现在调用 HeyGen 花$0.6 后,生成的口播视频,缺少字幕,这就成了半成品。
无意中发现好友
@Jasper_Wei1 的 JPW-Live-Cut 给了我新的启发。我复用了他的 Remotion 字幕思路,单独做了一条本地字幕流水线,让它支持任意长度的普通口播视频。
现在整条流程已经变成:
本人参考声音
→ 本地 Qwen3-TTS 生成口播
→ 本地 ASR 检查
→ HeyGen 生成人物视频
→ Remotion 自动添加字幕
→ 人工确认最终成片
下一步很明确:用LongCat-Video-Avatar 1.5 替代 HeyGen 的方案,把人物视频生成这笔费用也压下来。
让花费$0 也能做数字人。
成品效果见视频。