가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

左海
@heizolshao
🚀 Demystifying Reddit growth & anti-ban rules for builders. 📌 公开记录真实 Reddit 运营实战与避坑(纯实战,永不卖课) 💻 Full-stack Dev & 独立开发者
가입 May 2013
744 팔로잉 중    1.7K 팬
最近中文推里,@Zesee 的数字人skill 太火了 如果你也想使用这个Skill, 算了一遍成本才发现,从声音克隆、配音到人物视频生成,每一层都在收费。10 秒视频要花 $1 左右。 本着独立开发者精神,能省则省的思路。 我就在想有没有本机部署模型的平替方案? 今天花了 4 个小时,总算找到了。 声音部分:改成本地运行 Qwen3-TTS 模型,用一段自己的录音生成后续口播 wav文件。 视频目前仍然使用 HeyGen: 但我已经找到代替方案 LongCat-Video-Avatar 1.5 模型(待测试)。 我发现在调用 HeyGen 花$0.6 后,生成的口播视频,缺少字幕,这就成了半成品。 无意中发现好友 @Jasper_Wei1 的 JPW-Live-Cut 给了我新的启发。我复用了他的 Remotion 字幕思路,单独做了一条本地字幕流水线,让它支持任意长度的普通口播视频。 现在整条流程已经变成: 本人参考声音 → 本地 Qwen3-TTS 生成口播 → 本地 ASR 检查 → HeyGen 生成人物视频 → Remotion 自动添加字幕 → 人工确认最终成片 下一步很明确:用LongCat-Video-Avatar 1.5 替代 HeyGen 的方案,把人物视频生成这笔费用也压下来。 让花费$0 也能做数字人。 成品效果见视频。
더 보기