註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

劳伦斯
@LawrenceW_Zen
AI 独立开发者|专注 AI Agent 实操|BUILD IN PUBLIC |写给想入门、想做得更好的人 | 先完成再完美
加入 December 2025
1.2K 正在關注    13K 粉絲
做数字人,最容易犯的错是去找一个一体化工具,指望从选题到成片一把梭。用一阵子一定会出岔子。 因为一条数字人口播视频,其实只有五个位置:形象、声音、口型、内容、环境。五个位置互相独立,每个都可以单独换。 前三个让你「有一个数字人」。后两个才让它变成一条能发出去的营销视频。 绝大多数人的力气花在前三个上。卡住他们的,是后两个。 @MinLiBuilds 这篇把这件事拆到能下手。他自己先手搓了一条全本地链路:手机拍 30 秒素材当脸,VoiceBox 里跑 Qwen TTS 复刻自己的声音,再用 MuseTalk 把嘴逐帧重画,让口型和音频对上。脸是自己的,声音是自己的,稿子不用传给任何第三方。只做一个账号、量也不大,看到这里已经够用。 可真要做营销,这条链路会立刻露出四个洞:画面里只有人没有物,口型模型对姿势和构图很挑,没有环境也没有环境音,最要命的是——拍什么才能爆,它完全不管。 所以他后面把中间大半截换成了 Seedance 音画同出。给一张定妆参考图、一段描述,模型和声音一起吐出来。产品能进画面,构图不再被口型模型绑死,环境那一格也终于有东西填。他还从抖音里扒到一个词:ASMR。翻纸、脚步、杯子放下、室内那种说不清但确实存在的空气感,TTS 给不了,素材库也很难跟画面对上点。填满第五个位置的,不是语音模型,是视频模型。 但音画同出有一笔账必须先算清。它发挥空间太大,很难让它一字不差念完你的稿。产品名、价格、活动截止时间,念错一个字,这条就废。 所以本地那条他没删。两条是这么分工的: 要氛围、要环境、画面里要有产品:走 Seedance,一步到位。 逐字必须准,或者稿子不方便传出去:回本地,牺牲效果换可控。 别指望同时拿满。想清楚这一条视频要哪一头,比调参数重要。 还有一层比出片更值钱。选题不再沉进收藏夹,进一张每天自动变长的表;人设不再每次从零生成,先定妆,再做成主播库,换衣服换场景变成一次挑选。一条视频做完就结束了,一张表做完才刚开始。定妆卡沉淀成主播库,收藏夹沉淀成选题库,这两件事的收益是复利的。 本地负责可控,云端负责效果,表负责积累。数字人不是一个工具,是五个可以分开换的零件。
顯示更多