兄弟们,我又给你们找了 H3 的好东西,让你们少走弯路!
上篇文章已经讲过官方 Skills、Turbo LoRA、长视频续接和 T8 音画工作流,这里不再重复。几天过去,我又跑了一轮实测,H3 现在多了三块值得补上的能力:更稳的 8V8A 成片参数、新的 Attention 后端、人物 LoRA 和低显存方案。
第一处更新是成片步数。
我把 Larry Turbo + T8 的 4V8A、6V8A、8V8A 都跑了一遍。同一个 Prompt、Seed 424242、Turbo v4 step600、CK Attention、864×480、124 帧,只修改 Video Steps。
4V8A:92.80 秒
6V8A:92.48 秒
8V8A:93.29 秒
最大差距不到 1 秒,这次样本里 8V8A 的动作完整性、人物轮廓和画面稳定性最好。
T8 的硬性规则是 Audio Steps ≥ Video Steps。音频固定 8 步时,4V、6V、8V 都要执行 8 次联合 DiT 调用,所以耗时落在同一档。20V8A 会直接报错;想跑 20V,Audio 也必须至少设成 20A。
4V4A 可以快速试提示词,声音更容易出现底噪、爆音和立体声不稳。我目前把 8V8A 设为正式出片默认值。这个判断来自一个 Prompt、一个 Seed,后面还需要继续扩样本验证。
第二处更新是 Attention。
上篇推荐的 Turbo + SageAttention 继续保留。现在可以分成两条路线:
路线 A:CK Attention 单独使用
路线 B:SageAttention,按显卡测试叠加 Sol-Attn
CK、Sage、Sol 不应该同时写成一个组合。测试 CK 时,我会关闭 Sage 和 Sol,只替换 Attention 计算后端。
我在 RTX 4090 48GB 上做了单变量 A/B:同一模型、Prompt、Seed、分辨率、帧数和 25 步采样,只把 PyTorch Attention 换成 CK。
原版:272.70 秒,约 9.88 秒/步
CK:239.70 秒,约 8.52 秒/步
总耗时快 12.1%,采样快约 13.8%。两段画面结构和动作高度一致,没有发现明显画质退化,但并非逐像素相同。
CK 项目:
ComfyUI 官方 PR:
Sol-Attn:
我通过 ModelAttentionBackend 节点只给 H3 启用 CK,没有使用全局 --use-ck-attention。升级时还遇到一个坑:旧版 ComfyUI-MiniMaxH3-Cache 与新版 ComfyUI 存在 time_shift_slope 兼容错误,更新前要先检查 Cache 插件。当前 CUDA 12.8 已经获得 12.1% 提升;完整优化内核需要 CUDA 13,额外收益我还没有实测。
第三处更新是人物 LoRA。
上篇说人物和画风 LoRA 还没成气候,这个状态已经变化。Realism People LoRA 用 176 段真人视频训练,主要改善皮肤、五官和人物质感:
fal 也开放了 H3 LoRA Trainer。准备至少 10 段视频,就能训练自己的角色或风格,权重可以下载回本地工作流:
第四处更新是低显存。
ClipProj 用 4B/8B 投影模型替换 32B 文本编码器,把这一部分的显存占用从约 15.7GB 降到约 4.5GB:
低显存实机演示:
H3 GGUF 给 33B 主模型提供 Q2—Q8 量化,再配合 CPU offload,8—16GB 显存可以跑 480p 预览:
ClipProj 负责缩小文本编码器,GGUF 负责压缩主模型。低显存方案解决“能不能跑”,生成速度和画质仍然取决于量化等级、内存与 offload。
上篇提到的 h3-prompt-writing 也有了具体使用演示:
它可以帮 Claude、Codex 写镜头、对白和声音提示词。Agent → ComfyUI API → Remotion 的全自动链路还在继续打通。
我现在的 H3 路线已经固定下来:官方 Skills 写提示词;Larry Turbo + T8 用 8V8A 出片;Attention 选择 CK 单独使用,或者 Sage + Sol;Realism People 或 fal Trainer 处理人物 LoRA;ClipProj + GGUF 负责低显存预览。
玩 MiniMax H3 的,这 4 个仓库直接收藏,少走一星期弯路:
1⃣ MiniMax-AI/MiniMax-H3
官方仓库,重点不是权重,是里面带的 9 个 Skill——h3-prompt-writing 能让 Claude/Codex 替你组织镜头、对白、环境声,等于白嫖一个本地版提示词导演。
2⃣ larryvrh/MiniMax-H3-Turbo-Lora
目前最成熟的加速 LoRA,20 步压到 4–8 步:4 步出预览,6–8 步出成片。别信"5×"的传法——那是采样步数,端到端实测 3.9×(14 秒片从 15:57 到 4:03),VAE 解码和封装不跟着缩。
3⃣ NikoDemon80/ComfyUI-H3-Motion-Context
长视频续接。H3 单次上限 15 秒,要更长的分镜连贯生成,试试它。
4⃣ T8mars/comfyui-minimax-h3-audio-T8
音视频工作流合集,想把 H3 的声音能力用足的看这个。
实测最稳的加速组合:Turbo LoRA + SageAttention。EasyCache 是给原生 20 步准备的 , 跟 4 步 Turbo 不叠加,实测还多 5% 的监控开销,别全都开。
顺带说一个现状:H3 的 LoRA 生态现在热的是加速,人物/画风训练还没成气候,想训角色的再等等。
我下一步想打通的玩法 : Agent 调 h3-prompt-writing 写提示词 → ComfyUI API 出片 → Remotion 自动剪,全链路无人出片。通了发出来。
觉得有用,给这几个仓库个⭐️,链接👇
链接清单(放法你定:要么开评论贴,要么正文每条后面直接跟):
(注意 2⃣ 是 HuggingFace 不是 GitHub)
顯示更多