测试了一晚上:提速 24.3%,最高提速 44%
SageAttention 2.2.0 跑 MiniMax H3,在 RTX 4090 48G 上的实测(开源项目地址放最后)
清空显存后的可复现结果,是单段从 425.6 秒降到 322.0 秒,每段省 103.6 秒;
连续跑 13 段,大约省 22 分钟。44% 是首轮测到的极值。
安装:
pip install sageattention==2.2.0 --no-build-isolation
ComfyUI 在 UNETLoader 后接 KJNodes 的 Patch Sage Attention KJ,选 auto;
model 输出同时接 BasicScheduler 和 BasicGuider,4090 会自动走 cuda++。
具体开源地址👇
顯示更多
本地搭建了MiniMax H3(海螺3)
15秒的视频,跑了20多分钟
H3 Ref2VA 原生音画链:
H3 Ref2VA INT8 ConvRot 主模型:20.97GB
Qwen3-VL-32B NVFP4-AWQ 编码器:15.69GB
H3 Video VAE FP16:5.21GB
H3 Audio VAE FP32:0.61GB
权重合计:42.47GB
ComfyUI 0.30.0 + 原生 MiniMaxH3ReferenceToVideo 节点
PyTorch 2.11、CUDA 12.8、comfy-aimdo DynamicVRAM
3 张参考图、1152×640、24fps、362 帧、20 步,res_multistep + simple 👇
顯示更多