MiniMax H3 团队在 Reddit AMA 中透露,正在开发一款专门的图像模型,并计划开放权重。它会把文生图和通用图片编辑放进同一个模型,目前已经进入后训练优化阶段。
这款模型和 H3 来自同一套架构思路。它会沿用 H3 的 VAE Encoder,并为图片生成单独设计 VAE Decoder。MiniMax 设想的工作流是,先用图像模型生成首帧,再交给 H3 继续生成视频。
团队还提到,H3 本身已经表现出一定的生图和修图潜力。此前他们只训练模型根据「首帧 + 文字描述」预测尾帧,没有专门做图片编辑训练,但模型在多项图片编辑评测中仍表现出较强的零样本能力。这也是 MiniMax 继续把这套架构扩展到图像模型的重要依据。
顯示更多
MiniMax 正式开放视频模型 H3 的权重。本次发布包含两套 H3-Base:一套负责文生视频和首尾帧生视频,另一套负责同时参考图片、视频和声音。用户按任务选择其中一套,无需同时加载。
H3-Base 的生成主干是一个 330 亿参数的稠密单流 Transformer,编码器基于 Qwen3-VL-32B。本地部署可生成 4 至 15 秒、带立体声的 768p 视频。
这次开放的并非完整 H3 系统。负责理解复杂素材关系的 H3-Context-IR、把 768p 结果重新生成到 2K 的 H3-Regenerate-2K,以及稀疏注意力实现都没有放出。开发者要复现官方的完整 2K 效果,仍需调用 MiniMax API。
许可也有明显限制。MiniMax H3 Community License 不适用于美国、欧盟、英国和韩国,这些地区需要另行申请授权。年收入超过 2000 万美元的企业,也要提前获得 MiniMax 的书面授权。
顯示更多