MiniMax在2026年8月3日发布了H3,这是继Hailuo 01、Hailuo 02之后它的第三代视频模型,也是公司第一次开放视频模型权重。同一天,ComfyUI就做完了原生支持:文本、图片、视频、音频四种输入都能喂进去,最长15秒、最高2K,还带原生立体声音频。
这次的关键判断不是分辨率参数。是开放权重、多模态输入和音画同步生成,第一次被压进了本地的节点工作流。但官方反复强调的“RTX 3060可运行”,背后是把内存占用从123.6GB硬压到42.5GB的极限工程,离“顺手好用”还有距离。
H3做对了什么,权重开放意味着什么
H3能做的事不算新鲜:文生视频、图生视频、首尾帧控制、参考视频做运动迁移。真正的变化在于多模态融合——图片、音频、视频三种输入可以同时喂给模型,让它判断素材和提示词之间的关系,而不是靠人工拼接几个单独工具的输出。
音频也不是后期配上去的。画面和声音在同一次生成过程里产出,官方称之为“原生立体声”,口型、动作节奏和声音理论上能在生成阶段对齐。
MiniMax此前的Hailuo 01和Hailuo 02都靠云端API调用,模型权重从没开放过。H3是第一次把权重放出来,这也是ComfyUI愿意同日跟进原生支持的原因——本地部署终于有了基础。
需要提醒一句:开放权重不等于完全开源、可随意商用。具体许可条款要看模型页面的授权说明,不能直接当成“免费商用”。
RTX 3060能跑,不等于跑得快
ComfyUI团队把H3约40%的调制参数剪掉,换成一张查找表,再配上int8量化和定制推理内核。全精度模型123.6GB的内存占用,压到了42.5GB。
| 版本 | 内存/显存要求 | 备注 |
|---|---|---|
| 全精度模型 | 123.6GB | 官方原始权重 |
| 剪枝+int8量化 | 42.5GB | 内存占用降幅约66% |
| RTX 3060运行 | 12GB显存 + 动态卸载 | 显存远低于42.5GB,靠系统内存补 |
42.5GB是模型总内存占用,不是显卡显存要求。RTX 3060显存只有12GB,剩下的数据要靠动态显存卸载,从系统内存里按需搬运。
生成一条15秒2K视频要多久,官方材料没给数字。系统内存下限、长时间运行是否稳定,目前也看不清。这些恰恰是决定“能不能真的拿来干活”的关键信息,而不是“能不能跑起来”。
独立创作者和内容团队,现在该做什么
拿着消费级显卡的独立创作者,可以直接下载模板试跑。建议先用短时长、低分辨率的片段测速度和稳定性,别一上来就冲2K、15秒的满配版本。
已经在用云端视频模型的广告和内容制作团队,先别急着把预算挪到本地部署。把生成一条成片要多久、系统内存门槛多高、连续跑几个小时会不会崩,这几个数字问清楚,再决定要不要小范围试点。
评论区已经有用户反映,官方的R2V模板目前只允许上传两张参考图,跟宣传里的多输入能力有落差。这类具体限制官方通稿不会主动讲,也是接下来最该盯的变量。
