MiniMax在2026年8月3日发布了H3,这是继Hailuo 01、Hailuo 02之后它的第三代视频模型,也是公司第一次开放视频模型权重。同一天,ComfyUI就做完了原生支持:文本、图片、视频、音频四种输入都能喂进去,最长15秒、最高2K,还带原生立体声音频。

这次的关键判断不是分辨率参数。是开放权重、多模态输入和音画同步生成,第一次被压进了本地的节点工作流。但官方反复强调的“RTX 3060可运行”,背后是把内存占用从123.6GB硬压到42.5GB的极限工程,离“顺手好用”还有距离。

H3做对了什么,权重开放意味着什么

H3能做的事不算新鲜:文生视频、图生视频、首尾帧控制、参考视频做运动迁移。真正的变化在于多模态融合——图片、音频、视频三种输入可以同时喂给模型,让它判断素材和提示词之间的关系,而不是靠人工拼接几个单独工具的输出。

音频也不是后期配上去的。画面和声音在同一次生成过程里产出,官方称之为“原生立体声”,口型、动作节奏和声音理论上能在生成阶段对齐。

MiniMax此前的Hailuo 01和Hailuo 02都靠云端API调用,模型权重从没开放过。H3是第一次把权重放出来,这也是ComfyUI愿意同日跟进原生支持的原因——本地部署终于有了基础。

需要提醒一句:开放权重不等于完全开源、可随意商用。具体许可条款要看模型页面的授权说明,不能直接当成“免费商用”。

H3改变了什么工作流 过去:云端接口模型 依赖云端API调用 音频多为后期配音 权重不开放,无法本地跑 现在:H3+ComfyUI 开放权重,本地节点跑 音画同一次生成,原生立体声 消费级显卡(需显存卸载)

RTX 3060能跑,不等于跑得快

ComfyUI团队把H3约40%的调制参数剪掉,换成一张查找表,再配上int8量化和定制推理内核。全精度模型123.6GB的内存占用,压到了42.5GB。

版本内存/显存要求备注
全精度模型123.6GB官方原始权重
剪枝+int8量化42.5GB内存占用降幅约66%
RTX 3060运行12GB显存 + 动态卸载显存远低于42.5GB,靠系统内存补

42.5GB是模型总内存占用,不是显卡显存要求。RTX 3060显存只有12GB,剩下的数据要靠动态显存卸载,从系统内存里按需搬运。

生成一条15秒2K视频要多久,官方材料没给数字。系统内存下限、长时间运行是否稳定,目前也看不清。这些恰恰是决定“能不能真的拿来干活”的关键信息,而不是“能不能跑起来”。

H3本地化优化:内存砍掉多少? 123.6GB 全精度模型总内存占用 42.5GB 剪枝+int8量化后占用 66%↓ 官方给出的总体内存降幅 RTX 3060 需动态显存卸载才能运行 注:42.5GB是模型总内存占用,非显卡显存峰值

独立创作者和内容团队,现在该做什么

拿着消费级显卡的独立创作者,可以直接下载模板试跑。建议先用短时长、低分辨率的片段测速度和稳定性,别一上来就冲2K、15秒的满配版本。

已经在用云端视频模型的广告和内容制作团队,先别急着把预算挪到本地部署。把生成一条成片要多久、系统内存门槛多高、连续跑几个小时会不会崩,这几个数字问清楚,再决定要不要小范围试点。

评论区已经有用户反映,官方的R2V模板目前只允许上传两张参考图,跟宣传里的多输入能力有落差。这类具体限制官方通稿不会主动讲,也是接下来最该盯的变量。