MiniMax H3 深度解读<全模态生成模型的>全模态生成模型的>”DeepSeek 时刻”
2026-08-05 整理 | 基于官方博客、HuggingFace 模型卡、平台文档及多家一手评测信源
〇、一句话概览
MiniMax H3 是稀宇科技(MiniMax)于 2026 年 7 月 31 日发布、8 月 3 日正式开源的通用”全模态”生成模型——它把文本、图像、视频、声音当成同一段多模态上下文统一理解,一次生成”最长 15 秒、原生 2K、自带立体声”的音视频成片。这是全球首个达到前沿水平、且真正开放权重的旗舰级多模态生成模型,被媒体形容为视频生成领域的”DeepSeek 时刻”。
核心标签:
| 维度 | 结论 |
|---|---|
| 定位 | 通用全模态生成系统(Omni-modal generative system) |
| 参数量 | 33B 密集单流 Transformer(约 13B 在 AdaLN 分支,推理可裁剪) |
| 输出 | 4–15 秒视频、24 FPS、32kHz 原生立体声、默认 2K |
| 榜单 | Artificial Analysis”有声视频编辑”全球第一(Elo 1130),文生视频第二、图生视频第三 |
| 定价 | 0.8 元/秒(2K),不到主流旗舰的三分之一 |
| 开源 | 2026-08-03 开源权重(HF: MiniMaxAI/MiniMax-H3),16 家芯片/平台首日适配 |
一、发布与开源时间线
- 7 月 31 日 MiniMax 正式发布 H3,预告”未来几天开放模型权重”;同日魔搭社区显示将于 8 月 3 日 0 点(北京时间)开源。
- 7 月 31 日当天,港股 MINIMAX-W(00100.HK)大涨 12.56% 报 229.4 港元;8 月 3 日盘前正式宣布开源,股价报 249.4 港元、涨幅超 10%。市场用真金白银为这次发布投票。
- 8 月 3 日 权重正式落地 Hugging Face(
MiniMaxAI/MiniMax-H3),同时 ComfyUI 镜像Comfy-Org/MiniMax-H3上线,ComfyUI 当日原生支持。
按官方说法,H3 是 MiniMax 推出的首款开源多模态生成模型,也是 H 系列(海螺 Hailuo)第三代——Hailuo 01 从 0 到 1 搭系统,Hailuo 02 打磨架构效率与数据质量,H3 则完成了一次”任务统一”式的重构。行业里也把它称作”Hailuo 3.0 / Hailuo 03”。
二、H3 是什么<一个>一个>”全模态”生成系统
传统视频模型把能力切碎成几十个独立任务<文生图>文生图>、图生视频、首尾帧、主体参考、动作参考、音色参考、视频编辑……声音领域还分人声、音效、音乐,彼此各有清晰的边界。H3 的设计纲领是:打破任务和模态的隔离,把所有能力合并进”一段多模态上下文 + 一句自然语言指令”这一个任务里。
2.1 输入输出规格(来自模型卡)
| 类别 | 规格 |
|---|---|
| 输出时长 | 4–15 秒 |
| 分辨率 | 默认短边 768px;2K 由 H3-Regenerate-2K 二次生成 |
| 帧率 | 24 FPS |
| 音频 | 32kHz 原生立体声(双声道) |
| 画幅比 | 21<9>9>、16<9>9>、4<3>3>、1<1>1>、3<4>4>、9<16>16> 等 |
| 对话语言 | 稳定支持 11 种<阿拉伯>阿拉伯>/中/英/法/德/意/日/韩/葡/俄/西 |
两种本地检查点(Checkpoint):
| 检查点 | 任务 | 输入条件 |
|---|---|---|
| H3-Base-FL2VA | 文生音视频(t2va)、首/尾帧生音视频(fl2va) | 文本;0/1/2 张图 |
| H3-Base-Ref2VA | 全模态参考生音视频(ref2va) | 文本 + 参考;图像≤9、视频≤3 段、音频≤3 段,合计≤12 个文件 |
一个典型示例<上传>上传>”参考视频 1 的希区柯克式镜头运动 + 图 2 中的人物 + 音频 3 的歌声”,prompt 写一句”让图 2 里的人物按参考视频的运镜唱歌,歌声参考音频 3”,H3 直接一次出带原生双声道的 2K 成片。这不再是”执行一个融合任务”,而是”理解一段由视频、图片和文字共同构成的上下文”。
2.2 完整系统 = 三大模块
官方明确,H3 不是单文件,而是三个模块协同的系统:
- H3-Context-IR(托管,未开源) —— 多模态指令的”理解 + 编排”系统。它解析指令、做跨模态关联、时序理解和复杂逻辑推理,把”素材和素材、素材和目标之间的关系”序列化成模型能懂的 Context Intermediate Representation。官方强烈建议生成管线接入它,或按其 Prompting Guidance 自建预处理系统。
- 代价<大部分素材要耗>大部分素材要耗> ~100K Token 的推理,最后压成平均约 4K Token。
- H3-Base(已开源) —— 真正的生成引擎,产出 768p 音视频(FL2VA / Ref2VA 两个检查点)。
- H3-Regenerate-2K(托管,未开源) —— 把 768p 结果连同原始多模态上下文一起塞回 H3,原地”重新生成”一遍 2K 版本。
关键区分:本地部署的是 H3-Base,原生画布就是短边 768px;官方宣传的 2K 直出走的是托管 API 全链路。本地想要完整 2K 需本地 Base + 官方 Context-IR / Regenerate-2K API 拼起来。
三、核心技术拆解
官方博客只点到四个名字,模型卡把它们说透了:
3.1 Contextual Omni Representation(数据/标注层)
训练 H3 最重要的一环是强化 Caption(描述)能力,但这里的 Caption 被彻底泛化了:
- 不只描述”目标视频”,还要描述上下文与目标的关系、上下文内部元素间的关系;
- 要联合描述视频和音频,而多镜头下的音画对应关系又更复杂一层。
这套表征就叫 Contextual Omni Representation。它的实现桥梁是语言——“语言(或者说广义的智力结构)是泛化的桥梁”。所有任务差异都被翻译成”描述上的差异”,模型结构因此能保持干净,用同一套表述能力覆盖训练里从没出现过的组合。这正是 H3 指令理解能力的根源。
3.2 H3-VAE(压缩层)<4>4> 倍序列长度收益
H 系列一直啃 tokenizer 这块硬骨头。H3 一代彻底革新了前代技术:
- H3-VisualVAE<时序因果视频自编码器>时序因果视频自编码器>,空间压缩 16×、时间压缩 4×、24 个 latent 通道(记作
f16t4d24),再做1×2×2patchify,进入 Transformer 时等效空间下采样 32×;训练完编码器后额外训了一个 ViT 解码器来降本提质。 - H3-AudioVAE<左右声道各用同一套编解码器独立处理再重组>左右声道各用同一套编解码器独立处理再重组>,实现立体声输入输出;把 32kHz 音频压成 40Hz 的 latent token 序列。
结果:高压缩率带来 4 倍序列长度收益,大幅拉低训练与推理成本,这也是”敢默认提供原生 2K”的底气。
3.3 H3-Omni Transformer(架构层)<33b>33b> 密集单流
- 33B 参数、密集、单流 Transformer,其中 约 13B 参数在 AdaLN(自适应层归一化)相关分支——调制输出可预计算缓存,因此仅推理部署可以根本不加载这部分,这就是”剪枝版检查点只有 ~21GB”的来源。
- Attention 和 FFN 层不含任何模态专属结构;模态专属参数只集中在输入输出层和 AdaLN 分支。
- 位置编码用 MM-RoPE(3D 多模态旋转位置编码),在时间 + 两个空间维
(t,h,w)上表达位置关系。 - 训练末段引入原生稀疏注意力(当前开源版本暂只给全注意力推理,稀疏实现后续发布)。
- 关键取舍<抛弃了曾带来显著优势的>抛弃了曾带来显著优势的> Hailuo-02 架构。MiniMax 的原话是”架构技巧应为模型定义让路,任务泛化是不可逆转的趋势”。国内大模型团队主动砍掉自己最引以为傲的架构,并不常见。
- 因为多模态上下文让序列长度方差大了 3 倍、理解与生成的算力结构高度异质化,团队用了理解/生成异构训练架构,精细调不同 workload 下的硬件利用率,再做每样本异构计算 × 样本间负载均衡,端到端训练吞吐提升近 30%。
- 文本编码器 H3-Encoder 直接复用 Qwen3-VL-32B 的完整预训练权重,把第 50 层 hidden states 喂给 Omni Transformer——所以 oschina 那篇文章标题才叫”一个视觉语言模型只够当它的编码器”。
3.4 In-context Regeneration(输出层)<不靠超分>不靠超分>,靠”重生成”
行业做 2K/4K 的常规思路是”先生成低清 → 套专用超分模块放大”,超分本质是在猜缺失细节,小字、纹理、光影经常糊。H3 的做法是:
把 768p 结果当作参考,连同原始多模态上下文一起再喂回基模”重新生成”一遍 2K。好处有二<①>①> 最大程度复用 H3 已有的生成能力;② in-context 形式能找回低清画面里已经看不见、但上下文里仍存在的信息(小文字、品牌 Logo 细节等)。这也是 H3 在片头/Logo/字幕等复杂文字场景不翻车的底层原因。这套方案本身也是”任务泛化”的一个体现。
四、实测表现<它到底强在哪>它到底强在哪>
4.1 榜单与第三方结论
- Artificial Analysis 榜单(2026-07-31 发布日)<视频编辑能力>视频编辑能力>全球第一(Elo 1130),领先 Gemini Omni Flash、HappyHorse-1.0、Wan 2.7 等;文生视频第二、图生视频第三,六个偏好池全部进入前三。Artificial Analysis 评价:“发布权重将使其成为迄今遥遥领先的领先开源权重模型。”
- 诚实的一面<文生视频仍落后>文生视频仍落后> Google Gemini Omni Flash,图生视频落后 Seedance 2.0 与 Gemini Omni Flash——它编辑第一,但并非样样第一。
- 多家实测(品玩、36氪、云栈、智东西)的共同结论:与 Seedance 2.0 打的有来有回,生成速度体感更快,复杂文字保持超过 Seedance 2.0。
4.2 五个真正能打的能力
- 跨模态复合参考(全模态上下文)<品玩实测>品玩实测>——上传红辣椒乐队动画参考视频 + 上海美罗城街景图,H3 不仅 get 到原视频人物运动,还识别出美罗城是球状屏幕,让运动遵循球面变形规律;视频图片都没声音,它自动补齐了 BGM、屏幕闪烁音效、人物进入球面屏的音效。
- V2V Motion Transfer(视频到视频动作迁移)<把参考视频的人物动作>把参考视频的人物动作> + 运镜轨迹迁到全新视频,同时保持目标画面风格与主体。广告/电商场景不用重拍即可让同一产品出现在不同动态场景。
- 指令式精准编辑 / 导演级指令遵循<换台词>换台词>、配音、改嘴型、替换角色、删物体、加特效,都能在保持整体一致性的前提下局部改。品玩让范志毅采访视频”换种说法”,音色嘴型都还原得很好;打光测试里烛光→硬光→彩虹折射→红蓝对打→金色逆光连续变化,受光区域、面部阴影、金属高光都跟着变,红蓝阶段皮肤和真丝还保留材质感。
- 复杂文本保持 / 品牌信息呈现<这是>这是> H3 最出圈的专项。Logo 放玻璃杯上要理解折射、放墙上要理解曲率纹理、跟随镜头要不变形;片头英文演职员表清晰可读、不拼错、不乱码,且按时间块(按秒)执行的提示词能被严格遵循(游戏 UI 导览、0→100% 加载条、整环境加载等分镜逐一落位)。
- 原生双声道 + 声音可写进提示词<音乐>音乐>、音效、环境声、对白与画面同一次生成,可指定”第 3 秒低鼓进、第 10 秒萨克斯即兴”这类时间点。支持中文台词、口型同步,对短剧、口播、产品讲解极实用。
4.3 已知短板(各评测如实披露)
- 无官方对比评测表 / 技术报告(发布时),榜单位置验证的是托管链路,不代表本地 Base 检查点。
- 多镜头编排偶有动作重复(智东西实测<递奶茶动作连续出现两次>递奶茶动作连续出现两次>);部分场景仍有明显 AI 生成感(如寺庙建筑)。
- 细腻连续的物理交互仍不稳(云栈实测<粉底铺开>粉底铺开>→贴合皮肤的过程被跳切成最终妆效)。
- 本地 768p 画布在 21<9>9> 等极端画幅下输出上限约 768×1344。
五、价格<把商用起步价打到三分之一>把商用起步价打到三分之一>
5.1 官方与第三方定价
| 档位 | 官方 | Atlas Cloud(2026-07 核实) | 会员折算(云栈实测) |
|---|---|---|---|
| 2K | 0.8 元/秒(不到主流旗舰 1/3) | 0.14 美元/秒 | 约 0.4 元/秒 |
| 768P | 主流 720P 的 1/2 | 0.10 美元/秒 | 约 0.23 元/秒 |
参照系
注意两个坑<①>①> 托管端
resolution目前只接受2K一个值,README 里写的 768p 档已关闭——而 768p 恰是你本地跑权重时的原生画布,这正好形成对称;② 并发约 1 个任务,并发请求会 429,须串行调用。
5.2 为什么能这么便宜
不是单纯补贴,是架构效率:
- H3-VAE 的 4 倍序列压缩直接砍掉训练/推理成本;
- 异构训练 + 负载均衡端到端 +30% 吞吐;
- 推理可裁剪掉 AdaLN 的约 13B 参数;
- 借鉴文本模型已验证的方法(复杂问题拆解、推理、上下文扩展、Muon 优化器、MSA 稀疏注意力)迁移到多模态训练。
六、开源细节<42>42>.5 GB 起步,无需超算
6.1 下载与文件
- 官方仓库
MiniMaxAI/MiniMax-H3全拉取约 498 GB(所有精度变体 × 两检查点);ComfyUI 打包镜像Comfy-Org/MiniMax-H3约 343 GB。 - 你只需要 4 个文件<单任务最小工作集>单任务最小工作集> 42.5 GB(剪枝版 fl2va + nvfp4 编码器 + 视频/音频 VAE);全 bf16 全套约 123.6 GB。
- 关键文件参考
/ref2va 剪枝 int8 各 20.97GB、int8 34.04GB、bf16 66.28GB;文本编码器 qwen3vl-32b(4-bit AWQ 15.69GB / int8 27.14GB / bf16 51.51GB);视频 VAE 5.21GB;音频 VAE 0.61GB。 - 因为 ~13B AdaLN 参数推理时不用加载,ComfyUI 声称 12GB 显存 + 动态卸载(RTX 3060 级)可本地运行(需约 64GB 系统内存换 VRAM,速度会慢)。
6.2 部署与生态
- 推理框架:SGLang、vLLM、diffusers、ComfyUI 四路齐发,支持多卡并行(SGLang 官方例 4 卡、ulysses-degree 4);发布检查点是 CFG-distilled 权重。
- 首日适配 16 家生态伙伴<芯片侧华为昇腾>芯片侧华为昇腾>、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel;社区/平台侧 Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、fal;框架侧 vLLM-Omni、SGLang。
- Intel 为 H3 提供 Day 0 支持<锐炫>锐炫> Pro B70 上做 Encoder 8 卡张量并行 + DiT 8 卡 USP(配合 Layer-wise Offloading)+ VAE 部署,并开发 2TP×4USP 混合并行;H3 设计初期就考虑了多款国产芯片兼容性。
6.3 许可证(MiniMax H3 Community License,2026-08-02 生效)——必须读懂的条款
| 条款 | 内容 | 影响 |
|---|---|---|
| 适用区域 | 全球范围”除外区域”,即 欧盟、英国、韩国、美国 | 社区许可证不授权这些区域使用,覆盖输出而非仅权重 |
| 区域使用禁令 | 不得在适用区域之外使用/复制/修改/分发 H3 或其输出 | 处于排除区域需走单独授权渠道(“尚未,而非永不”)或使用托管 API |
| 署名 | 商业产品 UI 上须显著显示 “MiniMax H3” | 是 UI 改动,不是脚注 |
| 收入门槛 | 年收入 >2000 万美元需事先书面授权 | 免费商用有上限 |
| 禁止蒸馏 | 不得用 H3 或其输出改进任何其他 AI 模型 | 排除模型清洗/蒸馏 |
| 管辖法 | 香港特别行政区法律,香港专属管辖 | 记入风险台账 |
MiniMax 自己的 Q&A 解释了原因<视频生成处于比文本更快的监管环境>视频生成处于比文本更快的监管环境>(欧盟 AI 法案、英美韩规则、美国生成视频版权诉讼);API 因其控制服务基础设施而保持全球可用,开源权重则放弃了这种控制。严格说这是”开源权重”而非 OSI 意义上的开源——真正 Apache 2.0 开放的只有 Qwen3-VL-32B 编码器这一层。
七、行业意义<为什么说这是视频生成的>为什么说这是视频生成的>”DeepSeek 时刻”
- 打破闭源垄断<此前视频生成头部>此前视频生成头部>(Sora、Veo、Seedance、可灵)无一开源,定价权高度集中,衍生出涨价、排队、白名单、拼单转售等乱象。H3 把”旗舰级 + 开源 + 0.8 元/秒”同时摆上台面,把行业从”技术比拼”推向”生态竞争”。
- 接住”数据主权”型客户<影视公司不会把未发布剧集素材丢进公有云>影视公司不会把未发布剧集素材丢进公有云> API,游戏公司不能把核心 IP 交给第三方模型。开源 + 可私有化部署正好接住这批最贵、最有粘性、最未被服务的 B 端。
- 吃掉后期工具链<传统流程是>传统流程是>”文生视频拿素材 → TTS 配音 → 剪映套字幕 → AE 做包装”。H3 把后期装进模型内部<理解创意意图>理解创意意图>、生成画面、匹配音效音乐、渲染字幕文字、完成动效包装,一次生成直接交付。参考量级
2025 财年创意云收入约 145 亿美元,国内视频后期外包市场估算 300–500 亿元人民币——若 AI 原生后期持续兑现,可能替代其中 10–30% 传统工序。 - 国产芯片适配样板<作为首个把>作为首个把>”多模态理解 + 生成”统一到国产芯片兼容体系的前沿模型,它给国产算力生态提供了可验证、可复用的基线。
对 MiniMax 公司而言,这是其 2026 年 1 月港股上市后、在资本市场波动期里的第一次主动出招,把估值逻辑从”概念溢价”推向”生产力定价”。外媒还报道其正在开发 2.7 万亿参数的语言模型,以及 H 系列下个版本将与 M 系列融合的路线图。
八、局限与官方路线图
官方自述的三点局限:
- 生成能力的地基是多模态上下文理解——这里提升空间巨大,后续将推动 H 系列下个版本与 M 系列能力融合(M3 已在 2026 年 6 月发布开源,基于自研 MSA 稀疏注意力架构,原生多模态、1M 上下文);
- 模型规模限制完成度——Scaling 是明确方向,任务泛化会给 Scaling 留出发挥空间;
- 部分场景画面精细度仍需提升——持续追求更高分辨率和更精细画质。
社区层面待办
九、快速上手路径
- 零代码试玩<海螺>海螺> AI(
hailuoai.com,国际版hailuoai.video)、MiniMax Hub(hub.minimaxi.com/ 国际hub.minimax.io),支持 768p / 2K、4–15 秒,可选全能参考 / 首尾帧 / 角色参考三种模式。 - API 调用<模型名>模型名>
MiniMax-H3,接口video-generation-v2-create(直出 2K)、video-generation-v2-h3-context-ir、video-generation-v2-regeneration;全球api.minimax.io/ 国内api.minimaxi.com。 - 本地部署<从>从> HF 下载剪枝 int8 单任务检查点(42.5GB 最小工作集),SGLang / vLLM / diffusers / ComfyUI 均可;本地出 768p,想要 2K 就接官方 Context-IR + Regenerate-2K API。
- 避坑<本地>本地> 768p 才是原生画布;托管端
ratio对 t2va 必填、不能adaptive;任务并发约 1,串行调用;排除区域(美/欧/英/韩)注意许可证边界。
参考来源
- MiniMax 官方博客(中文):《MiniMax H3<打破任务和模态的边界>打破任务和模态的边界>》https://www.minimaxi.com/blog/minimax-h3
- MiniMax 官方博客(英文):https://www.minimax.io/blog/minimax-h3
- HuggingFace 模型卡
/MiniMax-H3 https://huggingface.co/MiniMaxAI/MiniMax-H3 - MiniMax 开放平台文档:https://platform.minimaxi.com/docs/guides/video-generation
- 智东西:《又一国产模型重磅开源!有声视频编辑全球第一,16家芯片及平台首日适配》
- 品玩:《MiniMax H3<很能打>很能打>、更通用、还开源,多模态格局得变一变了》
- 36氪/字母榜:《天下苦闭源模型久矣,MiniMax要做多模态领域的Deepseek》
- Atlas Cloud 评测:《MiniMax H3 评测<原生2k>原生2k> AI视频,成本更低》https://www.atlascloud.ai/zh/blog/guides/minimax-h3-review
- Atlas Cloud:《MiniMax H3 开源权重<42>42>.5 GB,以及 4 个排除国家》https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights
- Kingy Review: MiniMax H3 Benchmarks, Specs and Hardware https://kingy.ai/news/minimax-h3-benchmarks-specs-hardware-review/
- Reuters(经 Yahoo Finance)
‘s MiniMax releases H3 video model - 英特尔新闻室:《英特尔为MiniMax H3提供Day 0支持》
- 云栈社区:《MiniMax H3视频模型实测》
- oschina:《MiniMax H3 开源<33b>33b> 全模态模型》
- 网易/IT之家、新浪/IT之家、搜狐、腾讯新闻等发布报道
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





