mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
5363 字
16 分钟
minimax-h3-deep-dive
2026-07-16

MiniMax H3 深度解读<全模态生成模型的>”DeepSeek 时刻”#

2026-08-05 整理 | 基于官方博客、HuggingFace 模型卡、平台文档及多家一手评测信源


〇、一句话概览#

MiniMax H3 是稀宇科技(MiniMax)于 2026 年 7 月 31 日发布、8 月 3 日正式开源的通用”全模态”生成模型——它把文本、图像、视频、声音当成同一段多模态上下文统一理解,一次生成”最长 15 秒、原生 2K、自带立体声”的音视频成片。这是全球首个达到前沿水平、且真正开放权重的旗舰级多模态生成模型,被媒体形容为视频生成领域的”DeepSeek 时刻”。

核心标签:

维度结论
定位通用全模态生成系统(Omni-modal generative system)
参数量33B 密集单流 Transformer(约 13B 在 AdaLN 分支,推理可裁剪)
输出4–15 秒视频、24 FPS、32kHz 原生立体声、默认 2K
榜单Artificial Analysis”有声视频编辑”全球第一(Elo 1130),文生视频第二、图生视频第三
定价0.8 元/秒(2K),不到主流旗舰的三分之一
开源2026-08-03 开源权重(HF: MiniMaxAI/MiniMax-H3),16 家芯片/平台首日适配

一、发布与开源时间线#

  • 7 月 31 日 MiniMax 正式发布 H3,预告”未来几天开放模型权重”;同日魔搭社区显示将于 8 月 3 日 0 点(北京时间)开源。
  • 7 月 31 日当天,港股 MINIMAX-W(00100.HK)大涨 12.56% 报 229.4 港元;8 月 3 日盘前正式宣布开源,股价报 249.4 港元、涨幅超 10%。市场用真金白银为这次发布投票。
  • 8 月 3 日 权重正式落地 Hugging Face(MiniMaxAI/MiniMax-H3),同时 ComfyUI 镜像 Comfy-Org/MiniMax-H3 上线,ComfyUI 当日原生支持。

按官方说法,H3 是 MiniMax 推出的首款开源多模态生成模型,也是 H 系列(海螺 Hailuo)第三代——Hailuo 01 从 0 到 1 搭系统,Hailuo 02 打磨架构效率与数据质量,H3 则完成了一次”任务统一”式的重构。行业里也把它称作”Hailuo 3.0 / Hailuo 03”。


二、H3 是什么<一个>”全模态”生成系统#

传统视频模型把能力切碎成几十个独立任务<文生图>、图生视频、首尾帧、主体参考、动作参考、音色参考、视频编辑……声音领域还分人声、音效、音乐,彼此各有清晰的边界。H3 的设计纲领是:打破任务和模态的隔离,把所有能力合并进”一段多模态上下文 + 一句自然语言指令”这一个任务里。

2.1 输入输出规格(来自模型卡)#

类别规格
输出时长4–15 秒
分辨率默认短边 768px;2K 由 H3-Regenerate-2K 二次生成
帧率24 FPS
音频32kHz 原生立体声(双声道)
画幅比21<9>、16<9>、4<3>、1<1>、3<4>、9<16>
对话语言稳定支持 11 种<阿拉伯>/中/英/法/德/意/日/韩/葡/俄/西

两种本地检查点(Checkpoint):

检查点任务输入条件
H3-Base-FL2VA文生音视频(t2va)、首/尾帧生音视频(fl2va)文本;0/1/2 张图
H3-Base-Ref2VA全模态参考生音视频(ref2va)文本 + 参考;图像≤9、视频≤3 段、音频≤3 段,合计≤12 个文件

一个典型示例<上传>”参考视频 1 的希区柯克式镜头运动 + 图 2 中的人物 + 音频 3 的歌声”,prompt 写一句”让图 2 里的人物按参考视频的运镜唱歌,歌声参考音频 3”,H3 直接一次出带原生双声道的 2K 成片。这不再是”执行一个融合任务”,而是”理解一段由视频、图片和文字共同构成的上下文”。

2.2 完整系统 = 三大模块#

官方明确,H3 不是单文件,而是三个模块协同的系统:

  1. H3-Context-IR(托管,未开源) —— 多模态指令的”理解 + 编排”系统。它解析指令、做跨模态关联、时序理解和复杂逻辑推理,把”素材和素材、素材和目标之间的关系”序列化成模型能懂的 Context Intermediate Representation。官方强烈建议生成管线接入它,或按其 Prompting Guidance 自建预处理系统。
    • 代价<大部分素材要耗> ~100K Token 的推理,最后压成平均约 4K Token
  2. H3-Base(已开源) —— 真正的生成引擎,产出 768p 音视频(FL2VA / Ref2VA 两个检查点)。
  3. H3-Regenerate-2K(托管,未开源) —— 把 768p 结果连同原始多模态上下文一起塞回 H3,原地”重新生成”一遍 2K 版本。

关键区分:本地部署的是 H3-Base,原生画布就是短边 768px;官方宣传的 2K 直出走的是托管 API 全链路。本地想要完整 2K 需本地 Base + 官方 Context-IR / Regenerate-2K API 拼起来。


三、核心技术拆解#

官方博客只点到四个名字,模型卡把它们说透了:

3.1 Contextual Omni Representation(数据/标注层)#

训练 H3 最重要的一环是强化 Caption(描述)能力,但这里的 Caption 被彻底泛化了:

  • 不只描述”目标视频”,还要描述上下文与目标的关系、上下文内部元素间的关系;
  • 联合描述视频和音频,而多镜头下的音画对应关系又更复杂一层。

这套表征就叫 Contextual Omni Representation。它的实现桥梁是语言——“语言(或者说广义的智力结构)是泛化的桥梁”。所有任务差异都被翻译成”描述上的差异”,模型结构因此能保持干净,用同一套表述能力覆盖训练里从没出现过的组合。这正是 H3 指令理解能力的根源。

3.2 H3-VAE(压缩层)<4> 倍序列长度收益#

H 系列一直啃 tokenizer 这块硬骨头。H3 一代彻底革新了前代技术:

  • H3-VisualVAE<时序因果视频自编码器>,空间压缩 16×、时间压缩 4×、24 个 latent 通道(记作 f16t4d24),再做 1×2×2 patchify,进入 Transformer 时等效空间下采样 32×;训练完编码器后额外训了一个 ViT 解码器来降本提质。
  • H3-AudioVAE<左右声道各用同一套编解码器独立处理再重组>,实现立体声输入输出;把 32kHz 音频压成 40Hz 的 latent token 序列。

结果:高压缩率带来 4 倍序列长度收益,大幅拉低训练与推理成本,这也是”敢默认提供原生 2K”的底气。

3.3 H3-Omni Transformer(架构层)<33b> 密集单流#

  • 33B 参数、密集、单流 Transformer,其中 约 13B 参数在 AdaLN(自适应层归一化)相关分支——调制输出可预计算缓存,因此仅推理部署可以根本不加载这部分,这就是”剪枝版检查点只有 ~21GB”的来源。
  • Attention 和 FFN 层不含任何模态专属结构;模态专属参数只集中在输入输出层和 AdaLN 分支。
  • 位置编码用 MM-RoPE(3D 多模态旋转位置编码),在时间 + 两个空间维 (t,h,w) 上表达位置关系。
  • 训练末段引入原生稀疏注意力(当前开源版本暂只给全注意力推理,稀疏实现后续发布)。
  • 关键取舍<抛弃了曾带来显著优势的> Hailuo-02 架构。MiniMax 的原话是”架构技巧应为模型定义让路,任务泛化是不可逆转的趋势”。国内大模型团队主动砍掉自己最引以为傲的架构,并不常见。
  • 因为多模态上下文让序列长度方差大了 3 倍、理解与生成的算力结构高度异质化,团队用了理解/生成异构训练架构,精细调不同 workload 下的硬件利用率,再做每样本异构计算 × 样本间负载均衡,端到端训练吞吐提升近 30%
  • 文本编码器 H3-Encoder 直接复用 Qwen3-VL-32B 的完整预训练权重,把第 50 层 hidden states 喂给 Omni Transformer——所以 oschina 那篇文章标题才叫”一个视觉语言模型只够当它的编码器”。

3.4 In-context Regeneration(输出层)<不靠超分>,靠”重生成”#

行业做 2K/4K 的常规思路是”先生成低清 → 套专用超分模块放大”,超分本质是在缺失细节,小字、纹理、光影经常糊。H3 的做法是:

把 768p 结果当作参考,连同原始多模态上下文一起再喂回基模”重新生成”一遍 2K。好处有二<①> 最大程度复用 H3 已有的生成能力;② in-context 形式能找回低清画面里已经看不见、但上下文里仍存在的信息(小文字、品牌 Logo 细节等)。这也是 H3 在片头/Logo/字幕等复杂文字场景不翻车的底层原因。这套方案本身也是”任务泛化”的一个体现。


四、实测表现<它到底强在哪>#

4.1 榜单与第三方结论#

  • Artificial Analysis 榜单(2026-07-31 发布日)<视频编辑能力>全球第一(Elo 1130),领先 Gemini Omni Flash、HappyHorse-1.0、Wan 2.7 等;文生视频第二、图生视频第三,六个偏好池全部进入前三。Artificial Analysis 评价:“发布权重将使其成为迄今遥遥领先的领先开源权重模型。”
  • 诚实的一面<文生视频仍落后> Google Gemini Omni Flash,图生视频落后 Seedance 2.0 与 Gemini Omni Flash——它编辑第一,但并非样样第一
  • 多家实测(品玩、36氪、云栈、智东西)的共同结论:与 Seedance 2.0 打的有来有回,生成速度体感更快,复杂文字保持超过 Seedance 2.0。

4.2 五个真正能打的能力#

  1. 跨模态复合参考(全模态上下文)<品玩实测>——上传红辣椒乐队动画参考视频 + 上海美罗城街景图,H3 不仅 get 到原视频人物运动,还识别出美罗城是球状屏幕,让运动遵循球面变形规律;视频图片都没声音,它自动补齐了 BGM、屏幕闪烁音效、人物进入球面屏的音效。
  2. V2V Motion Transfer(视频到视频动作迁移)<把参考视频的人物动作> + 运镜轨迹迁到全新视频,同时保持目标画面风格与主体。广告/电商场景不用重拍即可让同一产品出现在不同动态场景。
  3. 指令式精准编辑 / 导演级指令遵循<换台词>、配音、改嘴型、替换角色、删物体、加特效,都能在保持整体一致性的前提下局部改。品玩让范志毅采访视频”换种说法”,音色嘴型都还原得很好;打光测试里烛光→硬光→彩虹折射→红蓝对打→金色逆光连续变化,受光区域、面部阴影、金属高光都跟着变,红蓝阶段皮肤和真丝还保留材质感。
  4. 复杂文本保持 / 品牌信息呈现<这是> H3 最出圈的专项。Logo 放玻璃杯上要理解折射、放墙上要理解曲率纹理、跟随镜头要不变形;片头英文演职员表清晰可读、不拼错、不乱码,且按时间块(按秒)执行的提示词能被严格遵循(游戏 UI 导览、0→100% 加载条、整环境加载等分镜逐一落位)。
  5. 原生双声道 + 声音可写进提示词<音乐>、音效、环境声、对白与画面同一次生成,可指定”第 3 秒低鼓进、第 10 秒萨克斯即兴”这类时间点。支持中文台词、口型同步,对短剧、口播、产品讲解极实用。

4.3 已知短板(各评测如实披露)#

  • 无官方对比评测表 / 技术报告(发布时),榜单位置验证的是托管链路,不代表本地 Base 检查点。
  • 多镜头编排偶有动作重复(智东西实测<递奶茶动作连续出现两次>);部分场景仍有明显 AI 生成感(如寺庙建筑)。
  • 细腻连续的物理交互仍不稳(云栈实测<粉底铺开>→贴合皮肤的过程被跳切成最终妆效)。
  • 本地 768p 画布在 21<9> 等极端画幅下输出上限约 768×1344。

五、价格<把商用起步价打到三分之一>#

5.1 官方与第三方定价#

档位官方Atlas Cloud(2026-07 核实)会员折算(云栈实测)
2K0.8 元/秒(不到主流旗舰 1/3)0.14 美元/秒约 0.4 元/秒
768P主流 720P 的 1/20.10 美元/秒约 0.23 元/秒

参照系 2.0 在即梦按会员积分折算约 2.97 元/秒;Seedance 2.0 720p 在 Atlas 约 0.24 美元/秒——H3 用更低的单价给出更高的分辨率。批量场景差距放大<100> 条 15 秒片,Seedance 约 4455 元,H3 的 2K 约 600 元、768P 约 345 元。

注意两个坑<①> 托管端 resolution 目前只接受 2K 一个值,README 里写的 768p 档已关闭——而 768p 恰是你本地跑权重时的原生画布,这正好形成对称;② 并发约 1 个任务,并发请求会 429,须串行调用。

5.2 为什么能这么便宜#

不是单纯补贴,是架构效率:

  • H3-VAE 的 4 倍序列压缩直接砍掉训练/推理成本;
  • 异构训练 + 负载均衡端到端 +30% 吞吐;
  • 推理可裁剪掉 AdaLN 的约 13B 参数;
  • 借鉴文本模型已验证的方法(复杂问题拆解、推理、上下文扩展、Muon 优化器、MSA 稀疏注意力)迁移到多模态训练。

六、开源细节<42>.5 GB 起步,无需超算#

6.1 下载与文件#

  • 官方仓库 MiniMaxAI/MiniMax-H3 全拉取约 498 GB(所有精度变体 × 两检查点);ComfyUI 打包镜像 Comfy-Org/MiniMax-H3 约 343 GB。
  • 你只需要 4 个文件<单任务最小工作集> 42.5 GB(剪枝版 fl2va + nvfp4 编码器 + 视频/音频 VAE);全 bf16 全套约 123.6 GB。
  • 关键文件参考/ref2va 剪枝 int8 各 20.97GB、int8 34.04GB、bf16 66.28GB;文本编码器 qwen3vl-32b(4-bit AWQ 15.69GB / int8 27.14GB / bf16 51.51GB);视频 VAE 5.21GB;音频 VAE 0.61GB。
  • 因为 ~13B AdaLN 参数推理时不用加载,ComfyUI 声称 12GB 显存 + 动态卸载(RTX 3060 级)可本地运行(需约 64GB 系统内存换 VRAM,速度会慢)。

6.2 部署与生态#

  • 推理框架:SGLang、vLLM、diffusers、ComfyUI 四路齐发,支持多卡并行(SGLang 官方例 4 卡、ulysses-degree 4);发布检查点是 CFG-distilled 权重。
  • 首日适配 16 家生态伙伴<芯片侧华为昇腾>、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel;社区/平台侧 Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、fal;框架侧 vLLM-Omni、SGLang。
  • Intel 为 H3 提供 Day 0 支持<锐炫> Pro B70 上做 Encoder 8 卡张量并行 + DiT 8 卡 USP(配合 Layer-wise Offloading)+ VAE 部署,并开发 2TP×4USP 混合并行;H3 设计初期就考虑了多款国产芯片兼容性。

6.3 许可证(MiniMax H3 Community License,2026-08-02 生效)——必须读懂的条款#

条款内容影响
适用区域全球范围”除外区域”,即 欧盟、英国、韩国、美国社区许可证不授权这些区域使用,覆盖输出而非仅权重
区域使用禁令不得在适用区域之外使用/复制/修改/分发 H3 或其输出处于排除区域需走单独授权渠道(“尚未,而非永不”)或使用托管 API
署名商业产品 UI 上须显著显示 “MiniMax H3”是 UI 改动,不是脚注
收入门槛年收入 >2000 万美元需事先书面授权免费商用有上限
禁止蒸馏不得用 H3 或其输出改进任何其他 AI 模型排除模型清洗/蒸馏
管辖法香港特别行政区法律,香港专属管辖记入风险台账

MiniMax 自己的 Q&A 解释了原因<视频生成处于比文本更快的监管环境>(欧盟 AI 法案、英美韩规则、美国生成视频版权诉讼);API 因其控制服务基础设施而保持全球可用,开源权重则放弃了这种控制。严格说这是”开源权重”而非 OSI 意义上的开源——真正 Apache 2.0 开放的只有 Qwen3-VL-32B 编码器这一层。


七、行业意义<为什么说这是视频生成的>”DeepSeek 时刻”#

  1. 打破闭源垄断<此前视频生成头部>(Sora、Veo、Seedance、可灵)无一开源,定价权高度集中,衍生出涨价、排队、白名单、拼单转售等乱象。H3 把”旗舰级 + 开源 + 0.8 元/秒”同时摆上台面,把行业从”技术比拼”推向”生态竞争”。
  2. 接住”数据主权”型客户<影视公司不会把未发布剧集素材丢进公有云> API,游戏公司不能把核心 IP 交给第三方模型。开源 + 可私有化部署正好接住这批最贵、最有粘性、最未被服务的 B 端。
  3. 吃掉后期工具链<传统流程是>”文生视频拿素材 → TTS 配音 → 剪映套字幕 → AE 做包装”。H3 把后期装进模型内部<理解创意意图>、生成画面、匹配音效音乐、渲染字幕文字、完成动效包装,一次生成直接交付。参考量级 2025 财年创意云收入约 145 亿美元,国内视频后期外包市场估算 300–500 亿元人民币——若 AI 原生后期持续兑现,可能替代其中 10–30% 传统工序。
  4. 国产芯片适配样板<作为首个把>”多模态理解 + 生成”统一到国产芯片兼容体系的前沿模型,它给国产算力生态提供了可验证、可复用的基线。

对 MiniMax 公司而言,这是其 2026 年 1 月港股上市后、在资本市场波动期里的第一次主动出招,把估值逻辑从”概念溢价”推向”生产力定价”。外媒还报道其正在开发 2.7 万亿参数的语言模型,以及 H 系列下个版本将与 M 系列融合的路线图。


八、局限与官方路线图#

官方自述的三点局限:

  1. 生成能力的地基是多模态上下文理解——这里提升空间巨大,后续将推动 H 系列下个版本与 M 系列能力融合(M3 已在 2026 年 6 月发布开源,基于自研 MSA 稀疏注意力架构,原生多模态、1M 上下文);
  2. 模型规模限制完成度——Scaling 是明确方向,任务泛化会给 Scaling 留出发挥空间;
  3. 部分场景画面精细度仍需提升——持续追求更高分辨率和更精细画质。

社区层面待办 / 更低比特量化(H3 尚无)、稀疏注意力实现发布、排除区域名单是否变化、README 中 768p 托管档是否回归。


九、快速上手路径#

  • 零代码试玩<海螺> AI(hailuoai.com,国际版 hailuoai.video)、MiniMax Hub(hub.minimaxi.com / 国际 hub.minimax.io),支持 768p / 2K、4–15 秒,可选全能参考 / 首尾帧 / 角色参考三种模式。
  • API 调用<模型名> MiniMax-H3,接口 video-generation-v2-create(直出 2K)、video-generation-v2-h3-context-irvideo-generation-v2-regeneration;全球 api.minimax.io / 国内 api.minimaxi.com
  • 本地部署<从> HF 下载剪枝 int8 单任务检查点(42.5GB 最小工作集),SGLang / vLLM / diffusers / ComfyUI 均可;本地出 768p,想要 2K 就接官方 Context-IR + Regenerate-2K API。
  • 避坑<本地> 768p 才是原生画布;托管端 ratio 对 t2va 必填、不能 adaptive;任务并发约 1,串行调用;排除区域(美/欧/英/韩)注意许可证边界。

参考来源#

  1. MiniMax 官方博客(中文):《MiniMax H3<打破任务和模态的边界>https://www.minimaxi.com/blog/minimax-h3
  2. MiniMax 官方博客(英文):https://www.minimax.io/blog/minimax-h3
  3. HuggingFace 模型卡/MiniMax-H3 https://huggingface.co/MiniMaxAI/MiniMax-H3
  4. MiniMax 开放平台文档:https://platform.minimaxi.com/docs/guides/video-generation
  5. 智东西:《又一国产模型重磅开源!有声视频编辑全球第一,16家芯片及平台首日适配》
  6. 品玩:《MiniMax H3<很能打>、更通用、还开源,多模态格局得变一变了》
  7. 36氪/字母榜:《天下苦闭源模型久矣,MiniMax要做多模态领域的Deepseek》
  8. Atlas Cloud 评测:《MiniMax H3 评测<原生2k> AI视频,成本更低》https://www.atlascloud.ai/zh/blog/guides/minimax-h3-review
  9. Atlas Cloud:《MiniMax H3 开源权重<42>.5 GB,以及 4 个排除国家》https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights
  10. Kingy Review: MiniMax H3 Benchmarks, Specs and Hardware https://kingy.ai/news/minimax-h3-benchmarks-specs-hardware-review/
  11. Reuters(经 Yahoo Finance)‘s MiniMax releases H3 video model
  12. 英特尔新闻室:《英特尔为MiniMax H3提供Day 0支持》
  13. 云栈社区:《MiniMax H3视频模型实测》
  14. oschina:《MiniMax H3 开源<33b> 全模态模型》
  15. 网易/IT之家、新浪/IT之家、搜狐、腾讯新闻等发布报道
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

minimax-h3-deep-dive
https://mizuki-eaf.pages.dev/posts/others/minimax-h3-deep-dive/
作者
无名之子
发布于
2026-07-16
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录