mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
5055 字
14 分钟
MiniMax-H3:全模态三折价
2026-08-04

MiniMax-H3 模型解读:全球首个开源全模态视频模型,15 秒 2K 立体声卖三折价#

系列:video-01(2024.8.31)→ Hailuo-02(2025.6.18)→ H3(2026.7.31 发布,2026.8.3 开源) 公司:MiniMax(稀宇科技),全模态路线,文本、语音、音乐、视频四条线,2026 年 1 月港股上市(00100.HK) 这条线值得合起来读。video-01 是”先上车”,抢在 Sora 只画饼不开放的窗口期立住口碑;Hailuo-02 是”换引擎”,用 NCR 架构把参数 3 倍、数据 4 倍塞进 2.5 倍效率里;H3 干了一件更狠的事,把任务、能力、模态之间的墙全部拆掉,从”视频生成”升级成”全模态内容生成”,主打商业级影视、广告、电商场景,然后宣布开源。截至本文写作,H3 没有 arXiv 论文,官方口径是后续会放出更详细的 Tech Report,技术细节以官方博客和多方报道为准。


一、前传:先上车,再换引擎,第三代要拆墙#

一、video-01:窗口期抢位#

2024 年 8 月 31 日,首届 MiniMaxLink 伙伴日,video-01 发布,原生高分辨率、高帧率文生视频,一次生成 5 秒。没有技术报告,连发布会都是跟音乐模型拼场开的,但它在 VBench 第三方评测里拿了综合第一(据报道),把海螺AI的网页访问量在 5 周里拉高了 8 倍多。这代的意义是”先上车”,证明普通用户愿意用、用得起 AI 视频。

二、Hailuo-02:算力重分配#

2025 年 6 月 18 日技术发布周第二天,Hailuo-02 带着 NCR(Noise-aware Compute Redistribution,噪声感知算力重分配) 上线,把算力从”省力”的去噪步骤挪到”费力”的步骤,同参数量级下训练和推理效率提升 2.5 倍,省出的预算填进 3 倍参数、4 倍数据,做到原生 1080P。发布当天在 Artificial Analysis Video Arena 图生视频栏目锁定全球第二,压过 Veo 3 和可灵(据报道)。这代的答案是”先算算力账,再谈规模化”。

三、H3 的伏笔:能力清单越拉越长,模式却越隔越远#

但 MiniMax 自己算了一笔更大的账。官方复盘过去两年视频生成行业,一句话概括:把某一类效果做好,封装成一个功能。文生视频、图生视频、参考、编辑,各是各的模块,各是各的微调管道,能力清单越拉越长,模型之间却越来越隔离。MiniMax 称之为”任务、能力、模态的隔离”,并下了两个判断:任务泛化是不可逆转的趋势语言(或者说广义的智力结构)是泛化的桥梁。H3 的第一纲领就是”任务的统一和泛化”。


二、H3 的问题:视频模型为什么一直干不了商业的活#

发布:2026 年 7 月 31 日,官方口径”通用全模态生成模型”,最高 15 秒、2K(2560×1440)、24 FPS、原生双声道音视频 核心:Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration 四件套 同日还发生了两件事:字节 Seedance 2.5 全量发布,DeepSeek V4 Flash 发布。一天三个新模型,赛道之卷可见一斑。

一、问题:要商用,先过三关#

视频生成想从”玩具”变成”生产力”,有三道坎。第一道是文字关,AI 视频里的文字经常是乱码,广告、品牌物料根本没法用,而 GPT Image 2、NanoBanana 已经解决了图片里的汉字问题,视频文字难度却是”指数级上升”(据报道)。第二道是声音关,此前多数模型只出画面不出声,或者声音是后期贴的,唇形、音效、BGM 对不上。第三道是控制关,商业拍摄要的是”改这不动那”,换台词、换光线、改节奏、精确到镜头,前代模型要么做不到,要么每个功能单独训一个模型,用户要在一堆开关之间来回切换。

对 MiniMax 来说还有第四道坎,成本关。2K 长视频的 token 量爆炸式增长,硬堆算力,训练和推理成本都会失控,就像 Hailuo-02 遇到的那样,只是这次问题严重了不止一个量级。

二、方法:不做加法做减法,一次预训练,全模态通吃#

H3 的破法不是再列一张更长的能力清单,而是把”任务”这个概念本身干掉。官方博客的表述很直白,预训练阶段就混合图文音视频,任务覆盖文生图、文生视频、带联合音频生成(音频输出均为原生双声道)、原生多镜头建模、文生音频(人声/音效/音乐统一联合建模,不再分开),以及广义参考与编辑(图→图、图→视频、音频→音频、音视频→音视频),并且”不限制在少数预定义任务中”。参考和编辑关系全用自然语言表述,模型结构保持干净,用官方的话说,语言是可泛化的连接层,任务差异变成描述差异,模式隔离自然消解。发布会上演示了一个典型 prompt:参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3——三类素材加一句人话,端到端出片。


三、H3 的方法:四件套拆开看#

一、Contextual Omni Representation:给模型配一个”会读空气”的解说员#

Contextual Omni Representation(上下文全模态表征) 是数据层的新设计。传统 caption(标注)只负责”描述目标视频”,H3 的标注要宽得多,除了描述目标视频,还要描述上下文与目标视频的关系,甚至理清上下文内部各元素之间的关联;视频和音频要联合描述,多镜头下的音画对应关系也要写清楚。MiniMax 为此定制了专门的 caption 模型,搭建了一条全模态理解管线,把大部分素材约 100K Token 的推理压缩成平均约 4K Token 的表征。语言在这里当”胶水”,把参考图、参考视频、参考声音和用户意图粘成一个整体,这是 H3 能”看懂”复杂 prompt 的根源。

二、H3-VAE:4 倍压缩的”视频压缩包”#

H3-VAE 是 tokenizer 层的重构,目标是同时优化三件事:压缩率、重建质量、以及 latent 空间对生成主干的友好度。官方给出的收益是4 倍序列长度压缩,直接砍掉四分之三的训练和推理成本,这是 H3 敢默认输出 2K 的关键底气。可以类比成视频压缩包,同样的画质,包越小,传输越快越便宜;反过来,同样的预算,可以装更长的视频。

三、H3-Omni Transformer:异构训练,吞吐 +30%#

H3-Omni Transformer 是主干架构。全模态上下文让序列长度方差比前代大了 3 倍,理解任务和生成任务的 workload 高度异质化,一个”一刀切”的并行策略必然浪费算力。H3 的做法是理解/生成异构训练架构,精细调优不同 workload 的硬件利用率,联合考虑”每样本异构计算 × 样本间负载均衡”,端到端训练吞吐提升近 30%。更值得注意的是它做了什么减法,H3 直接抛弃了 Hailuo-02 的架构。官方原话,“架构技巧应为模型定义让路”,在任务泛化这个核心定义面前,前代引以为傲的设计变成了”不合时宜的复杂性”。一个模型团队主动扔掉自己最得意的架构,这在国内并不常见(据报道)。

四、In-context Regeneration:不用超分模块,让模型自己重画#

In-context Regeneration(上下文内再生) 是输出层的设计。2K 输出不用专门的超分模块,而是让基模对自己的低分辨率结果做一次 in-context 重新生成。好处有两条:一是最大程度复用基模自己的生成能力,不用为超分单独养一个模型;二是重新生成时能再次利用原始多模态上下文,把传统超分”猜”不出来的小文字、精细纹理恢复出来。官方强调,这本身就是任务泛化的体现——“重画一遍”和”从零画一张”用的是同一套能力,不是两套系统。

五、训练:借文本模型的作业#

据多方报道,H3 把文本模型上的经验搬到了多模态训练里,包括复杂问题拆解、ReasoningScaling ContextMuon 优化器,并在异构训练、负载均衡、GPU 利用效率上做系统优化。这条”文本模型反哺视频模型”的路线,是 MiniMax 全模态布局里比较隐蔽的一手。


四、H3 的成绩:榜单、价格、股价#

一、榜单:编辑能力全球第一#

据第三方评测平台 Artificial Analysis 数据,H3 在视频编辑能力项排名全球第一(据报道);在文生视频有声榜单中排名第二,Elo 得分 1242,仅低于谷歌 Gemini Omni Flash 的 1245(据智东西)。社区实测里,给范志毅采访视频换台词,能保留音色、适配嘴形,还能正确替换画面原有文字而不是叠新横幅;长提示词要求烛光→硬光→彩虹折射→红蓝对打→金色逆光依次变化,光照变化是物理性的,墙上受光区、面部阴影、金属球高光全都跟着光源走。这类”精准编辑 + 指令遵循”正是商业场景最缺的能力。官方承认的局限也写在博客里,多模态上下文理解仍有巨大提升空间、模型规模限制完成度、部分场景画面精细度还要打磨。

二、价格:0.8 元/秒,砍到三分之一#

定价是 H3 的另一张王牌。2K 分辨率 0.8 元/秒,不到主流同类旗舰模型的三分之一;768P 约为主流模型 720P 的一半,API 最低价据报道低至 0.23 元/秒。按这个口径算,生成一条 15 秒 2K 视频约 10 元(据报道;0.8 元/秒 × 15 秒约 12 元,各家测算口径略有出入),有报道称”约 10 元制作一支广告视频,约 20 元完成一集短剧”。对照参考线,2025 年 3 月时海螺一条 5 秒视频成本已经不到 0.5 元,这次 H3 是把”商业级成片”直接拉到了”随手生成不心疼”的价格带。

三、市场:股价涨超 13%,悲喜同框#

发布当日,MiniMax 港股(MINIMAX-W,00100.HK)应声上涨,截至发稿涨 13.64%,报 231.6 港元,成交额 6.91 亿港元(据智通财经),市场还预期其 8 月初纳入港股通。但硬币的另一面是,据报道公司市值已从高点蒸发 3000 多亿港元,只剩 800 亿港元左右;6 月发布的文本模型 M3(4280 亿参数)市场表现不及预期,CEO 闫俊杰在复盘会上向全员道歉,并宣布停薪至 AGI,未来四年拿出个人名下 4% 股份激励员工、1% 股份设立专项基金支持开源社区。7 月 10 日刚完成的 160 亿港元融资,八成投向 AI 基础设施和模型研发。H3 这场发布会,是背水一战里的关键一局。


五、开源:8 月 3 日 0 点,把桌子掀了#

H3 是 MiniMax 首款开源的多模态生成模型(此前开源的是三代 M 系列文本模型)。魔搭社区(ModelScope)页面显示,模型于北京时间 8 月 3 日 0 点正式开源,据称是全球首个开源的全模态视频生成模型(据报道)。官方给出的开源动机有三条,推动开源社区、加速国产芯片适配(设计初期就考虑多款国产芯片的兼容性)、方便企业用户私有部署和定制。

这个动作被多家媒体类比成”DeepSeek R1 时刻”(据报道):o1 开创新范式后闭源,R1 开源让全行业跟进;多模态这边,Seedance 2.0 突破了能力放缓但闭源,整个行业要快速跟上,需要一个同水平的开源模型。时间线也很有戏剧性,7 月 27 日 Kimi K3 开源(据报道 3 万亿参数级别),7 月 31 日 H3 发布加 Seedance 2.5 全量发布,8 月 3 日 H3 权重落地。有媒体把 H3 称为视频赛道的”Coding 时刻”,意思是视频生成终于从”提供一段素材”进化为”可商用的生产工具”,输入文本直接得到能发布的成品,不再需要拖进 PR 加字幕、调色、转场。H3 的经验和踩过的坑随权重一起开放,成了所有人都可以验证、可以复用、也可以推翻的东西。


收尾:我的一点看法#

先说这代技术路线。H3 最有价值的设计是”用语言统一任务”。Contextual Omni Representation 把 caption 从”描述目标”升级成”描述关系”,In-context Regeneration 把超分从”外挂模块”变成”基模自愈”,H3-Omni Transformer 甚至主动抛弃前代架构——三件事指向同一个哲学:能泛化的东西才值得保留,不能泛化的东西都是负债。这不是小修小补,是对”Hailuo-02 模式”的自我否定,一个团队愿意推翻自己上一代的核心卖点,在国内视频模型圈里确实少见。遗憾也很明显,截至写作没有技术报告,四件套的细节主要靠官方博客和二手报道,外界无法复现 NCR 之后这套新架构的完整账本,只能等后续 Tech Report。

再说竞争。H3 面对的可灵、Seedance、Veo 3、Gemini Omni Flash 各有各的杀手锏,Seedance 2.5 甚至选择同日发布正面刚。H3 的牌是”全能 + 三折价 + 开源”三张一起打,单张都不算最强,合起来确实打到了空档:编辑能力全球第一是它的差异化标签,0.8 元/秒把商用门槛砍掉一大截,开源则把”闭源垄断生态”的桌子直接掀了。视频模型的开源本来就比大语言模型稀缺得多,H3 之后,这条赛道的游戏规则大概率要变。

最后是拐点判断。我认为 H3 标志着视频生成从”玩具”到”生产力”的拐点真正落地:文字正确(广告能用)、双声道(成片能听)、可控编辑(拍摄能改)、开源(部署能私有),四个条件第一次同时凑齐,而且价格压到主流的三分之一。但也要泼盆冷水,官方自己承认规模限制和精细度短板,榜单位次在这个赛道是按月翻烧饼的,H3 的领先能保持多久不好说;公司层面,市值蒸发、M3 不及预期、好莱坞版权诉讼的阴影都还在。H3 开了一个好头,但”生产力”三个字,要靠整个生态接得住。


附:核心数据速查#

三代模型一览

项目video-01Hailuo-02H3
发布2024.8.31,MiniMaxLink 伙伴日2025.6.18,技术发布周 Day 22026.7.31(2026.8.3 开源)
核心卖点原生高分辨率高帧率文生视频NCR 架构 + 原生 1080P + 极限物理全模态统一 + 原生双声道 + 2K 直出 + 开源
输出5 秒、768p 级768p-6s / 768p-10s / 1080p-6s最高 15s、2K(2560×1440)、24 FPS
效率手段-NCR,同参数量级效率 2.5 倍H3-VAE 4 倍压缩 + 异构训练吞吐 +30%
榜单VBench 综合第一(据报道)Arena 图生视频全球第二视频编辑能力全球第一(据报道)

H3 关键数字

指标数据备注
定价(2K)0.8 元/秒,不到主流 1/3据报道
定价(768P)约为主流 720P 的 1/2,API 最低 0.23 元/秒据报道
单条成本15 秒 2K 约 10 元据报道(口径有出入)
全模态压缩素材约 100K Token → 平均约 4K Token官方博客
H3-VAE4 倍序列长度压缩官方博客
序列长度方差比前代大 3 倍官方博客
训练吞吐端到端提升近 30%官方博客
有声文生视频Elo 1242,全球第二(Gemini Omni Flash 1245)据智东西
股价发布日 +13.64%,报 231.6 港元据智通财经
开源2026.8.3 0 点(北京时间),魔搭社区据报道

关键概念清单

  • Contextual Omni Representation = 上下文全模态表征(增强 caption,描述”上下文与目标的关系”,约 100K→4K Token)
  • H3-VAE = 新一代视频 tokenizer(4 倍序列长度压缩,支撑原生 2K)
  • H3-Omni Transformer = 全模态主干架构(理解/生成异构训练,吞吐 +30%,抛弃 Hailuo-02 架构)
  • In-context Regeneration = 上下文内再生(基模对自己的低分辨率结果重新生成,替代专用超分模块)
  • caption = 数据标注(H3 中从”描述目标”扩展为”描述关系”)
  • V2V Motion Transfer = 视频到视频动作迁移
  • native stereo / 原生双声道 = 输出直接含环境音、对话、BGM
  • task generalization = 任务泛化(用语言统一任务差异,不做模式隔离)
  • Muon 优化器 / Scaling Context / Reasoning = 从文本模型借鉴的训练技术(据报道)
  • NCR = Hailuo-02 的噪声感知算力重分配(H3 已弃用其架构)
  • Artificial Analysis = 第三方 AI 模型评测平台
  • 魔搭社区(ModelScope)= H3 开源渠道(2026.8.3 0 点)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

MiniMax-H3:全模态三折价
https://mizuki-eaf.pages.dev/posts/minimax/minimax-h3全模态三折价/
作者
无名之子
发布于
2026-08-04
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录