mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4192 字
12 分钟
MiMo-V2-Pro 与 V2.5:万亿效率怪兽
2026-07-12

MiMo-V2-Pro 与 V2.5 系列解读:万亿参数的”效率怪兽”,把开源榜头把交椅扛回了家#

论文:无独立论文(依据官方博客与媒体报道:mimo.xiaomi.com / mimo.mi.com 发布公告、Artificial Analysis 榜单、CrossModel 模型卡等) 作者:小米 MiMo 团队(负责人罗福莉) 从 2026 年 3 月的 V2-Pro”三连发”到 4 月底 V2.5 全量开源,小米在两个月里把 MiMo 从”开源第二梯队”直接顶到了”全球开源第一”。V2-Pro 用 1T 参数拿回 Artificial Analysis 全球第八、品牌第五;V2.5-Pro 更狠,1.02 万亿参数 + 42B 激活 + 1M 上下文,GDPVal-AA 1581 Elo、ClawEval 63.8 双双开源登顶,反超 DeepSeek-V4-Pro。这波操作的核心逻辑就俩字:堆效率——参数堆到万亿,激活还是只花 42B,外加一手”30 天白送 100 万亿 token”的 Orbit 生态补贴,把开源价格战打成了小米的形状。


一、V2-Pro:万亿级基座,Agent 时代的”重型卡车”#

2026 年 3 月 19 日,小米春季发布会一口气端出三款模型:旗舰基座 MiMo-V2-Pro、全模态 MiMo-V2-Omni、语音合成 MiMo-V2-TTS(3 月 18–19 日期间发布,官方公告口径为 3 月 19 日)。雷军同日官宣:2026 年小米 AI 投入超 160 亿元、未来三年超 600 亿元。

1. 架构:总参破万亿、激活 42B,混合注意力比例拉到 7<1>#

V2-Pro 总参数规模突破 1T(媒体报道口径,官方未披露精确值,官方对比表中标注为 1.02T),激活参数 42B——延续了 V2-Flash”1/20 激活率”的肌肉记忆。上下文窗口一举扩到 100 万 token,可以直接吞下超长任务链和复杂工作流。注意力架构沿用并升级了混合注意力,混合比例从 V2-Flash 的 5<1> 进一步提到 7<1>(据第三方资料,待核实),思路没变:用更多滑动窗口层省钱,少数全注意力层兜住全局。

评测上最出圈的是排名:Artificial Analysis 综合智能榜全球第八、按品牌排名第五、中国模型第二,排在它前面的只剩 Gemini 3.1 Pro Preview、GPT-5.4、GPT-5.3 Codex、Claude Opus 4.6、Claude Sonnet 4.6、GLM-5 等一线闭源。针对 Agent 工作流,官方称平均任务完成率达 81%。有意思的还有”隐身测试”:此前 3 月 11 日上线 OpenRouter 的匿名模型 “Hunter Alpha”,7 天累计调用量突破 1 万亿 token、连续登顶,事后被罗福莉官宣就是 V2-Pro 的内测版——这波”偷偷考了个第一”的营销,把关注度拉满。

定价方面:256K 上下文内输入 $1/M、输出 $3/M;1M 上下文输入 $2/M、输出 $6/M,并联合 OpenClaw、OpenCode、KiloCode、Blackbox、Cline 五大 Agent 框架提供一周限时免费。

2. V2-Omni 与 V2-TTS:把”看、听、说”补全#

  • V2-Omni:全模态 Agent 基座,原生融合文本、视觉与音频感知,打通”理解→执行”链路。它的匿名测试版”Healer Alpha”曾在 OpenClaw 测评榜拿到均分第一。支持 256K 上下文,API 输入 $0.4/M、输出 $2/M。
  • V2-TTS:语音合成大模型,基于自研 Audio Tokenizer + 多码本语音-文本联合建模,上亿小时语音数据训练 + 多维度强化学习,支持从整体风格到局部情绪的精细控制,还能方言、角色扮演乃至歌声合成——目标是把 V2-Pro 的”大脑”配上一副有温度的好嗓子。

同场还官宣了小米首款 AI 原生手机”龙虾”Xiaomi miclaw 启动封测:搭载 MiMo 大模型,与操作系统及人车家全生态深度融合,用户只需表达意图、AI 自主寻优并安全执行。卢伟冰定调:miclaw 不会取代小爱,将与超级小爱合体赋能。

二、V2.5 系列:全球开源登顶的那一天#

2026 年 4 月 23 日 V2.5 系列公测,4 月 28 日正式全量开源,MIT 协议(允许商用、二次训练、微调,无需额外授权),Base 权重一并放出。两款模型都支持 1M 上下文。

1. V2.5-Pro:1.02T/42B、384 专家,27T tokens 喂出来的全能选手#

  • 架构:1.02T 总参数 / 42B 激活 MoE,384 个路由专家、每 token 取 top-8;混合注意力为 10 层全局 + 60 层滑动窗口(SWA = 6<1>,窗口 128 token),配可学习 attention sink 偏置与 3 层 MTP;27T tokens、FP8 混合精度预训练,原生 32K 外扩至 1M 上下文,最大输出 128K。后训练沿用 V2-Flash 的三阶段范式(SFT → 领域专项训练 → MOPD)。
  • 评测明细(官方博客对比表,均优于开源对手):
指标V2.5-ProV2-ProDeepSeek V4 ProKimi K2.6GLM 5.1
GDPVal-AA(Elo)15811426155414801535
τ³-bench72.964.571.871.070.6
ClawEval(pass³)63.857.859.862.362.7
Humanity’s Last Exam48.034.040.048.252.3
SWE-bench Verified78.978.080.680.2
SWE-bench Pro57.255.055.458.658.4
Terminal-Bench 2.068.457.167.966.769.0

(来源:mimo.xiaomi.com/mimo-v2-5-pro 官方对比表;DeepSeek V4 Pro 为 max effort 档)

  • 解读:GDPVal-AA 1581 Elo、ClawEval 63.8、τ³-bench 72.9 三项全球开源第一(τ³ 与 GPT-5.4 持平);SWE-bench Verified 78.9 虽略低于 DeepSeek-V4-Pro 的 80.6,但 SWE-bench Pro 与 Terminal-Bench 2.0 反超;长上下文杀手锏——GraphWalks 上拉到 1M 输入仍保持 BFS 0.37 / Parents 0.62 F1,而 V2-Pro 到 1M 直接崩到 0.00。
  • Token 效率:官方称同等分数下比 Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.4 省 40%–60% token;ClawEval 实测每次任务约 7 万 token,Claude Opus 4.6 约 13 万。省字就是省钱,这是 Agent 长任务成本战的胜负手。

2. V2.5:310B/15B 激活,原生全模态 + 48T tokens#

MiMo-V2.5(310B/15B 激活)是 V2.5 系列的全模态担当,原生支持文本、图像、视频、音频理解,主打 Agent 能力;官方称预训练用了 48T tokens(媒体报道口径,官方模型卡未系统披露,待核实)。性能可比肩 Claude Sonnet 4.6(小米自述),也是后来 MiMo Code 内置限时免费的默认模型。它拿下的市场战绩同样生猛:据 OpenRouter 6 月 10 日数据,V2.5 单周调用量 2.19 万亿 token、全球第二,仅次于 DeepSeek。

3. Orbit 计划:30 天白送 100 万亿 token 的生态豪赌#

开源当日同步启动 MiMo Orbit 百万亿 Token 创造者激励计划:4 月 28 日—5 月 28 日,向全球申请者免费发放总计 100 万亿(100T)token,最高档 Max 含 16 亿 Credits、价值 659 元;另设面向 Agent 框架团队的”Agent 生态共建计划”(合作方含 OpenCode、Hermes Agent、KiloCode)。

结果:5 月 26 日 16<08> 提前 2 天全部发完——54.87 万人申请、24.19 万份获批、通过率 43.74%,等值约 6583 万元人民币(据新浪财经/智东西报道)。这套”开源 + 撒 token + 抢开发者”的组合拳,几乎是 DeepSeek 生态打法的放大版,效果肉眼可见。

4. Day-0 适配:7 家芯片厂商 + SGLang/vLLM#

开源首日,V2.5-Pro 即完成 7 家芯片厂商的接入适配:阿里平头哥(真武 810E)、亚马逊云科技(自研 Trainium2 + Neuron SDK + vLLM)、AMD(ROCm)、百度昆仑芯、燧原科技、沐曦、天数智芯;同时完成 SGLang、vLLM 两大主流推理框架的 Day-0 适配,官方同步放出部署指南。这种”开源即开箱”的生态工程能力,是开源榜第一能真正落地的关键一环。

5. API 降价:最高 99%,跟 DeepSeek 打价格战#

5 月 27 日零点起,V2.5 系列 API 永久降价、最高降幅 99%,且不再按上下文长度分段计价。新价格:V2.5-Pro 缓存命中输入从 2.80 元降至 0.025 元/百万 token,未命中 3 元、输出 6 元;V2.5 更激进——缓存命中 0.02 元、未命中 1 元、输出 2 元/百万 token。Token Plan 同步升级,同价下用量提升至原 5–8 倍,且所有在期用户额度全量重置。

降价底气来自推理系统:基于 SGLang HiCache 完整支持 SWA(滑动窗口注意力),KV Cache 在 GPU/CPU/SSD 多级存储间的数据搬运量降至优化前的近 1/7,可缓存 token 数提升近 5 倍。再配合专家并行、输入分桶等优化,单位 token 成本被压到跟 DeepSeek-V4-Pro 几乎一致——罗福莉前脚刚”开怼”价格战,后脚自己就成了价格战主力,真香。

后续还有两个彩蛋:6 月 8 日上线 V2.5-Pro UltraSpeed 模式,万亿参数模型在通用 GPU 上推理速度首次突破 1000 tokens/s(10 倍速度只要 3 倍价格,与 TileRT 联合宣布);同月 V2.5-Pro 在 Artificial Analysis 综合智能指数 / Agent 指数上拿到全球开源并列第一

三、从模型到生态:miclaw、MiMo Code、Miloco 2.0#

  • miclaw(2026.03.19 官宣封测):小米首款 AI 原生手机,搭载 MiMo 大模型,深度融入操作系统与人车家全生态,主打”AI 自主寻优并安全执行”。它与超级小爱的关系是”合体赋能”而非替代(卢伟冰口径)。
  • MiMo Code(2026.06.11 发布并开源 V0.1.0):终端 AI 编程助手,基于 OpenCode 二次开发、MIT 协议。三大卖点:① 独创持久记忆系统(项目记忆 + 会话检查点 + 任务进度,独立 subagent 自动存档,窗口满时重建简报,“不赌模型自觉,用工程把它兜住”);② 为 MiMo 系列定制 Harness 系统 + 独创 Compose 模式(Tab 一键切换,自动完成设计→规划→编码→测试→审查全流程);③ 内置限时免费的 MiMo-V2.5,支持 DeepSeek/Kimi/GLM,还带语音输入(基于 MiMo-V2.5-ASR)。控制变量实测:同样用 MiMo 模型,MiMo Code 在 SWE-bench Pro 拿 62%(Claude Code 57%)、Terminal Bench 2 拿 73%(Claude Code 68%)——证明”模型 + Agent 协同优化”确实有 1+1>2。
  • Miloco 2.0(2026.06.18 发布并开源):全屋智能 AI 开源方案,以 MiMo 大模型为智能核心、跑在 OpenClaw 上,米家摄像头做全模态感知入口。四大升级:多模态感知、主动智能、持续任务、家庭记忆(能认人、懂喜好、记得病史);隐私上原始数据”用完即弃”、本地保存、30 天自动清理、与 Agent 完全隔离。部署门槛已降到”一台电脑 + 米家账号 + 一个摄像头 + 一个 API Key”,且支持基于 MiMo-VL-Miloco-7B 的端侧版本。这是”人车家全生态”里”家”这枚棋子,也是 MiMo 从云端基座走向物理世界的入口。

收尾:我的一点看法#

V2.5-Pro 登顶的意义,不只是榜单第一。它证明了一个此前没人敢想的事:一家消费电子厂商,能在一个季度内把万亿参数模型的开源节奏、评测、生态适配、价格战全部跑通。DeepSeek 靠开源重构了国产模型的行业地位,小米则试图把”开源”本身变成一套商业打法——先放权重抢声量,再撒 100 万亿 token 抢开发者,最后 API 降价 99% 抢流量入口。这套组合拳的节奏感和执行力,是 V2.5 系列最可怕的地方。

技术上最值得学的还是”效率执念”。1.02T 参数只激活 42B、混合注意力 6<1>、MTP 提速、HiCache 多级缓存搬运降到 1/7——所有动作都指向同一个目标:把单位 token 的成本打下来。在 Agent 时代,模型好不好,一半看能力,一半看”任务完成率 / 每任务 token 数”这个比值;V2.5-Pro 在 ClawEval 上每任务 7 万 token 对 Claude 的 13 万,就是这个比值的胜利。

当然要泼盆冷水。其一,SWE-bench Verified 78.9 仍低于 DeepSeek-V4-Pro 的 80.6,ClawEval 也仍落后 Claude Opus 4.6(70.4)——开源第一和绝对第一之间还有一道”闭源护城河”。其二,V2.5 的 48T tokens 训练量等不少数字仍停留在媒体报道口径,官方模型卡的透明度和 DeepSeek 的技术报告还有差距。其三,价格战是把双刃剑,2 元/百万输出的价格能否长期覆盖万亿参数推理成本,取决于调用量能否真的大到摊薄边际成本——这也是 V2.5-Pro UltraSpeed 和 Orbit 计划存在的意义。

把 V2-Pro 和 V2.5 放进 MiMo 发展史看,它就是那条从”跃升”到”登顶”的完整弧线:V2-Flash 定调了混合注意力与 MOPD,V2-Pro 验证了万亿参数 + 1M 上下文,V2.5 把它们打包成全模态、全生态、全价格战的开源旗舰。小米 MiMo 至此真正完成了从”追赶 DeepSeek”到”和 DeepSeek 同场竞技”的转身——而下一站,是雷军那句”未来三年 600 亿”要兑现的商业化深水区。

附:核心数据速查#

V2-Pro 基本盘

项目数值
总参数 / 激活破 1T(约 1.02T)/ 42B
上下文1M tokens
注意力混合注意力(比例提升至 7<1>,据第三方资料,待核实)
排名Artificial Analysis 全球第八、品牌第五、中国第二
Agent 任务完成率平均 81%(官方口径)
API 定价256K 内 输入$1/输出$3;1M 输入$2/输出$6(每百万 tokens)
隐身测试”Hunter Alpha” 上 OpenRouter,7 天调用超 1 万亿 token

V2-Omni / V2-TTS 速览

  • V2-Omni:全模态(文/视觉/音频),256K 上下文,API 输入$0.4/输出$2(每百万 tokens)
  • V2-TTS:自研 Audio Tokenizer + 多码本联合建模,上亿小时语音训练 + 多维 RL,支持方言/角色扮演/歌声

V2.5 系列基本盘

项目V2.5-ProV2.5
总参数 / 激活1.02T / 42B310B / 15B
MoE384 专家,top-8待核实
注意力10 全局 + 60 SWA(6<1>,窗口 128)待核实
MTP3 层
预训练27T tokens(FP8)48T tokens(媒体报道,待核实)
上下文1M1M
协议MITMIT
模态文本原生全模态(文/图/视频/音频)

关键成绩

  • V2.5-Pro:GDPVal-AA 1581 Elo、ClawEval 63.8、τ³-bench 72.9,全球开源第一;HLE 48.0;SWE-Verified 78.9、SWE-Pro 57.2、Terminal-Bench 2.0 68.4
  • 长上下文:GraphWalks 1M 下 BFS 0.37 / Parents 0.62 F1(V2-Pro 同场景 0.00)
  • Token 效率:比 Claude Opus 4.6 / Gemini 3.1 Pro / GPT-5.4 省 40%–60%
  • Orbit:100T tokens 提前 2 天发完,54.87 万人申请、24.19 万份获批、约 6583 万元等值
  • Day-0 适配:7 家芯片厂商(平头哥/AWS/AMD/昆仑芯/燧原/沐曦/天数智芯)+ SGLang/vLLM
  • API 降价:最高 99%;V2.5 输出 2 元/百万 tokens;V2.5-Pro 缓存命中输入 0.025 元
  • UltraSpeed:万亿参数通用 GPU 超 1000 tokens/s(6.8 上线)

生态三件套

  • miclaw:AI 原生手机,3.19 封测,搭载 MiMo、人车家全生态融合
  • MiMo Code:6.11 开源,基于 OpenCode,持久记忆 + Harness + Compose,SWE-Pro 62% vs Claude Code 57%
  • Miloco 2.0:6.18 开源,全屋智能 AI 方案,多模态感知/主动智能/持续任务/家庭记忆,数据本地化 30 天自清
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

MiMo-V2-Pro 与 V2.5:万亿效率怪兽
https://mizuki-eaf.pages.dev/posts/mimo/mimo-v2-pro-与-v25万亿效率怪兽/
作者
无名之子
发布于
2026-07-12
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录