mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
3079 字
9 分钟
MiMo-V2-Flash:成本打到 2.5%
2026-07-28

MiMo-V2-Flash 模型解读:309B 的壳、15B 的激活,用”混合注意力”把推理成本打到闭源的 2.5%#

论文:MiMo-V2-Flash: Efficient Reasoning, Coding, and Agentic Foundation Model 作者:小米 MiMo 团队(LLM-Core Xiaomi) 这是 2025 年 12 月 16 日开源的技术报告,也是小米在罗福莉加盟后交出的第一张 MoE 旗舰答卷。核心卖点就一句话:总参数 309B、每次只激活 15B,用约 1/20 的参数干活,SWE-bench Verified 73.4% 直接拿下开源第一,代码能力比肩 Claude Sonnet 4.5,推理成本却只有它的 2.5%、生成速度翻倍。如果说 DeepSeek 走的是”用稀疏注意力榨干长上下文”,那 V2-Flash 就是换了一条路——用 128-token 的滑动窗口把 KV Cache 按 5<1> 的比例”挤出”去,土办法,但真香。


一、架构:256 个专家只唤醒 8 个,“小马拉大车”的极致版#

1. MoE:309B 总参数、15B 激活,1/20 参数量干活#

V2-Flash 是标准 MoE(专家混合)架构:总参数 309B,含 256 个专家,每个 token 动态激活 top-8(对应 15B 激活参数)。这个”激活率”大概在 1/20 上下——什么意思?就好比一家公司养了 256 个专家,每次派活只叫醒 8 个,剩下 248 个在工位上睡觉不领工资(不占推理算力)。

对比同期的开源旗舰:DeepSeek-V3.2 总参 671B、Kimi-K2 总参 1T,V2-Flash 只用它们 1/2、1/3 的参数,就把分数做到了同一梯队。这是小米第一次把 MoE 旗舰立起来,定下的基调就是”参数是虚胖,激活才是肌肉”。

2. 混合注意力:5<1> 的 SWA + 全注意力,128-token 滑动窗口#

这是全文最重要的架构创新。V2-Flash 没有用近年流行的 Linear Attention(线性注意力),而是选择 Sliding Window Attention(滑动窗口注意力)与全局注意力(Global Attention)以 5<1> 比例交替堆叠,滑动窗口大小是激进的 128 token

用人话说:每 6 层里只有 1 层是”全视野”(能看到整个上下文),其余 5 层都只盯着眼前 128 个 token 看。就像人读长文,大部分时候只关注眼前几行,偶尔抬头扫一眼全文脉络——计算量从 O(L²) 降到 O(L×128),长上下文直接省出一大截。

论文里专门给了理由:早期大量实验表明,SWA 相比 Linear Attention 在通用任务、长上下文和推理上综合更强,而且窗口固定意味着 KV Cache 大小固定,极易塞进现有训练和推理框架,工程上省心得多。为了缓解 128-token 窗口带来的”语义断层”,还加了一个 可学习的 attention sink 偏置(attention sink bias),让极少数关键 token 始终被照顾到。训练时原生 32K 上下文,预训练后外扩到 256K。

3. MTP:既是训练加速器,也是推理”草稿模型”#

MTP(Multi-Token Prediction,多 token 预测)这招 DeepSeek-V3 用过,小米把它玩出了第二用途。训练时 MTP 一次预测多个后续 token,增强规划能力;推理时 MTP 头被改造成推测解码的草稿模型——先快速猜一串 token,再并行验证,打破大 batch 下传统自回归解码的显存带宽瓶颈。

实测数据:3 层 MTP 配置下,接受长度最高 3.6 个 token,解码加速最高 2.6×(官方博客口径为实测 2.5–3.7× 加速),配合 15B 激活的轻量架构,达成 150 tokens/s 的生成速度。API 定价输入 $0.1/M、输出 $0.3/M,推理成本只有 Claude Sonnet 4.5 的约 2.5%。

二、27T tokens 与 MOPD:后训练的”私教天团”#

1. 三阶段预训练#

V2-Flash 在 27T tokens 上预训练(来源:技术报告 Abstract),分三阶段:先以 32K 上下文训练基础能力,再强化代码与推理,最后外扩 256K 长上下文。数据调度上有专门的 scheduler 设计(论文 §3.1),但细节没完全公开。

2. MOPD:多教师在线策略蒸馏#

后训练是这篇报告最有”小米味”的原创点。常规做法是”领域专家蒸馏”,但小米提出 MOPD(Multi-Teacher On-Policy Distillation,多教师在线策略蒸馏):先分别训练数学、代码、搜索等领域的专家教师模型(每个都做大规模 RL),然后让一个学生模型在自己产生的 rollout 上、在教师给出的 token 级密集奖励指导下学习,把多位专家的能力融进一个模型。

官方说法是:MOPD 仅需传统流程不到 1/50 的计算资源,就能匹配教师模型的峰值性能,而且支持随时接入新教师与 ORM(可验证结果模型),形成能力闭环迭代。配合稳定 MoE RL 训练的 Rollout Routing Replay(R3)等技巧,把这套管线跑稳。

三、成绩单:SWE-bench 开源第一,AIME/GPQA 开源前二#

论文公开了 V2-Flash 与 DeepSeek-V3.2、K2-Thinking、Claude Sonnet 4.5、GPT-5(High)、Gemini 3.0 Pro 的直接对比(%),这是开源模型罕见地敢把闭源顶流拉进同框:

指标MiMo-V2-FlashDeepSeek-V3.2K2-ThinkingClaude Sonnet 4.5GPT-5(High)Gemini 3.0 Pro
SWE-bench Verified(代码)73.473.171.377.274.976.2
SWE-bench Multilingual71.770.261.168.055.3
τ²-Bench(工具调用)80.380.374.384.780.285.4
AIME 2025(数学)94.193.194.587.094.695.0
GPQA-Diamond(科学)84.382.484.583.485.791.9
HLE 无工具(学术推理)22.125.123.913.726.337.5
Arena-Hard(创意写作)86.288.880.176.792.293.6

(来源:MiMo-V2-Flash Technical Report Figure 1)

几点解读:

  • SWE-bench Verified 73.4%、多语言版 71.7%,双双开源第一,且多语言版把 K2-Thinking 甩开 10.6 分——“代码能力开源最强”的招牌立住了;
  • AIME 2025 94.1、GPQA-Diamond 84.3,开源前二;数学上甚至压过了 Claude Sonnet 4.5 的 87.0;
  • 长上下文同样能打:LongBenchV2、BrowseComp(启用上下文管理后 58.3)表现优异;
  • 短板也明显:HLE 只有 22.1(低于 V3.2 的 25.1),创意写作 86.2 落后闭源一个身位,说明通用世界知识仍是小参数的软肋——这是激活参数只有 15B 的天花板,不是 RL 能补的。

此外模型支持混合思考模式(hybrid thinking,可开关思考)、一键生成 HTML 网页、与 Claude Code/Cursor/Cline 等 vibe-coding 脚手架无缝配合,定位就是”代码与 Agent 时代的语言基座”。模型权重、3 层 MTP 权重与推理代码全部 MIT 协议开源。

四、同场加映:MiMo-Embodied——具身智能与智驾的”统一大脑”#

V2-Flash 开源前后,小米还放出一颗”附赠彩蛋”:MiMo-Embodied(2025.11.21 发布并开源,论文 arXiv<2511>.16518)。这是全球首个打通自动驾驶与具身智能的跨具身(X-Embodied)基座模型(MiMo-Embodied-7B,基于 MiMo-VL 架构)。

它试图回答一个行业级难题:室内机器人和户外智驾,能不能共享一个认知底座?架构上就是 ViT 视觉编码器 + MLP 投影器 + LLM 主干的经典三段式,但数据与训练方法是亮点——四阶段渐进训练:先双轨学习具身/自驾能力,再用思维链(CoT)增强推理,最后用 RL 在真实闭环环境里精细调优。结果:在 29 项基准(17 项具身 + 12 项智驾)上全面刷新开源纪录,空间推理与规划上甚至击败 GPT-4o、Gemini-Pro 等闭源模型。项目负责人是小米智驾团队首席科学家陈龙,第一作者为郝孝帅——把智驾团队的经验反哺具身,这个组织设计本身就很”小米”。

收尾:我的一点看法#

V2-Flash 最值得抄的地方,是它在”效率”这条路上选了一个跟 DeepSeek 完全不同的技术分叉口。DeepSeek 的 DSA 是”可学习的稀疏选择”,花哨但工程复杂;V2-Flash 直接拍板用固定 128-token 的滑动窗口,靠 5<1> 混合比例和 attention sink 兜底——简单、固定 KV Cache、好适配现有框架。这种”用工程确定性换取极致性价比”的思路,跟它”15B 激活硬刚 671B”的哲学是一脉相承的:不追求单项指标封神,追求每单位算力下的综合分。

MOPD 是另一个让我眼前一亮的东西。它把后训练从”师傅领进门”变成了”多师傅带着练”——1/50 算力匹配教师峰值性能,这个数字如果属实,对算力紧张的中小团队来说是降维打击式的方法论。

当然局限也很清楚。HLE 22.1、创意写作 86.2 说明它的”知识上限”被 15B 激活锁死了,它是一把”代码和推理的尖刀”,不是全知全能选手;256K 上下文在当时的 Agent 时代也只是够用,需要靠上下文管理来凑。另外我注意到它 12.16 发布、2 月就更新换代,迭代节奏快到模型卡上的一些数字已经开始过期。

但把 V2-Flash 放进小米 MiMo 发展史看,它的意义怎么强调都不过分:这是小米从”7B 小模型打榜”到”MoE 旗舰 + 开源生态”的惊险一跃,也是罗福莉团队正式接管后的第一份成绩单。它证明了小米不再只是”端侧之王”,在云端的效率赛道上,也已经有了跟 DeepSeek、Kimi 掰手腕的资格——而这,只是后面万亿级 Pro 系列的预热。

附:核心数据速查#

基本盘

项目数值
总参数 / 激活参数309B / 15B
MoE 配置256 个专家,每 token 激活 top-8
注意力SWA + 全注意力 5<1>,SWA 窗口 128 token,可学习 attention sink 偏置
上下文原生 32K,预训练后外扩至 256K
预训练数据27T tokens,三阶段数据调度
MTP3 层轻量多 token 预测,推理时作推测解码草稿模型
推理加速接受长度最高 3.6,解码加速最高 2.6×(官方博客口径 2.5–3.7×)
生成速度150 tokens/s
开源协议MIT(权重 + 3 层 MTP 权重 + 推理代码)
API 定价输入 $0.1/M、输出 $0.3/M;推理成本约为 Claude 4.5 的 2.5%

关键成绩

  • SWE-bench Verified 73.4%、SWE-bench Multilingual 71.7%,均开源第一
  • AIME 2025 94.1、GPQA-Diamond 84.3,开源前二;τ²-Bench 80.3
  • Arena-Hard 86.2、HLE(无工具)22.1、BrowseComp(带上下文管理)58.3
  • MOPD 后训练算力约为传统流程的 1/50
  • 同日/同期开源 MiMo-Embodied:29 项具身+智驾基准刷新开源纪录(论文 arXiv<2511>.16518)

关键概念清单

  • MoE = 专家混合(Mixture of Experts)
  • SWA = 滑动窗口注意力(Sliding Window Attention)
  • attention sink bias = 注意力汇聚偏置(保护关键 token 的可学习机制)
  • MTP = 多 token 预测(Multi-Token Prediction)
  • MOPD = 多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation)
  • speculative decoding = 推测解码(草稿模型并行验证加速)
  • HLE = Humanity’s Last Exam,人类最后考试
  • τ²-Bench / BrowseComp / Arena-Hard = Agent 工具调用 / 浏览检索 / 创意写作基准
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

MiMo-V2-Flash:成本打到 2.5%
https://mizuki-eaf.pages.dev/posts/mimo/mimo-v2-flash成本打到-25/
作者
无名之子
发布于
2026-07-28
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录