MiMo-V2-Flash 模型解读:309B 的壳、15B 的激活,用”混合注意力”把推理成本打到闭源的 2.5%
论文:MiMo-V2-Flash: Efficient Reasoning, Coding, and Agentic Foundation Model 作者:小米 MiMo 团队(LLM-Core Xiaomi) 这是 2025 年 12 月 16 日开源的技术报告,也是小米在罗福莉加盟后交出的第一张 MoE 旗舰答卷。核心卖点就一句话:总参数 309B、每次只激活 15B,用约 1/20 的参数干活,SWE-bench Verified 73.4% 直接拿下开源第一,代码能力比肩 Claude Sonnet 4.5,推理成本却只有它的 2.5%、生成速度翻倍。如果说 DeepSeek 走的是”用稀疏注意力榨干长上下文”,那 V2-Flash 就是换了一条路——用 128-token 的滑动窗口把 KV Cache 按 5<1>1> 的比例”挤出”去,土办法,但真香。
一、架构:256 个专家只唤醒 8 个,“小马拉大车”的极致版
1. MoE:309B 总参数、15B 激活,1/20 参数量干活
V2-Flash 是标准 MoE(专家混合)架构:总参数 309B,含 256 个专家,每个 token 动态激活 top-8(对应 15B 激活参数)。这个”激活率”大概在 1/20 上下——什么意思?就好比一家公司养了 256 个专家,每次派活只叫醒 8 个,剩下 248 个在工位上睡觉不领工资(不占推理算力)。
对比同期的开源旗舰:DeepSeek-V3.2 总参 671B、Kimi-K2 总参 1T,V2-Flash 只用它们 1/2、1/3 的参数,就把分数做到了同一梯队。这是小米第一次把 MoE 旗舰立起来,定下的基调就是”参数是虚胖,激活才是肌肉”。
2. 混合注意力:5<1>1> 的 SWA + 全注意力,128-token 滑动窗口
这是全文最重要的架构创新。V2-Flash 没有用近年流行的 Linear Attention(线性注意力),而是选择 Sliding Window Attention(滑动窗口注意力)与全局注意力(Global Attention)以 5<1>1> 比例交替堆叠,滑动窗口大小是激进的 128 token。
用人话说:每 6 层里只有 1 层是”全视野”(能看到整个上下文),其余 5 层都只盯着眼前 128 个 token 看。就像人读长文,大部分时候只关注眼前几行,偶尔抬头扫一眼全文脉络——计算量从 O(L²) 降到 O(L×128),长上下文直接省出一大截。
论文里专门给了理由:早期大量实验表明,SWA 相比 Linear Attention 在通用任务、长上下文和推理上综合更强,而且窗口固定意味着 KV Cache 大小固定,极易塞进现有训练和推理框架,工程上省心得多。为了缓解 128-token 窗口带来的”语义断层”,还加了一个 可学习的 attention sink 偏置(attention sink bias),让极少数关键 token 始终被照顾到。训练时原生 32K 上下文,预训练后外扩到 256K。
3. MTP:既是训练加速器,也是推理”草稿模型”
MTP(Multi-Token Prediction,多 token 预测)这招 DeepSeek-V3 用过,小米把它玩出了第二用途。训练时 MTP 一次预测多个后续 token,增强规划能力;推理时 MTP 头被改造成推测解码的草稿模型——先快速猜一串 token,再并行验证,打破大 batch 下传统自回归解码的显存带宽瓶颈。
实测数据:3 层 MTP 配置下,接受长度最高 3.6 个 token,解码加速最高 2.6×(官方博客口径为实测 2.5–3.7× 加速),配合 15B 激活的轻量架构,达成 150 tokens/s 的生成速度。API 定价输入 $0.1/M、输出 $0.3/M,推理成本只有 Claude Sonnet 4.5 的约 2.5%。
二、27T tokens 与 MOPD:后训练的”私教天团”
1. 三阶段预训练
V2-Flash 在 27T tokens 上预训练(来源:技术报告 Abstract),分三阶段:先以 32K 上下文训练基础能力,再强化代码与推理,最后外扩 256K 长上下文。数据调度上有专门的 scheduler 设计(论文 §3.1),但细节没完全公开。
2. MOPD:多教师在线策略蒸馏
后训练是这篇报告最有”小米味”的原创点。常规做法是”领域专家蒸馏”,但小米提出 MOPD(Multi-Teacher On-Policy Distillation,多教师在线策略蒸馏):先分别训练数学、代码、搜索等领域的专家教师模型(每个都做大规模 RL),然后让一个学生模型在自己产生的 rollout 上、在教师给出的 token 级密集奖励指导下学习,把多位专家的能力融进一个模型。
官方说法是:MOPD 仅需传统流程不到 1/50 的计算资源,就能匹配教师模型的峰值性能,而且支持随时接入新教师与 ORM(可验证结果模型),形成能力闭环迭代。配合稳定 MoE RL 训练的 Rollout Routing Replay(R3)等技巧,把这套管线跑稳。
三、成绩单:SWE-bench 开源第一,AIME/GPQA 开源前二
论文公开了 V2-Flash 与 DeepSeek-V3.2、K2-Thinking、Claude Sonnet 4.5、GPT-5(High)、Gemini 3.0 Pro 的直接对比(%),这是开源模型罕见地敢把闭源顶流拉进同框:
| 指标 | MiMo-V2-Flash | DeepSeek-V3.2 | K2-Thinking | Claude Sonnet 4.5 | GPT-5(High) | Gemini 3.0 Pro |
|---|---|---|---|---|---|---|
| SWE-bench Verified(代码) | 73.4 | 73.1 | 71.3 | 77.2 | 74.9 | 76.2 |
| SWE-bench Multilingual | 71.7 | 70.2 | 61.1 | 68.0 | 55.3 | — |
| τ²-Bench(工具调用) | 80.3 | 80.3 | 74.3 | 84.7 | 80.2 | 85.4 |
| AIME 2025(数学) | 94.1 | 93.1 | 94.5 | 87.0 | 94.6 | 95.0 |
| GPQA-Diamond(科学) | 84.3 | 82.4 | 84.5 | 83.4 | 85.7 | 91.9 |
| HLE 无工具(学术推理) | 22.1 | 25.1 | 23.9 | 13.7 | 26.3 | 37.5 |
| Arena-Hard(创意写作) | 86.2 | 88.8 | 80.1 | 76.7 | 92.2 | 93.6 |
(来源:MiMo-V2-Flash Technical Report Figure 1)
几点解读:
- SWE-bench Verified 73.4%、多语言版 71.7%,双双开源第一,且多语言版把 K2-Thinking 甩开 10.6 分——“代码能力开源最强”的招牌立住了;
- AIME 2025 94.1、GPQA-Diamond 84.3,开源前二;数学上甚至压过了 Claude Sonnet 4.5 的 87.0;
- 长上下文同样能打:LongBenchV2、BrowseComp(启用上下文管理后 58.3)表现优异;
- 短板也明显:HLE 只有 22.1(低于 V3.2 的 25.1),创意写作 86.2 落后闭源一个身位,说明通用世界知识仍是小参数的软肋——这是激活参数只有 15B 的天花板,不是 RL 能补的。
此外模型支持混合思考模式(hybrid thinking,可开关思考)、一键生成 HTML 网页、与 Claude Code/Cursor/Cline 等 vibe-coding 脚手架无缝配合,定位就是”代码与 Agent 时代的语言基座”。模型权重、3 层 MTP 权重与推理代码全部 MIT 协议开源。
四、同场加映:MiMo-Embodied——具身智能与智驾的”统一大脑”
V2-Flash 开源前后,小米还放出一颗”附赠彩蛋”:MiMo-Embodied(2025.11.21 发布并开源,论文 arXiv<2511>2511>.16518)。这是全球首个打通自动驾驶与具身智能的跨具身(X-Embodied)基座模型(MiMo-Embodied-7B,基于 MiMo-VL 架构)。
它试图回答一个行业级难题:室内机器人和户外智驾,能不能共享一个认知底座?架构上就是 ViT 视觉编码器 + MLP 投影器 + LLM 主干的经典三段式,但数据与训练方法是亮点——四阶段渐进训练:先双轨学习具身/自驾能力,再用思维链(CoT)增强推理,最后用 RL 在真实闭环环境里精细调优。结果:在 29 项基准(17 项具身 + 12 项智驾)上全面刷新开源纪录,空间推理与规划上甚至击败 GPT-4o、Gemini-Pro 等闭源模型。项目负责人是小米智驾团队首席科学家陈龙,第一作者为郝孝帅——把智驾团队的经验反哺具身,这个组织设计本身就很”小米”。
收尾:我的一点看法
V2-Flash 最值得抄的地方,是它在”效率”这条路上选了一个跟 DeepSeek 完全不同的技术分叉口。DeepSeek 的 DSA 是”可学习的稀疏选择”,花哨但工程复杂;V2-Flash 直接拍板用固定 128-token 的滑动窗口,靠 5<1>1> 混合比例和 attention sink 兜底——简单、固定 KV Cache、好适配现有框架。这种”用工程确定性换取极致性价比”的思路,跟它”15B 激活硬刚 671B”的哲学是一脉相承的:不追求单项指标封神,追求每单位算力下的综合分。
MOPD 是另一个让我眼前一亮的东西。它把后训练从”师傅领进门”变成了”多师傅带着练”——1/50 算力匹配教师峰值性能,这个数字如果属实,对算力紧张的中小团队来说是降维打击式的方法论。
当然局限也很清楚。HLE 22.1、创意写作 86.2 说明它的”知识上限”被 15B 激活锁死了,它是一把”代码和推理的尖刀”,不是全知全能选手;256K 上下文在当时的 Agent 时代也只是够用,需要靠上下文管理来凑。另外我注意到它 12.16 发布、2 月就更新换代,迭代节奏快到模型卡上的一些数字已经开始过期。
但把 V2-Flash 放进小米 MiMo 发展史看,它的意义怎么强调都不过分:这是小米从”7B 小模型打榜”到”MoE 旗舰 + 开源生态”的惊险一跃,也是罗福莉团队正式接管后的第一份成绩单。它证明了小米不再只是”端侧之王”,在云端的效率赛道上,也已经有了跟 DeepSeek、Kimi 掰手腕的资格——而这,只是后面万亿级 Pro 系列的预热。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 总参数 / 激活参数 | 309B / 15B |
| MoE 配置 | 256 个专家,每 token 激活 top-8 |
| 注意力 | SWA + 全注意力 5<1>1>,SWA 窗口 128 token,可学习 attention sink 偏置 |
| 上下文 | 原生 32K,预训练后外扩至 256K |
| 预训练数据 | 27T tokens,三阶段数据调度 |
| MTP | 3 层轻量多 token 预测,推理时作推测解码草稿模型 |
| 推理加速 | 接受长度最高 3.6,解码加速最高 2.6×(官方博客口径 2.5–3.7×) |
| 生成速度 | 150 tokens/s |
| 开源协议 | MIT(权重 + 3 层 MTP 权重 + 推理代码) |
| API 定价 | 输入 $0.1/M、输出 $0.3/M;推理成本约为 Claude 4.5 的 2.5% |
关键成绩
- SWE-bench Verified 73.4%、SWE-bench Multilingual 71.7%,均开源第一
- AIME 2025 94.1、GPQA-Diamond 84.3,开源前二;τ²-Bench 80.3
- Arena-Hard 86.2、HLE(无工具)22.1、BrowseComp(带上下文管理)58.3
- MOPD 后训练算力约为传统流程的 1/50
- 同日/同期开源 MiMo-Embodied:29 项具身+智驾基准刷新开源纪录(论文 arXiv<2511>2511>.16518)
关键概念清单
- MoE = 专家混合(Mixture of Experts)
- SWA = 滑动窗口注意力(Sliding Window Attention)
- attention sink bias = 注意力汇聚偏置(保护关键 token 的可学习机制)
- MTP = 多 token 预测(Multi-Token Prediction)
- MOPD = 多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation)
- speculative decoding = 推测解码(草稿模型并行验证加速)
- HLE = Humanity’s Last Exam,人类最后考试
- τ²-Bench / BrowseComp / Arena-Hard = Agent 工具调用 / 浏览检索 / 创意写作基准
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





