mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4031 字
12 分钟
MiMo-7B:7B 理科状元
2026-07-23

MiMo-7B 论文解读:7B 的”理科状元”,小米第一次被开源圈记住的样子#

论文:MiMo: Unlocking the Reasoning Potential of Language Model – From Pretraining to Posttraining 作者:小米大模型 Core 团队 arXiv:2505.07608(2025 年 4 月 30 日随模型一并开源,共 26 页) 这是小米的”一战成名”之作。在 MiLM 时代,小米大模型还只是榜单上的两个名字;MiMo-7B 则直接掀了桌子——一个 7B 小模型,在 AIME、LiveCodeBench 上把 OpenAI o1-mini 和 32B 的 QwQ-Preview 踩在脚下,一个月后连 671B 的 DeepSeek-R1 都超了。它的核心主张一句话:推理能力不是参数堆出来的,是数据工程和 RL 配方”炼”出来的——而这份配方,小米几乎是公开写在论文里给你抄。


一、预训练:推理不是后补的技能,而是”胎教”#

1. 数据工程三件套:HTML 挖掘机、一天全量去重、小模型当质检员#

MiMo 团队把预训练语料当成”推理种子田”来经营。第一件事是改造抽取工具:通用抽取器(trafilatura 一类)在扒网页时会丢数学公式和代码块,小米专门写了针对数学、代码、论坛网页优化的 HTML 抽取器,并强化 PDF 解析以保住 STEM 内容——这是”保留推理痕迹”的源头工程。

第二件事是全量去重:URL 去重 + MinHash 去重并行上,工程优化后整个 Web 语料的全量去重一天内跑完,而后按多维质量分动态调整数据分布。

第三件事最有意思:不用规则过滤器,改用微调的小 LLM 当”质检员”,做领域分类和多维质量打分。原因是启发式规则常误杀含数学代码的高质量网页,而模型判断能保留推理密度高的内容。人话版:别的团队在过滤数据,小米在”挑有脑子的数据”。

2. 200B 合成推理数据与三阶段递进混合#

合成数据方面,小米用先进推理模型生成约 200B tokens 的合成推理数据(含 STEM 深挖、数学/代码解题、创意写作等),并有一个关键发现:合成推理数据可以超高 epoch 反复训练而不过拟合——这是它能大量掺进预训练的前提。

最终采用三阶段递进式混合,总语料约 25 万亿 tokens(据论文及发布口径,约为同等规模模型的 3 倍以上):

  • Stage 1:铺全量数据(排除合成推理响应),下采样广告、新闻、招聘等低推理密度内容,上采样专业领域高价值数据;
  • Stage 2:数学与代码相关数据大幅增至约 70%,专攻专项能力又不毁通用性;
  • Stage 3:混入约 10% 的合成响应(数学、代码、创意写作),同时把上下文从 8K 扩到 32K。

这个设计的要点是”推理数据不是后补的,而是嵌入预训练全流程”——小米管这叫给模型做”推理胎教”。

3. 架构:标准底座 + MTP 点睛(DeepSeek-V3 的”遗产”)#

模型架构本身毫不花哨:36 层 Transformer,隐层 4096,FFN 中间维 11008,32 个注意力头、8 个 KV 组(GQA),配 pre-RMSNorm、SwiGLU、RoPE——与 Llama、Qwen 同源,没有 MoE、没有新注意力。上下文 Stage 1/2 为 8192,Stage 3 扩到 32768,RoPE base 从 1 万拉高到 64 万。

真正的点睛之笔是 MTP(Multi-Token Prediction,多 token 预测)。论文原文写明”受 DeepSeek-V3 启发”(Inspired by DeepSeek-V3),但用法做了本土化改造:

  • 预训练期只挂 1 层 MTP——实验发现多层无增益,损失权重前 10.3T tokens 设为 0.3、之后降到 0.1(与 V3 的 0.3/0.1 配方几乎逐字对应);
  • 推理期复制成多层——把预训练的单层 MTP 复制成两份,冻结主模型和第一层 MTP,微调出新 MTP 层,用于**投机解码(speculative decoding)**加速。实测第一层 MTP 接受率约 90%,第三层仍在 75% 以上,对推理模型动辄上万 token 的长输出是实打实的提速。

4. 训练超参一览#

优化器 AdamW(β₁=0.9、β₂=0.95、weight decay 0.1),梯度裁剪 1.0;学习率先线性 warmup 到 1.07e-4(前 84B tokens),恒定期 10.2T,再余弦衰减到 3e-5;batch size 前两阶段 warmup 到 2560,Stage 3 固定在 640。整体是”稳”字当头的配置,没有整活的余地。

二、后训练:一份比 R1 更”重”的 RL 配方#

1. GRPO 改良三招:去 KL、动态采样、Clip-Higher#

RL 算法是在 GRPO(DeepSeekMath 提出的组相对策略优化)基础上做的改良版,核心三招:

  • 移除 KL 损失:认为 KL 项会压制策略潜能,直接拿掉也不破坏稳定性(R1 的 KL 系数 0.001 在这里被砍成了零);
  • 动态采样(Dynamic Sampling):过采样并过滤 pass rate 为 0 或 1 的极端 prompt,保证每个 batch 里都有有效梯度;
  • Clip-Higher:把 GRPO 目标的上剪裁界(ε_high)调高,缓解熵坍缩、鼓励探索。

训练超参:batch 512、actor mini-batch 32、每轮 16 次梯度更新、学习率 1e-6、最大序列 32768、温度与 top-p 均为 1.0。

2. 奖励设计:纯规则 + “测试难度驱动奖励”#

奖励只用规则验证,不引入任何神经奖励模型,从源头杜绝 reward hacking(奖励作弊):数学题用 Math-Verify 判对错,代码题跑自研在线评测(online judge)判测试用例,不加格式奖励、不加长度惩罚。对比一下 DeepSeek-R1:R1 在规则之外还加了格式奖励和语言一致性奖励,MiMo 把这些全砍了——奖励更”脏”一点,逼模型自己找格式。

代码题的难点在于稀疏奖励:难题解不出,每一步都得零分。小米的解法是 Test Difficulty Driven Reward(测试难度驱动奖励),灵感来自 IOI(国际信息学奥赛)计分:按模型在各测试用例上的通过率把测试聚类成不同难度,通过率越低越难;再设计 strict(按难度逐级全过才给分)与 soft(组内分数摊到每个用例)两套方案。据社区转述的口径,简单/中等/困难用例分别给 1/3/10 分,全过再额外加 20 分(具体分值以论文图 5 为准)。这招把”全对才有糖”变成”每过一关都有糖”,有效地把稀疏奖励变稠密。

3. 13 万道题:数据是”炼”出来的#

RL 数据是 13 万道数学/代码题(10 万数学 + 3 万代码)。数学题先用先进推理模型筛掉过难或答案错误的,再用 SFT 版 MiMo-7B 各 rollout 16 次,剔除通过率超 90% 的简单题(约削掉一半);代码题只留带测试用例的,golden solution 过不了测的、16 次 rollout 一个用例都解不出的全部丢弃。人话版:留下的题”刚好卡在模型啃不动又跳一跳够得着”的位置——这是 RL 训练数据最难拿捏的甜点区。

4. Seamless Rollout 引擎:把 GPU 空闲时间从 1.0 压到 0.15#

RL 训练是显存和算力的无底洞。小米基于开源库 verl + Ray 自研了 Seamless Rollout Engine,三招治”GPU 空转”:连续 rollout(continuous rollout,不等上一批训完)、异步奖励计算(尤其代码判题耗时)、提前终止(early termination)。效果立竿见影:训练提速 2.29 倍、验证提速 1.96 倍,归一化 GPU 空闲时间从 1.0 直降到 0.15。同时把 MTP 支持进 vLLM,让推理引擎在 RL 系统里更健壮。这套工程能力,是”小模型 + 大 RL”能跑得动的隐藏前提。

5. RL-Zero vs RL:一个反直觉的结论#

MiMo 同时开源了 RL-Zero(从 base 直接 RL,不经过 SFT)RL(SFT 后 RL) 两个版本——这条实验路线和 DeepSeek-R1-Zero / R1 的对照如出一辙。结论却更细:直接 RL 的初始增长势头更猛(RL-Zero 的推理表现超过 32B 基座的 RL 训练成绩),但在 SFT 模型上做 RL 最终天花板更高;更反直觉的是,“轻量级 SFT”反而比”重量级 SFT”和”直接 RL”都差——说明 SFT 必须先练够深度,才能给 RL 打牢地基。此外论文还发现,RL 中生成长度预算从 32K→38K→48K 渐进放长,数学推理会持续受益。

三、成绩单与涟漪:7B 打 32B、打 o1-mini、再超 R1#

1. 四版评测成绩(temp=0.6)#

MiMo-7B 一次放出 Base / SFT / RL-Zero / RL 四个版本(Hugging Face 模型卡显示 SFT 版约 7.83B 参数,Apache 2.0 授权)。核心成绩(据 arXiv 技术报告与 HF 模型卡):

  • MiMo-7B-RL:MATH-500 95.8、AIME 2024 68.2、AIME 2025 55.4(超 o1-mini 4.7 分)、LiveCodeBench v5 57.8(o1-mini 为 53.1)、LCB v6 超 QwQ-32B-Preview 10 分以上、GPQA 54.4、MMLU-Pro 58.6(据发布口径);
  • MiMo-7B-Base:BBH 75.2,超 Qwen2.5-7B 近 5 分,通用知识/代码在 7B 级别同类最佳;
  • RL-Zero:数学与代码任务的 RL 训练成绩反超 32B 基座,证明底座”推理潜力”确实被预训练打开了。

2. RL-0530:一个月后的”补刀”#

2025 年 5 月 30 日,小米在模型卡上更新了 MiMo-7B-RL-0530:SFT 数据从约 50 万条扩到 600 万条,RL 窗口从 32K 扩到 48K。结果(据 ModelScope 模型卡):

  • AIME 2024:68.2 → 80.1反超 DeepSeek-R1 的 79.8
  • MATH-500:95.8 → 97.2;AIME 2025:55.4 → 70.2;LCB v5:57.8 → 60.9;GPQA-Diamond:54.4 → 60.6。

一个 7B 模型在数学推理上打赢 671B 的 R1——“数据 + 配方 > 参数量”这个叙事自此坐实。

3. 股价与社区花絮#

发布当天(2025.04.30)小米港股收涨约 4.74%(媒体口径,午间市值 1.29 万亿港元;另有口径称收高 5.27%),资本市场给了”最强背书”。社区热度上,MiMo-7B-RL 在 Hugging Face 长期是小米系下载王(据 dev.to 测评文约 59.4 万次下载,时效待核实);单卡即可运行(据 Yahoo 财经转述)让它在端侧与个人开发者中格外吃香。GitHub 仓库与 26 页技术报告同步公开,Apache 2.0 授权——这份”透明教学”的态度,也让 MiMo-7B 成了当时开源圈 R1 之后又一份 RL 教材。

收尾:我的一点看法#

MiMo-7B 最值得学习的不是某个单项技术,而是它把”推理特化”这条线做到了极致闭环:预训练埋推理种子(数据工程 + MTP)→ RL 用干净规则兑现(GRPO 改良 + 难度驱动奖励)→ 工程把成本打下来(Seamless Rollout)→ 开源把方法论传播出去。它证明了在推理这个赛道上,7B 不是”小模型的将就”,而是”可验证任务 + 好配方”下的最优解之一。 这也解释了为什么一年后 V2-Flash 要上 MoE——推理特化的边际收益在 7B 上吃完了,剩下的是效率与多模态的仗。

它有局限。评测高度集中在数学/代码这些”答案可验证”的任务上,通用对话、事实知识只是”守住不下滑”,RL 造不出验证器的任务它依然没辙——这和 R1 的边界完全一致,因为路线本来就师出同门。另外,“数据工程 + RL 配方”的成功极度依赖那 25T tokens 和 13 万道精筛题,普通团队复现成本并不低。

把它放回发展史里,这篇论文是小米整个叙事的分水岭:MiLM 时期小米是”能做大模型的厂商之一”,MiMo-7B 之后它变成了”会用 RL 把小模型打出大模型成绩的狠角色”。而它对 DeepSeek 的致敬(MTP 借鉴 V3、RL-Zero 对照 R1)也埋下了有趣的线头——几个月后,DeepSeek-V2 的作者之一罗福莉加入小米执掌 MiMo,两个名字在现实中接上了榫。7B 的状元不是终点,它只是小米大模型故事的真正开头。

附:核心数据速查#

基本盘

项目数值
参数量约 7B(SFT 版模型卡显示 7.83B)
架构36 层 / 隐层 4096 / FFN 11008 / 32 头 / 8 KV 组(GQA)+ pre-RMSNorm + SwiGLU + RoPE
预训练数据约 25T tokens(含约 200B 合成推理数据)
数据混合三阶段递进:Stage 2 数学代码占 ~70%;Stage 3 +~10% 合成数据,上下文 8K→32K
MTP预训练单层(权重 0.3→0.1);推理多层投机解码,接受率约 90%
RL 算法改良 GRPO:去 KL、动态采样、Clip-Higher
奖励纯规则验证(Math-Verify / 在线评测)+ Test Difficulty Driven Reward
RL 数据13 万道(10 万数学 + 3 万代码),每道题经清洗与难度评估
RL 超参batch 512 / mini-batch 32 / lr 1e-6 / max seq 32768 / 温度 1.0
训练引擎Seamless Rollout Engine:训练提速 2.29×、验证提速 1.96×,GPU 空闲 1.0→0.15
开源4 版本(Base / SFT / RL-Zero / RL),Apache 2.0,HF + ModelScope

关键成绩(temp=0.6,据 arXiv 技术报告 / HF 模型卡)

  • MiMo-7B-RL:MATH-500 95.8|AIME24 68.2|AIME25 55.4(超 o1-mini 4.7 分)|LCB v5 57.8(o1-mini 53.1)|GPQA 54.4|MMLU-Pro 58.6(据发布口径)
  • MiMo-7B-Base:BBH 75.2(超 Qwen2.5-7B 近 5 分)
  • MiMo-7B-RL-0530(2025.05.30):AIME24 80.1(超 DeepSeek-R1 的 79.8)|AIME25 70.2|MATH-500 97.2|LCB v5 60.9|GPQA-Diamond 60.6|Alignbench1.1 7.4
  • 花絮:发布当天小米股价涨约 4.74%(另有口径 5.27%),市值 1.29 万亿港元;MiMo-7B-RL 长期为小米系 HF 下载冠军(约 59.4 万次,据 dev.to,时效待核实)

关键概念清单

  • MTP = Multi-Token Prediction,多 token 预测(受 DeepSeek-V3 启发)
  • GQA = Grouped-Query Attention,分组查询注意力
  • GRPO = Group Relative Policy Optimization,组相对策略优化(无 critic)
  • RL-Zero = 从 base 直接做 RL,不经 SFT(对应 DeepSeek-R1-Zero 思路)
  • speculative decoding = 投机解码(用小模型猜、大模型验)
  • reward hacking = 奖励作弊(钻奖励函数的空子)
  • Seamless Rollout Engine = 无缝 rollout 引擎(连续 rollout + 异步奖励 + 提前终止)
  • Test Difficulty Driven Reward = 测试难度驱动奖励(按用例难度分级给分)
  • Easy Data Re-Sampling = 简单题回池重采样(约 10% 概率从简单题池补采样,稳定更新)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

MiMo-7B:7B 理科状元
https://mizuki-eaf.pages.dev/posts/mimo/mimo-7b7b-理科状元/
作者
无名之子
发布于
2026-07-23
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录