MiLM 系列模型解读:一部端侧大模型的”从军记”,小米 AI 的隐秘序章
论文:无公开技术报告,细节散见于小米官方公告、GitHub 评测页(MiLM-6B)及媒体披露 作者:小米 AI 实验室大模型团队(技术委员会负责人栾剑,向 AI 实验室主任王斌汇报) 在 MiMo-7B 引爆开源圈之前,小米的大模型一直是”隐身”的——没有论文、没有发布会,只有两张 C-Eval / CMMLU 榜单上的名字和一个 13B 端侧 Demo 的传闻。MiLM 系列就是这段隐身期的主角。今天回看,它是整个小米大模型故事的真正第一页:MiMo 后来”场景驱动、端云协同”的打法,都能在这里找到种子。
一、MiLM-6B / 1.3B:一张低调的成绩单,两条悄悄定下的路线
1. 榜单上的数字:同尺寸第一,但也就到此为止
2023 年 8 月,MiLM-6B 与 MiLM-1.3B 悄然现身 GitHub 及 C-Eval / CMMLU 两个中文评测榜单。据 GitHub 页面数据:MiLM-6B(约 64 亿参数)C-Eval zero-shot 平均 60.2、CMMLU 平均 60.37,均为同尺寸最佳水平;MiLM-1.3B 为 C-Eval 45.8、CMMLU 50.79。翻译成”人话”:中文知识问答的维度上,小米的 6B 站住了脚——尽管这个体量上不了大模型的牌桌,但算得上一张”我也有能力”的名片。
2. “轻量化 + 本地部署”:雷军 8 月演讲定下的军令状
同月,雷军在年度演讲中官宣小米”全面拥抱大模型”,主攻**“轻量化 + 本地部署”,并透露 13 亿参数端侧模型已跑通 Demo,部分场景效果媲美云端 60 亿参数模型。这句话是整段历史的纲领:手机厂商的功耗、内存、隐私约束,决定了小米不可能去硬拼云端通用大模型。“先端侧、后云端”不是退缩,而是被场景倒逼出来的战略选择。** 同年 12 月,小米被曝已建成 GPU 万卡集群(团队成立时约 6500 张卡),算力基建同步就位。
二、MiLM2:从”一个模型”到”一支军队”
1. 0.3B–30B 云边端矩阵:把模型做成”货架上的尺码”
2024 年 11 月 12 日,小米宣布大模型升级至第二代 MiLM2,参数矩阵一口气铺开 0.3B–30B 八个档位,实现”云边端结合”:0.3B–6B 供终端按芯片和存储条件挑选(微调后可达百亿参数开源模型效果);6B / 13B 是多任务微调的”涌现能力起点”;30B 专供云端,据媒体口径在指令遵循、常识推理、阅读理解上”超越主流竞品”,落地于 SU7 智能座舱。人话版:小米没造一艘航母,而是组了一支按尺码供货的舰队,每个场景都能领到合身的模型。
2. 45% 平均提升与端侧硬技术
据小米官方口径,MiLM2 在自建评测集 Mi-LLMBM2.0(10 大类、170 个细分测试项)上,相比一代平均提升超过 45%,指令跟随、翻译、闲聊等智能助手关键能力”处于业界前列”。更有含金量的是端侧工程:支持大小模型投机、BiTA、Medusa 三种推理加速方案;自研量化较业界标准(高通方案)损失降低 78%;最长窗口从一代的 4K 扩到 200K。同期还公开了 TransAct 剪枝、INTRADoc 注意力、MoDSE 三篇论文(KV Cache 降 50%、推理提速 20%,部署情况待核实)。这些积累,为 MiMo 的”端云协同”攒下了弹药。
收尾:我的一点看法
MiLM 系列最值得玩味的地方,恰恰是它的”不性感”。当全网比拼参数量和榜单排位时,小米选择把有限算力投向”轻量化 + 本地部署”这条没人抢的路——不是因为它跑得比谁都快,而是手机和车上的 NPU 只认这条路。这是典型的”场景定义模型”思维,也是后来 MiMo 方法论第一条原则的源头。
它的局限同样明显:没有公开技术报告,评测主要基于自建集,缺乏可横向比较的硬指标,“同尺寸第一”的含金量也被同期百模大战的喧嚣稀释了。它证明了小米”能做大模型”,却没证明”能做好大模型”——这道题,留给了后来的 MiMo-7B。
放在整个发展史里看,MiLM 时期完成了团队、算力、合规(2024 年 5 月备案)、场景四要素的积累,也埋下两个伏笔:一是”推理密度”的意识——榜单成绩说明小米重视知识问答,MiMo 把它升级为”推理特化”;二是端侧工程沉淀——量化、剪枝、投机解码,两年后以 MTP 和 RL 训练引擎的形态在 MiMo 里开花。序章不精彩,但每一页都是后文的草稿。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| MiLM-6B 参数 | 约 64 亿 |
| C-Eval(zero-shot) | 60.2(同尺寸第一) |
| CMMLU(zero-shot) | 60.37(同尺寸第一) |
| MiLM-1.3B 参数 | 约 13 亿(C-Eval 45.8 / CMMLU 50.79) |
| MiLM2 参数矩阵 | 0.3B–30B 八档,云边端结合 |
| MiLM2 能力提升 | 10 大类平均 +45%(Mi-LLMBM2.0,170 个测试项) |
| MiLM2 最长窗口 | 200K(一代为 4K) |
| 端侧加速 | 大小模型投机 / BiTA / Medusa;自研量化损失较高通方案降 78% |
关键成绩
- 2023.08 登 C-Eval / CMMLU 榜单;同月雷军定调”轻量化 + 本地部署”,13B 端侧 Demo 跑通
- 2023 年底接入澎湃 OS,同期万卡 GPU 集群建成(初始约 6500 张卡)
- 2024.05 通过大模型备案,获合规入场券
- 2024.11.12 MiLM2 发布,参数覆盖 0.3B–30B;MiLM2-30B 用于 SU7 智能座舱(据官方/媒体口径)
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





