mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1674 字
5 分钟
MiLM:端侧从军记
2026-07-22

MiLM 系列模型解读:一部端侧大模型的”从军记”,小米 AI 的隐秘序章#

论文:无公开技术报告,细节散见于小米官方公告、GitHub 评测页(MiLM-6B)及媒体披露 作者:小米 AI 实验室大模型团队(技术委员会负责人栾剑,向 AI 实验室主任王斌汇报) 在 MiMo-7B 引爆开源圈之前,小米的大模型一直是”隐身”的——没有论文、没有发布会,只有两张 C-Eval / CMMLU 榜单上的名字和一个 13B 端侧 Demo 的传闻。MiLM 系列就是这段隐身期的主角。今天回看,它是整个小米大模型故事的真正第一页:MiMo 后来”场景驱动、端云协同”的打法,都能在这里找到种子。


一、MiLM-6B / 1.3B:一张低调的成绩单,两条悄悄定下的路线#

1. 榜单上的数字:同尺寸第一,但也就到此为止#

2023 年 8 月,MiLM-6B 与 MiLM-1.3B 悄然现身 GitHub 及 C-Eval / CMMLU 两个中文评测榜单。据 GitHub 页面数据:MiLM-6B(约 64 亿参数)C-Eval zero-shot 平均 60.2、CMMLU 平均 60.37,均为同尺寸最佳水平;MiLM-1.3B 为 C-Eval 45.8、CMMLU 50.79。翻译成”人话”:中文知识问答的维度上,小米的 6B 站住了脚——尽管这个体量上不了大模型的牌桌,但算得上一张”我也有能力”的名片。

2. “轻量化 + 本地部署”:雷军 8 月演讲定下的军令状#

同月,雷军在年度演讲中官宣小米”全面拥抱大模型”,主攻**“轻量化 + 本地部署”,并透露 13 亿参数端侧模型已跑通 Demo,部分场景效果媲美云端 60 亿参数模型。这句话是整段历史的纲领:手机厂商的功耗、内存、隐私约束,决定了小米不可能去硬拼云端通用大模型。“先端侧、后云端”不是退缩,而是被场景倒逼出来的战略选择。** 同年 12 月,小米被曝已建成 GPU 万卡集群(团队成立时约 6500 张卡),算力基建同步就位。

二、MiLM2:从”一个模型”到”一支军队”#

1. 0.3B–30B 云边端矩阵:把模型做成”货架上的尺码”#

2024 年 11 月 12 日,小米宣布大模型升级至第二代 MiLM2,参数矩阵一口气铺开 0.3B–30B 八个档位,实现”云边端结合”:0.3B–6B 供终端按芯片和存储条件挑选(微调后可达百亿参数开源模型效果);6B / 13B 是多任务微调的”涌现能力起点”;30B 专供云端,据媒体口径在指令遵循、常识推理、阅读理解上”超越主流竞品”,落地于 SU7 智能座舱。人话版:小米没造一艘航母,而是组了一支按尺码供货的舰队,每个场景都能领到合身的模型。

2. 45% 平均提升与端侧硬技术#

据小米官方口径,MiLM2 在自建评测集 Mi-LLMBM2.0(10 大类、170 个细分测试项)上,相比一代平均提升超过 45%,指令跟随、翻译、闲聊等智能助手关键能力”处于业界前列”。更有含金量的是端侧工程:支持大小模型投机、BiTA、Medusa 三种推理加速方案;自研量化较业界标准(高通方案)损失降低 78%;最长窗口从一代的 4K 扩到 200K。同期还公开了 TransAct 剪枝、INTRADoc 注意力、MoDSE 三篇论文(KV Cache 降 50%、推理提速 20%,部署情况待核实)。这些积累,为 MiMo 的”端云协同”攒下了弹药。

收尾:我的一点看法#

MiLM 系列最值得玩味的地方,恰恰是它的”不性感”。当全网比拼参数量和榜单排位时,小米选择把有限算力投向”轻量化 + 本地部署”这条没人抢的路——不是因为它跑得比谁都快,而是手机和车上的 NPU 只认这条路。这是典型的”场景定义模型”思维,也是后来 MiMo 方法论第一条原则的源头。

它的局限同样明显:没有公开技术报告,评测主要基于自建集,缺乏可横向比较的硬指标,“同尺寸第一”的含金量也被同期百模大战的喧嚣稀释了。它证明了小米”能做大模型”,却没证明”能做好大模型”——这道题,留给了后来的 MiMo-7B。

放在整个发展史里看,MiLM 时期完成了团队、算力、合规(2024 年 5 月备案)、场景四要素的积累,也埋下两个伏笔:一是”推理密度”的意识——榜单成绩说明小米重视知识问答,MiMo 把它升级为”推理特化”;二是端侧工程沉淀——量化、剪枝、投机解码,两年后以 MTP 和 RL 训练引擎的形态在 MiMo 里开花。序章不精彩,但每一页都是后文的草稿。

附:核心数据速查#

基本盘

项目数值
MiLM-6B 参数约 64 亿
C-Eval(zero-shot)60.2(同尺寸第一)
CMMLU(zero-shot)60.37(同尺寸第一)
MiLM-1.3B 参数约 13 亿(C-Eval 45.8 / CMMLU 50.79)
MiLM2 参数矩阵0.3B–30B 八档,云边端结合
MiLM2 能力提升10 大类平均 +45%(Mi-LLMBM2.0,170 个测试项)
MiLM2 最长窗口200K(一代为 4K)
端侧加速大小模型投机 / BiTA / Medusa;自研量化损失较高通方案降 78%

关键成绩

  • 2023.08 登 C-Eval / CMMLU 榜单;同月雷军定调”轻量化 + 本地部署”,13B 端侧 Demo 跑通
  • 2023 年底接入澎湃 OS,同期万卡 GPU 集群建成(初始约 6500 张卡)
  • 2024.05 通过大模型备案,获合规入场券
  • 2024.11.12 MiLM2 发布,参数覆盖 0.3B–30B;MiLM2-30B 用于 SU7 智能座舱(据官方/媒体口径)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

MiLM:端侧从军记
https://mizuki-eaf.pages.dev/posts/mimo/milm端侧从军记/
作者
无名之子
发布于
2026-07-22
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录