mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
3446 字
10 分钟
Kimi K2:万亿开源不崩
2026-07-20

Kimi K2 论文解读:一万亿参数开源,训练还不崩,月之暗面这次是真疯了#

论文:Kimi K2: Open Agentic LLM 作者:Moonshot AI(月之暗面) 这篇是2025年7月11日挂上Hugging Face的那篇,Apache 2.0协议,权重全开。核心主张一句话:万亿参数MoE不仅能开源,还能用一整套野路子让它训练全程不发散。它是国内第一个真正开源的万亿参数模型,在它之前这个俱乐部只有闭源玩家。前提是得先读过K1.5那篇——RL方法论的根在那儿。

一、架构:把稀疏度卷到别人不敢想的地步#

1. 基本盘#

K2是个61层的**MoE(Mixture of Experts,专家混合)模型,总参数1.04万亿,但每个token只激活约32.6B。384个路由专家里只选8个干活,外加1个共享专家兜底,稀疏度(总专家数除以激活专家数)干到了48。注意力走MLA(Multi-head Latent Attention,多头潜在注意力)**路线,64个头,全部61层里只有1层是dense层。

打个比方:传统dense模型像一家全员必须同时打卡的公司,K2更像一座有384个专科医生的医院——每个病人只挂8个最对口的科室,医院可以无限扩建,但单次问诊成本几乎不变。

2. 跟DeepSeek-V3掰手腕#

最扎眼的对比:总参数比V3多54%,激活参数反而少13%,专家数量多50%,注意力头数砍半,dense层从3层压到1层。说白了就是用更大的”知识仓库”配更小的”计算开销”,一次彻底的不对称扩张。

3. 稀疏度本身就是一条scaling law#

但K2真正猛的地方不是把稀疏度做到48这个数字,而是用实验证明了:稀疏度本身可以当饭吃。团队固定激活参数和算力,系统扫描稀疏度,发现提高稀疏度能持续降loss——达到验证loss 1.5时,稀疏度48相比8、16、32,分别省了约1.69倍、1.39倍、1.15倍的FLOPs。

这不是工程上的权宜之计,这是一条跟Chinchilla定律平行的新scaling维度。算力锁死的前提下,稀疏度就是可以兑换性能的硬通货。这个发现直接给后来K3的更大规模稀疏化铺好了理论地基。


二、MuonClip:让一匹疯马跑起来还不翻车#

1. 毛病出在哪#

稀疏度上去了,训练稳定性就是悬在头顶的刀。K2用的底座优化器是Muon——通过对更新矩阵做正交化(Newton-Schulz迭代),让梯度各方向”步长均等”,效率碾压AdamW。但团队在万亿规模MoE上发现了一个致命副作用:注意力logit会不受控地膨胀。

原因很直白:Muon的正交化天然倾向于增大权重矩阵的谱范数,Q/K投影权重范数一涨,注意力logit就跟着飙。不加约束的话,logit可以冲到1000以上——一旦爆炸,softmax输出趋近one-hot,注意力退化成”只看一个位置”,梯度消失,训练随时发散。

2. QK-Clip:电子限速器#

QK-Clip的机制很克制:实时监测每个注意力头的最大logit,一旦超过阈值tau=100,就在参数更新后对该头的Q/K投影权重做一次缩放,把logit压回安全区。

打个比方:Muon是一匹马力极强的赛马,QK-Clip不是换一匹慢马,而是装了一套只在超速时介入的电子限速器——平时完全不影响加速,只在失控边缘拉一把。不改变优化方向,只在越界时踩一脚刹车。

3. 数据说话#

前70k步有12.7%的注意力头触发过clip,说明风险是真实存在的,不是杞人忧天。70k步之后,所有头的logit都稳在100以下。整个训练过程逐步loss没有出现任何异常尖峰。稳如老狗。

MuonClip把”换用更激进优化器”从一个高风险赌注变成了可控的工程选项。它证明稳定性问题可以用局部、低侵入的机制解决,不必退回保守的AdamW——这给整个行业在万亿规模上启用Muon类优化器扫清了最大的心理障碍。


三、预训练:15.5万亿token的马拉松,全程没翻车#

K2在H800集群上吃掉了15.5T tokens,全局批大小约67M tokens,采用**WSD(Warmup-Stable-Decay)**调度:前10T tokens学习率恒定在2e-4,后5.5T余弦衰减到2e-5,最后退火阶段把上下文扩展到128k。并行策略是16路流水线并行、16路专家并行加ZeRO-1,激活值用FP8存储。

两个细节体现工程判断:WSD调度的”稳定期”可以无限延长,中途任何时候都能分叉出退火实验,比传统余弦调度灵活得多;FP8激活存储是万亿参数训练能塞进显存的关键trick——精度损失可忽略,最吃显存的中间状态直接压缩一半。

论文特别强调的一点:15.5T tokens全程无重大事故。这本身就是对MuonClip和整套并行方案最硬的背书。没有发明新理论,展示的是”把已知最佳实践全部做对”的系统能力。


四、数据工程:改写比重读有效,反直觉但真实#

1. 怎么改的#

K2团队对高质量知识语料做了分块自回归改写——把一段百科知识用模型重新表述为不同风格和结构,再加入保真校验(用问答对验证改写后文本是否仍包含原始事实)确保信息不丢失。数学材料被改写成”学习笔记”风格(带推理过程和自我提问),统一译成英文匹配模型主要训练语言。

2. 对照实验#

SimpleQA上的数据很说明问题:原始wiki数据训练10个epoch,得分23.76;10种改写版本各训练1个epoch,得分28.94。总token量相同,后者高出5分还多。

说白了就是:重复阅读同一段文字,边际收益递减极快;但每次”阅读”换一个视角、一种结构,模型被迫从不同角度重建同一份知识表征,记忆反而更牢固。这是用数据质量的杠杆撬动算力效率——对预算有限的团队,这比无脑堆数据聪明太多。


五、后训练:先给模型”双手”,再教它”干活”#

1. 工具生态#

K2的野心不在benchmark,在Agent。后训练第一步是大规模SFT,核心是工具生态。真实MCP工具3000多个(主要来自GitHub生态),合成工具20000多个(层级化领域生成+领域演化构造)。t-SNE可视化显示,真实工具和合成工具的覆盖区域互补而非重叠——合成数据不是注水,是实打实填补了真实工具分布的空白区。

2. RL:覆盖面极广#

第二步是RL,覆盖数学、STEM、逻辑、编码、软件工程、安全。奖励设计分而治之:可验证任务(代码、数学)用可验证奖励环境,对错一目了然;开放任务用self-critique rubric reward,让模型依据评分准则自我批判。还有预算控制、PTX loss混合防止语言能力退化、温度衰减逐步收敛。

3. 训练/推理共置:一万并发环境#

支撑这套RL的是一套训练/推理共置架构。传统做法是训练集群和推理集群分离,参数通过存储中转,延迟高、带宽贵。K2把两者放同一集群,用checkpoint engine做参数同步,一次完整模型更新小于30秒——rollout用的策略和正在训练的策略之间滞后被压到极小,on-policy程度大幅提高。

软件工程环境直接接入真实GitHub PR和issues、单元测试、Kubernetes沙箱,支持10000以上并发环境同时运行。一万并发什么概念?相当于同时有一万个”实习生”在不同代码仓库里做任务,模型每一步都从真实反馈中学习。网络会超时、测试会失败、PR会被reject——这不是过家家,这是工业级Agent训练。


六、成绩单#

BenchmarkKimi K2
SWE-bench Verified(单次)65.8
SWE-bench Verified(多次)71.6
AIME 202549.5
GPQA-Diamond75.1
MMLU89.5
LiveCodeBench v653.7

客观说,数学成绩(AIME 49.5)跟同期顶级推理模型还有差距,这是”重Agent、轻奥赛”路线选择的直接体现。但在软件工程这条线上,65.8/71.6的SWE-bench让它成为当时最强开源Agent模型,没有之一。


收尾:我的一点看法#

我最服的是MuonClip这个设计。不是因为它多复杂——恰恰相反,它简单到让人怀疑”这就行了?“。但正是这种克制让它能被任何人复用。你不需要推翻Muon,不需要重新设计架构,只需要在越界时踩一脚刹车。这种”最小侵入解决最大风险”的工程哲学,比任何花哨的新优化器都更有行业价值。

当然也要泼盆冷水。K2的数学和纯推理能力确实不是第一梯队,AIME 49.5跟o3、R1那些专门卷推理的模型比还有明显差距。论文对此很诚实,但”路线选择”这个解释多少有点自我安慰的意思——如果稀疏度scaling law真那么强,为什么推理任务上没能兑现?这个问题论文没有正面回答。

把K2放在Kimi的技术路线里看,它的位置非常清晰:承接K1.5的RL方法论(self-critique、可验证奖励这些根都在K1.5),开启了K2.5/K3的MoE+Agent路线。从K2开始,月之暗面的叙事彻底从”长上下文”转向了”稀疏+工具”。读懂K2,就读懂了Kimi后半程的全部技术选择。

最后说一句:万亿参数、Apache 2.0、训练全程无事故。这三件事放在一起,在2025年7月的时间点上是独一份的。月之暗面这次确实把门槛从”参数本身”搬到了”系统能力”上——稀疏度的理论勇气、优化器的稳定性工程、把真实世界搬进训练循环的基础设施。这三件事,他们全做对了。


附:核心数据速查#

模型架构#

参数数值
总参数量1.04万亿
每token激活参数~32.6B
层数61(含1层dense)
路由专家数384
每token激活专家数8 + 1共享
稀疏度48
注意力头数64(MLA)

与DeepSeek-V3对比#

维度K2 vs V3
总参数+54%
激活参数-13%
专家数量+50%
注意力头数-50%
Dense层数3 → 1

预训练配置#

参数数值
训练数据量15.5T tokens
硬件H800集群
全局批大小~67M tokens
学习率(稳定期)2e-4
学习率(衰减终点)2e-5
并行策略16路PP + 16路EP + ZeRO-1
激活存储精度FP8
退火上下文长度128k

后训练规模#

参数数值
真实MCP工具3000+
合成工具20000+
并发RL环境10000+
模型同步延迟<30秒
QK-Clip阈值tau=100
前70k步触发clip的头比例12.7%

关键概念清单#

术语英文一句话解释
MoEMixture of Experts大量专家只激活少数,用稀疏换效率
MLAMulti-head Latent Attention压缩KV缓存的注意力机制
Muon-基于正交化的优化器,效率高于AdamW
QK-Clip-监测注意力logit并在越界时缩放Q/K权重
MuonClip-Muon + QK-Clip的组合方案
WSDWarmup-Stable-Decay预热-恒定-衰减的学习率调度
稀疏度Sparsity总专家数除以激活专家数
SFTSupervised Fine-Tuning有监督微调
RLReinforcement Learning强化学习
MCPModel Context Protocol模型工具调用协议
Newton-Schulz迭代-矩阵正交化的数值方法
谱范数Spectral Norm矩阵最大奇异值,衡量权重”膨胀程度”
ZeRO-1-优化器状态分片以节省显存
PTX lossPre-Training loss预训练loss混合防止能力退化
Self-critique rubric reward-模型依据评分准则自我打分的奖励机制
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Kimi K2:万亿开源不崩
https://mizuki-eaf.pages.dev/posts/kimi/kimi-k2万亿开源不崩/
作者
无名之子
发布于
2026-07-20
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录