Kimi K3 论文解读:三万亿开源白送,全注意力直接下岗
论文:Kimi K3 Technical Report 作者:Moonshot AI(月之暗面) 2026年7月28号深夜,月之暗面直接往Hugging Face上扔了一颗核弹。全球第一个开源三万亿参数模型,2.8T参数、896个路由专家、100万token上下文,权重文件1.56TB,随便下。最狠的不是规模——是它把标准Transformer的全注意力层干掉了四分之三,换上一套叫KDA的线性注意力,然后告诉你:效果不降反升。顺带手还把三件Infra核心武器一并开源。这不是发论文,这是掀桌子。
一、七年磨一剑:从124M到2.8T的长上下文信仰
1. 一条从未转弯的路
回看月之暗面的技术线,就一个字:长。2019年杨植麟在CMU搞XLNet的时候就在琢磨怎么让模型吃更长的序列;2023年Kimi拿20万字上下文窗口把业界震了一下;2024年K2用MoE把参数怼到万亿级;2026年K3直接把上下文拉到100万token,参数规模七年翻了22580倍。
这不是无脑堆参数。K3的核心命题特别朴素:当你需要模型真正”读完”一百万个token然后在此基础上推理,标准Transformer那个O(n^2)的注意力就是物理定律级别的瓶颈。一百万token意味着一万亿次注意力计算,GPU再猛也扛不住。
K3的回答特别刚:既然全注意力是瓶颈,那就改掉它。
二、KDA:把全注意力扔进垃圾桶的勇气
1. 线性注意力到底在干嘛
K3最炸裂的架构决策:用**KDA(Kimi Delta Attention)**替换了四分之三的注意力层。
KDA继承自Gated DeltaNet,本质是线性注意力。标准Transformer的注意力要求每个token跟序列里所有其他token算相关性,复杂度O(n^2)。KDA完全换了个思路:把Key和Value压成一个固定尺寸的”记忆矩阵”,每来一个新token只更新这个矩阵,复杂度直接降到O(n)。
打个比方:标准注意力像每翻一页都把整本书重新扫一遍;KDA像边读边做笔记,笔记本大小固定,翻到任何一页只看笔记就够了。
2. FlashKDA:解决串行依赖的致命伤
线性注意力有个固有缺陷:逐token串行依赖。每个token的状态更新得等前一个token算完,天然跟GPU并行犯冲。
K3的解法是FlashKDA——把token序列切成chunk,块内并行计算,块间传递压缩状态。在英伟达H20上,prefill速度相对flash-linear-attention基线提升1.72到2.22倍。串行瓶颈,硬生生被工程手段掰成了并行。
3. 两个补偿机制:线性注意力不是孤军奋战
为了弥补线性注意力在信息保留上的损失,K3加了两道保险:
第一,保留四分之一的**Gated MLA(Multi-head Latent Attention)**层,专门处理需要精确全局检索的任务。3<1的混合比例>1的混合比例>,线性层干粗活,MLA层干细活。
第二,更精巧的设计:块级注意力残差(Block AttnRes)。传统残差连接逐层传递,信息到深层容易稀释成渣。AttnRes把网络切成约8个块,块内用普通残差,块间用注意力机制选择性继承信息——相当于给模型装了个跨楼层电梯,底层的关键信息可以直达顶层,不用一层层爬楼梯。
结论很硬:四分之三的层跑O(n)复杂度,模型质量不降反升。百万级乃至千万级上下文的工程可行性大门,被K3一脚踹开了。
三、896选16:极端稀疏MoE怎么训不崩
1. 高稀疏是承诺也是诅咒
2.8万亿参数,每个token只激活16个专家。98.2%的参数在任何一次前向传播中都是沉默的。
高稀疏是MoE的核心承诺:用Dense模型十分之一的计算量,拿到接近甚至超越Dense的能力。但高稀疏也是MoE的核心诅咒——896个专家里只有16个被激活,负载稍有不均就是部分专家过载、部分专家饿死,训练loss曲线随时崩给你看。
2. Stable LatentMoE路由:两板斧
K3的解法是Stable LatentMoE路由,两个关键组件:
SiTU-GLU激活函数。传统路由用softmax分配token,梯度在极端分布下动不动就爆炸或消失。SiTU-GLU(Sigmoid-Transformed Unit with Gated Linear Unit)用sigmoid替代softmax的归一化,配合门控线性单元的乘法结构,让路由梯度在稀疏条件下依然平滑。
Quantile Balancing负载均衡。传统auxiliary loss强制所有专家接收等量token,但这违背自然语言的事实——某些专家天然就该更忙。Quantile Balancing不追求绝对均匀,只约束负载分布的分位数:只要没有专家落入极端过载或极端空闲的尾部,就不施加惩罚。不是消灭不平等,是消灭极端不平等。
896选16的极端稀疏比,K3训练全程稳如老狗。这本身就是工程成就。
四、MoonViT-V2:视觉编码器从对比学习毕业了
1. 省掉中间商
K3原生支持视觉理解,但它的视觉编码器MoonViT-V2走了一条极少有人走的路:完全用next-token prediction从头训练,不依赖任何对比学习预训练。
主流做法是先拿对比学习(CLIP那套)训一个视觉编码器,让它学会”这张图和这段文字说的是同一件事”,再嫁接到语言模型上。相当于先教一个人”看图识字”,再教他”阅读理解”,中间总有个缝合的gap。
MoonViT-V2的逻辑是:既然最终目标是让视觉信息以token形式参与自回归生成,那为什么不一开始就在同一个目标函数下训练?省掉对比预训练这个中间商,视觉表征和语言表征从第一天就在同一个语义空间里生长。代价是训练成本更高,没有预训练权重可以复用——但对月之暗面这个体量,这trade-off完全可以接受。
五、Infra三件套:开源的不只是权重
1. MoonEP:专家并行的通信噩梦终结者
896个专家分布在多张GPU上,每个token路由到不同GPU上的不同专家,all-to-all通信量巨大。更棘手的是负载不均:某些专家被频繁调用,对应GPU成瓶颈,其他GPU只能干等。
MoonEP的策略:给每张GPU分配固定数量的token槽位(S x K),对高负载专家进行有上限的冗余复制。论文举例:100个专家分布在20张GPU上时,每张GPU最多复制5个冗余专家。不是完美最优解,是工程上可快速求解的近似方案——够用,能跑,不拖后腿。
2. FlashKDA:不只是快
前面提过FlashKDA的chunk化并行。这里补充它的核心机制KCP(Kimi Chunk Parallelism)——将可独立求解的状态更新方程拆分到多GPU并行计算,再合并出完整历史状态。没有FlashKDA,KDA的串行依赖就是致命缺陷;有了它,线性注意力才真正能上生产。
3. AgentEnv:给Agent训练造一个时间机器
AgentEnv是与KVCache.ai合作的Agent训练沙箱,提供高保真、强隔离的执行环境,支持快照(snapshot)、恢复(restore)和分叉(fork)。
翻译成人话:训练Agent时可以从任意执行状态回滚,分叉出多条探索路径,选最优路径继续。本质上是为强化学习中的树搜索提供了基础设施级别的支撑。RL探索需要海量trial-and-error,fork机制让并行探索成本直接打骨折。
开源权重不公开Infra,等于给你一辆车但不给发动机图纸。月之暗面把三件武器一并公开,信号很明确:不担心被复制。真正的壁垒不在单点技术,在系统集成的经验和长期调优的积累。正如36氪那篇报道的标题——“Kimi K3公开了不少秘密,但最重要的Infra却很难抄”。
六、后训练:百万token上的强化学习
1. 三条线并进
K3后训练围绕三个方向:通用推理、通用Agent、编程Agent。
具体做法是大规模任务合成——不从互联网爬现成题目,用模型自身生成训练任务,形成自我进化的数据飞轮。配合近20个内部评测集迭代评估。
2. 百万token RL基建
最值得注意的是:K3支持百万token上下文的RL训练。Agent可以在一个完整的、长达百万token的交互轨迹上做端到端策略优化,不用被截断成短片段分别训练。AgentEnv的快照和分叉能力在这里是刚需——没有它,百万token级别的RL探索成本根本不可控。
七、Benchmark:开源模型第一次摸到天花板
1. 核心战绩
| 评测集 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 备注 |
|---|---|---|---|---|
| SWE Marathon | 第一 | - | - | 编程 |
| Program Bench | 第一 | - | - | 编程 |
| Terminal Bench 2.1 | 88.3 | - | ~89 | 逼近GPT-5.6 Sol |
| FrontierSWE | 81.2 | 第一 | - | 仅次Fable 5 |
| BrowseComp | 91.2 | - | - | Agent/知识 |
| Automation Bench | 第一 | - | - | Agent |
| SpreadsheetBench 2 | 第一 | - | - | Agent |
| OmniDocBench | 91.1 | - | - | 视觉文档 |
| CharXiv | 较强 | - | - | 视觉图表 |
| 内部GPU内核优化 | 接近Fable 5 | 最高 | 低于K3 | 超Opus 4.8/GPT-5.5 |
| 内部知识工作(深度思考) | 超GPT-5.5/Opus 4.8 | - | 低于K3 | 通用推理/文档/金融 |
2. 三个关键判断
编程是K3最猛的维度。SWE Marathon和Program Bench双料第一,Terminal Bench 2.1的88.3跟GPT-5.6 Sol几乎贴脸。Cognition(Devin母公司)的原话:FrontierCode 1.1上,Kimi K3是他们测过的”首款性能逼近前沿水准的开源模型”。
Agent能力全面开花。BrowseComp 91.2、Automation Bench和SpreadsheetBench 2双冠——K3不只是”会写代码”,是”会完成任务”。
跟Claude Fable 5仍有差距,但在收窄。FrontierSWE、GDPval-AA v2、APEX-Agents上Fable 5还是领先。但K3是开源的——任何团队都可以在这个基础上继续迭代,这个差距的意义完全不同。
八、成本:吊打级别的性价比
1. 实测数据
一个游戏设计任务的实测成本对比:
| 模型 | 质量评分 | 单次成本 |
|---|---|---|
| Kimi K3 | 9.5/10 | $0.030 |
| Claude Fable 5 | 7.5/10 | $0.38 |
| GPT-5.6 Sol | 7.0/10 | $0.11 |
最扎眼的数据:K3成本是Fable 5的十二分之一,GPT-5.6 Sol的三分之一,质量评分反而最高。MoE架构的天然优势——2.8万亿参数每次只激活约500亿,推理FLOPs远低于同规模Dense模型。官方宣称推理成本仅为GPT-5.6 Sol的一半,特定任务上差距拉到10倍以上。
九、应用案例:从格斗游戏到引力波
1. 一次生成完整3D游戏
K3 Max模式一次生成了一个完整的3D横版格斗游戏——低多边形地图、5种可选角色、5种敌人AI,代码无报错直接运行。海外开发者盲测中,K3方案的节奏感和完成度被评为最佳。
2. 48小时自主设计芯片
更硬核的:K3在开源EDA工具和Nangate 45nm工艺库上连续自主运行48小时,完成芯片搭建、优化与验证全流程。不是”辅助人类设计芯片”,是Agent独立完成从RTL到验证的闭环。
3. 引力波分析与造工具
科研方向,K3分析了LIGO的391个GWTC-5引力波事件,调用20多个并发子智能体并行处理,综合10多篇论文,产出7张科学可视化图和2张数据表。
此外K3还从零实现了MiniTriton编译器——一个GPU内核编程工具,部分场景性能超过现有工具链。这解释了为什么K3在内部GPU内核优化评测上能逼近Fable 5:它不只是会用工具,它能造工具。
十、生态:Day 0适配的广度
1. 开源当天的响应
Nebius、Baseten、Fireworks三家推理平台完成Day 0适配。华为昇腾CANN对MXFP4量化提供Day 0原生支持,覆盖950PR/DT与Atlas A3系列。趋境科技基于SGLang完成昇腾910C超节点首日适配并开源。Cognition将K3接入Devin桌面端与CLI。
Hugging Face上,K3权重页面30分钟内超过4000个赞。Nebius的评价:“首个达到前沿性能水平的开放权重模型。“
收尾:我的一点看法
KDA这个架构决策,说实话,需要极大的勇气。全注意力是Transformer的命根子,从2017年Attention Is All You Need开始,整个行业默认”注意力就该是二次复杂度”。月之暗面说不是。他们从2019年XLNet时代就开始押注线性注意力,DeltaNet、Gated DeltaNet在学术界躺了好几年,没人在万亿规模上真正验证过。K3是第一次有人拿2.8万亿参数、100万token上下文来证明:四分之三的层不需要全注意力,模型照样能打。七年等一个架构假设被验证,这种耐心本身就是竞争力。
Infra三件套的开源,战略价值可能比权重本身更大。MoonEP、FlashKDA、AgentEnv——这三样东西是让K3能跑起来的发动机。公开它们等于告诉整个行业:我们不靠信息差赚钱,我们靠迭代速度。你抄完这一版,下一版已经出来了。36氪说得对,最重要的Infra很难抄——不是因为代码保密,而是因为系统集成的know-how和踩坑经验没法从论文里复制。
局限也要说。跟Claude Fable 5在FrontierSWE等顶级编程评测上仍有差距;线性注意力在需要精确长距离检索的任务上天然弱于全注意力,3<1的混合比例是工程妥协而非理论最优>1的混合比例是工程妥协而非理论最优>;MoonViT-V2从头训练视觉编码器的成本不是所有团队都能承受的。K3不是完美的,但它把”开源模型能不能摸到前沿”这个问题的答案从”不能”变成了”能,而且成本只要零头”。
放在七年长上下文路线里看,K3是终极表达而非终点。2019年的XLNet思考怎么处理更长序列,2023年的Kimi用20万字窗口证明市场需求存在,2024年的K2用MoE解决规模问题,2026年的K3用KDA解决复杂度问题。每一步都在回答同一个问题:怎么让模型真正”读完”并”理解”海量信息。K3给出的答案是:扔掉全注意力的拐杖,线性复杂度照样能走到前沿。下一个七年,上下文窗口可能是千万级、亿级——而K3证明的那条路,大概率就是通往那里的路。
附:核心数据速查
基本盘
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8万亿(2.8T) |
| 路由专家数 | 896 |
| 每token激活专家数 | 16 |
| 激活参数占比 | ~1.8%(约500亿) |
| 上下文窗口 | 100万token |
| 权重文件大小 | 1.56TB(Hugging Face) |
| 开源日期 | 2026年7月28日 |
| 参数七年增长倍数 | 22580倍(124M → 2.8T) |
架构创新
| 技术 | 核心机制 | 关键数据 |
|---|---|---|
| KDA(Kimi Delta Attention) | 线性注意力,固定记忆矩阵,O(n)复杂度 | 替换3/4注意力层 |
| Gated MLA | 保留全局精确检索能力 | 占1/4注意力层 |
| FlashKDA | chunk化并行 + KCP多GPU拆分 | H20上prefill提速1.72-2.22x |
| Block AttnRes | 块间注意力残差,跨块信息直达 | 约8个块 |
| SiTU-GLU | sigmoid替代softmax归一化 + 门控乘法 | 路由梯度平滑 |
| Quantile Balancing | 分位数约束替代绝对均匀 | 消灭极端不均衡 |
| MoonViT-V2 | 纯next-token prediction训练视觉编码器 | 无对比学习预训练 |
Benchmark核心战绩
| 评测集 | K3表现 | 对比 |
|---|---|---|
| SWE Marathon | 第一 | 编程 |
| Program Bench | 第一 | 编程 |
| Terminal Bench 2.1 | 88.3 | 逼近GPT-5.6 Sol(~89) |
| FrontierSWE | 81.2 | 仅次Claude Fable 5 |
| BrowseComp | 91.2 | Agent/知识 |
| Automation Bench | 第一 | Agent |
| SpreadsheetBench 2 | 第一 | Agent |
| OmniDocBench | 91.1 | 视觉文档 |
成本对比(游戏设计任务实测)
| 模型 | 质量评分 | 单次成本 | 相对K3倍数 |
|---|---|---|---|
| Kimi K3 | 9.5/10 | $0.030 | 1x |
| GPT-5.6 Sol | 7.0/10 | $0.11 | 3.7x |
| Claude Fable 5 | 7.5/10 | $0.38 | 12.7x |
生态适配
| 平台/厂商 | 适配内容 |
|---|---|
| Nebius / Baseten / Fireworks | Day 0推理适配 |
| 华为昇腾CANN | MXFP4量化Day 0原生支持(950PR/DT、Atlas A3) |
| 趋境科技 | SGLang + 昇腾910C超节点首日适配(开源) |
| Cognition(Devin) | 桌面端 + CLI接入 |
| Hugging Face | 30分钟内4000+赞 |
关键概念清单
- KDA(Kimi Delta Attention):K3核心架构创新,线性注意力,O(n)复杂度替换O(n^2)全注意力
- FlashKDA:KDA的高性能算子实现,chunk并行 + KCP多GPU拆分
- KCP(Kimi Chunk Parallelism):将状态更新方程拆分到多GPU并行计算
- Gated MLA(Multi-head Latent Attention):保留的1/4全注意力层,处理精确全局检索
- Block AttnRes:块级注意力残差,块间用注意力选择性继承信息
- Stable LatentMoE路由:SiTU-GLU + Quantile Balancing,保证896选16训练稳定
- MoonEP:专家并行通信优化,固定槽位 + 有上限冗余复制
- AgentEnv:Agent训练沙箱,支持snapshot/restore/fork,与KVCache.ai合作
- MoonViT-V2:纯自回归训练的视觉编码器,无对比学习预训练
- MiniTriton:K3从零实现的GPU内核编程编译器
参考来源:Kimi K3技术报告(2026)、Hugging Face模型页面(moonshotai/Kimi-K3)、36氪深度报道、Cognition/Nebius官方评价。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





