mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4916 字
14 分钟
Kimi K3:三万亿白送开源
2026-07-28

Kimi K3 论文解读:三万亿开源白送,全注意力直接下岗#

论文:Kimi K3 Technical Report 作者:Moonshot AI(月之暗面) 2026年7月28号深夜,月之暗面直接往Hugging Face上扔了一颗核弹。全球第一个开源三万亿参数模型,2.8T参数、896个路由专家、100万token上下文,权重文件1.56TB,随便下。最狠的不是规模——是它把标准Transformer的全注意力层干掉了四分之三,换上一套叫KDA的线性注意力,然后告诉你:效果不降反升。顺带手还把三件Infra核心武器一并开源。这不是发论文,这是掀桌子。

一、七年磨一剑:从124M到2.8T的长上下文信仰#

1. 一条从未转弯的路#

回看月之暗面的技术线,就一个字:长。2019年杨植麟在CMU搞XLNet的时候就在琢磨怎么让模型吃更长的序列;2023年Kimi拿20万字上下文窗口把业界震了一下;2024年K2用MoE把参数怼到万亿级;2026年K3直接把上下文拉到100万token,参数规模七年翻了22580倍。

这不是无脑堆参数。K3的核心命题特别朴素:当你需要模型真正”读完”一百万个token然后在此基础上推理,标准Transformer那个O(n^2)的注意力就是物理定律级别的瓶颈。一百万token意味着一万亿次注意力计算,GPU再猛也扛不住。

K3的回答特别刚:既然全注意力是瓶颈,那就改掉它。


二、KDA:把全注意力扔进垃圾桶的勇气#

1. 线性注意力到底在干嘛#

K3最炸裂的架构决策:用**KDA(Kimi Delta Attention)**替换了四分之三的注意力层。

KDA继承自Gated DeltaNet,本质是线性注意力。标准Transformer的注意力要求每个token跟序列里所有其他token算相关性,复杂度O(n^2)。KDA完全换了个思路:把Key和Value压成一个固定尺寸的”记忆矩阵”,每来一个新token只更新这个矩阵,复杂度直接降到O(n)。

打个比方:标准注意力像每翻一页都把整本书重新扫一遍;KDA像边读边做笔记,笔记本大小固定,翻到任何一页只看笔记就够了。

2. FlashKDA:解决串行依赖的致命伤#

线性注意力有个固有缺陷:逐token串行依赖。每个token的状态更新得等前一个token算完,天然跟GPU并行犯冲。

K3的解法是FlashKDA——把token序列切成chunk,块内并行计算,块间传递压缩状态。在英伟达H20上,prefill速度相对flash-linear-attention基线提升1.72到2.22倍。串行瓶颈,硬生生被工程手段掰成了并行。

3. 两个补偿机制:线性注意力不是孤军奋战#

为了弥补线性注意力在信息保留上的损失,K3加了两道保险:

第一,保留四分之一的**Gated MLA(Multi-head Latent Attention)**层,专门处理需要精确全局检索的任务。3<1的混合比例>,线性层干粗活,MLA层干细活。

第二,更精巧的设计:块级注意力残差(Block AttnRes)。传统残差连接逐层传递,信息到深层容易稀释成渣。AttnRes把网络切成约8个块,块内用普通残差,块间用注意力机制选择性继承信息——相当于给模型装了个跨楼层电梯,底层的关键信息可以直达顶层,不用一层层爬楼梯。

结论很硬:四分之三的层跑O(n)复杂度,模型质量不降反升。百万级乃至千万级上下文的工程可行性大门,被K3一脚踹开了。


三、896选16:极端稀疏MoE怎么训不崩#

1. 高稀疏是承诺也是诅咒#

2.8万亿参数,每个token只激活16个专家。98.2%的参数在任何一次前向传播中都是沉默的。

高稀疏是MoE的核心承诺:用Dense模型十分之一的计算量,拿到接近甚至超越Dense的能力。但高稀疏也是MoE的核心诅咒——896个专家里只有16个被激活,负载稍有不均就是部分专家过载、部分专家饿死,训练loss曲线随时崩给你看。

2. Stable LatentMoE路由:两板斧#

K3的解法是Stable LatentMoE路由,两个关键组件:

SiTU-GLU激活函数。传统路由用softmax分配token,梯度在极端分布下动不动就爆炸或消失。SiTU-GLU(Sigmoid-Transformed Unit with Gated Linear Unit)用sigmoid替代softmax的归一化,配合门控线性单元的乘法结构,让路由梯度在稀疏条件下依然平滑。

Quantile Balancing负载均衡。传统auxiliary loss强制所有专家接收等量token,但这违背自然语言的事实——某些专家天然就该更忙。Quantile Balancing不追求绝对均匀,只约束负载分布的分位数:只要没有专家落入极端过载或极端空闲的尾部,就不施加惩罚。不是消灭不平等,是消灭极端不平等。

896选16的极端稀疏比,K3训练全程稳如老狗。这本身就是工程成就。


四、MoonViT-V2:视觉编码器从对比学习毕业了#

1. 省掉中间商#

K3原生支持视觉理解,但它的视觉编码器MoonViT-V2走了一条极少有人走的路:完全用next-token prediction从头训练,不依赖任何对比学习预训练。

主流做法是先拿对比学习(CLIP那套)训一个视觉编码器,让它学会”这张图和这段文字说的是同一件事”,再嫁接到语言模型上。相当于先教一个人”看图识字”,再教他”阅读理解”,中间总有个缝合的gap。

MoonViT-V2的逻辑是:既然最终目标是让视觉信息以token形式参与自回归生成,那为什么不一开始就在同一个目标函数下训练?省掉对比预训练这个中间商,视觉表征和语言表征从第一天就在同一个语义空间里生长。代价是训练成本更高,没有预训练权重可以复用——但对月之暗面这个体量,这trade-off完全可以接受。


五、Infra三件套:开源的不只是权重#

1. MoonEP:专家并行的通信噩梦终结者#

896个专家分布在多张GPU上,每个token路由到不同GPU上的不同专家,all-to-all通信量巨大。更棘手的是负载不均:某些专家被频繁调用,对应GPU成瓶颈,其他GPU只能干等。

MoonEP的策略:给每张GPU分配固定数量的token槽位(S x K),对高负载专家进行有上限的冗余复制。论文举例:100个专家分布在20张GPU上时,每张GPU最多复制5个冗余专家。不是完美最优解,是工程上可快速求解的近似方案——够用,能跑,不拖后腿。

2. FlashKDA:不只是快#

前面提过FlashKDA的chunk化并行。这里补充它的核心机制KCP(Kimi Chunk Parallelism)——将可独立求解的状态更新方程拆分到多GPU并行计算,再合并出完整历史状态。没有FlashKDA,KDA的串行依赖就是致命缺陷;有了它,线性注意力才真正能上生产。

3. AgentEnv:给Agent训练造一个时间机器#

AgentEnv是与KVCache.ai合作的Agent训练沙箱,提供高保真、强隔离的执行环境,支持快照(snapshot)、恢复(restore)和分叉(fork)。

翻译成人话:训练Agent时可以从任意执行状态回滚,分叉出多条探索路径,选最优路径继续。本质上是为强化学习中的树搜索提供了基础设施级别的支撑。RL探索需要海量trial-and-error,fork机制让并行探索成本直接打骨折。

开源权重不公开Infra,等于给你一辆车但不给发动机图纸。月之暗面把三件武器一并公开,信号很明确:不担心被复制。真正的壁垒不在单点技术,在系统集成的经验和长期调优的积累。正如36氪那篇报道的标题——“Kimi K3公开了不少秘密,但最重要的Infra却很难抄”。


六、后训练:百万token上的强化学习#

1. 三条线并进#

K3后训练围绕三个方向:通用推理、通用Agent、编程Agent。

具体做法是大规模任务合成——不从互联网爬现成题目,用模型自身生成训练任务,形成自我进化的数据飞轮。配合近20个内部评测集迭代评估。

2. 百万token RL基建#

最值得注意的是:K3支持百万token上下文的RL训练。Agent可以在一个完整的、长达百万token的交互轨迹上做端到端策略优化,不用被截断成短片段分别训练。AgentEnv的快照和分叉能力在这里是刚需——没有它,百万token级别的RL探索成本根本不可控。


七、Benchmark:开源模型第一次摸到天花板#

1. 核心战绩#

评测集Kimi K3Claude Fable 5GPT-5.6 Sol备注
SWE Marathon第一--编程
Program Bench第一--编程
Terminal Bench 2.188.3-~89逼近GPT-5.6 Sol
FrontierSWE81.2第一-仅次Fable 5
BrowseComp91.2--Agent/知识
Automation Bench第一--Agent
SpreadsheetBench 2第一--Agent
OmniDocBench91.1--视觉文档
CharXiv较强--视觉图表
内部GPU内核优化接近Fable 5最高低于K3超Opus 4.8/GPT-5.5
内部知识工作(深度思考)超GPT-5.5/Opus 4.8-低于K3通用推理/文档/金融

2. 三个关键判断#

编程是K3最猛的维度。SWE Marathon和Program Bench双料第一,Terminal Bench 2.1的88.3跟GPT-5.6 Sol几乎贴脸。Cognition(Devin母公司)的原话:FrontierCode 1.1上,Kimi K3是他们测过的”首款性能逼近前沿水准的开源模型”。

Agent能力全面开花。BrowseComp 91.2、Automation Bench和SpreadsheetBench 2双冠——K3不只是”会写代码”,是”会完成任务”。

跟Claude Fable 5仍有差距,但在收窄。FrontierSWE、GDPval-AA v2、APEX-Agents上Fable 5还是领先。但K3是开源的——任何团队都可以在这个基础上继续迭代,这个差距的意义完全不同。


八、成本:吊打级别的性价比#

1. 实测数据#

一个游戏设计任务的实测成本对比:

模型质量评分单次成本
Kimi K39.5/10$0.030
Claude Fable 57.5/10$0.38
GPT-5.6 Sol7.0/10$0.11

最扎眼的数据:K3成本是Fable 5的十二分之一,GPT-5.6 Sol的三分之一,质量评分反而最高。MoE架构的天然优势——2.8万亿参数每次只激活约500亿,推理FLOPs远低于同规模Dense模型。官方宣称推理成本仅为GPT-5.6 Sol的一半,特定任务上差距拉到10倍以上。


九、应用案例:从格斗游戏到引力波#

1. 一次生成完整3D游戏#

K3 Max模式一次生成了一个完整的3D横版格斗游戏——低多边形地图、5种可选角色、5种敌人AI,代码无报错直接运行。海外开发者盲测中,K3方案的节奏感和完成度被评为最佳。

2. 48小时自主设计芯片#

更硬核的:K3在开源EDA工具和Nangate 45nm工艺库上连续自主运行48小时,完成芯片搭建、优化与验证全流程。不是”辅助人类设计芯片”,是Agent独立完成从RTL到验证的闭环。

3. 引力波分析与造工具#

科研方向,K3分析了LIGO的391个GWTC-5引力波事件,调用20多个并发子智能体并行处理,综合10多篇论文,产出7张科学可视化图和2张数据表。

此外K3还从零实现了MiniTriton编译器——一个GPU内核编程工具,部分场景性能超过现有工具链。这解释了为什么K3在内部GPU内核优化评测上能逼近Fable 5:它不只是会用工具,它能造工具。


十、生态:Day 0适配的广度#

1. 开源当天的响应#

Nebius、Baseten、Fireworks三家推理平台完成Day 0适配。华为昇腾CANN对MXFP4量化提供Day 0原生支持,覆盖950PR/DT与Atlas A3系列。趋境科技基于SGLang完成昇腾910C超节点首日适配并开源。Cognition将K3接入Devin桌面端与CLI。

Hugging Face上,K3权重页面30分钟内超过4000个赞。Nebius的评价:“首个达到前沿性能水平的开放权重模型。“


收尾:我的一点看法#

KDA这个架构决策,说实话,需要极大的勇气。全注意力是Transformer的命根子,从2017年Attention Is All You Need开始,整个行业默认”注意力就该是二次复杂度”。月之暗面说不是。他们从2019年XLNet时代就开始押注线性注意力,DeltaNet、Gated DeltaNet在学术界躺了好几年,没人在万亿规模上真正验证过。K3是第一次有人拿2.8万亿参数、100万token上下文来证明:四分之三的层不需要全注意力,模型照样能打。七年等一个架构假设被验证,这种耐心本身就是竞争力。

Infra三件套的开源,战略价值可能比权重本身更大。MoonEP、FlashKDA、AgentEnv——这三样东西是让K3能跑起来的发动机。公开它们等于告诉整个行业:我们不靠信息差赚钱,我们靠迭代速度。你抄完这一版,下一版已经出来了。36氪说得对,最重要的Infra很难抄——不是因为代码保密,而是因为系统集成的know-how和踩坑经验没法从论文里复制。

局限也要说。跟Claude Fable 5在FrontierSWE等顶级编程评测上仍有差距;线性注意力在需要精确长距离检索的任务上天然弱于全注意力,3<1的混合比例是工程妥协而非理论最优>;MoonViT-V2从头训练视觉编码器的成本不是所有团队都能承受的。K3不是完美的,但它把”开源模型能不能摸到前沿”这个问题的答案从”不能”变成了”能,而且成本只要零头”。

放在七年长上下文路线里看,K3是终极表达而非终点。2019年的XLNet思考怎么处理更长序列,2023年的Kimi用20万字窗口证明市场需求存在,2024年的K2用MoE解决规模问题,2026年的K3用KDA解决复杂度问题。每一步都在回答同一个问题:怎么让模型真正”读完”并”理解”海量信息。K3给出的答案是:扔掉全注意力的拐杖,线性复杂度照样能走到前沿。下一个七年,上下文窗口可能是千万级、亿级——而K3证明的那条路,大概率就是通往那里的路。


附:核心数据速查#

基本盘#

项目数据
总参数量2.8万亿(2.8T)
路由专家数896
每token激活专家数16
激活参数占比~1.8%(约500亿)
上下文窗口100万token
权重文件大小1.56TB(Hugging Face)
开源日期2026年7月28日
参数七年增长倍数22580倍(124M → 2.8T)

架构创新#

技术核心机制关键数据
KDA(Kimi Delta Attention)线性注意力,固定记忆矩阵,O(n)复杂度替换3/4注意力层
Gated MLA保留全局精确检索能力占1/4注意力层
FlashKDAchunk化并行 + KCP多GPU拆分H20上prefill提速1.72-2.22x
Block AttnRes块间注意力残差,跨块信息直达约8个块
SiTU-GLUsigmoid替代softmax归一化 + 门控乘法路由梯度平滑
Quantile Balancing分位数约束替代绝对均匀消灭极端不均衡
MoonViT-V2纯next-token prediction训练视觉编码器无对比学习预训练

Benchmark核心战绩#

评测集K3表现对比
SWE Marathon第一编程
Program Bench第一编程
Terminal Bench 2.188.3逼近GPT-5.6 Sol(~89)
FrontierSWE81.2仅次Claude Fable 5
BrowseComp91.2Agent/知识
Automation Bench第一Agent
SpreadsheetBench 2第一Agent
OmniDocBench91.1视觉文档

成本对比(游戏设计任务实测)#

模型质量评分单次成本相对K3倍数
Kimi K39.5/10$0.0301x
GPT-5.6 Sol7.0/10$0.113.7x
Claude Fable 57.5/10$0.3812.7x

生态适配#

平台/厂商适配内容
Nebius / Baseten / FireworksDay 0推理适配
华为昇腾CANNMXFP4量化Day 0原生支持(950PR/DT、Atlas A3)
趋境科技SGLang + 昇腾910C超节点首日适配(开源)
Cognition(Devin)桌面端 + CLI接入
Hugging Face30分钟内4000+赞

关键概念清单#

  • KDA(Kimi Delta Attention):K3核心架构创新,线性注意力,O(n)复杂度替换O(n^2)全注意力
  • FlashKDA:KDA的高性能算子实现,chunk并行 + KCP多GPU拆分
  • KCP(Kimi Chunk Parallelism):将状态更新方程拆分到多GPU并行计算
  • Gated MLA(Multi-head Latent Attention):保留的1/4全注意力层,处理精确全局检索
  • Block AttnRes:块级注意力残差,块间用注意力选择性继承信息
  • Stable LatentMoE路由:SiTU-GLU + Quantile Balancing,保证896选16训练稳定
  • MoonEP:专家并行通信优化,固定槽位 + 有上限冗余复制
  • AgentEnv:Agent训练沙箱,支持snapshot/restore/fork,与KVCache.ai合作
  • MoonViT-V2:纯自回归训练的视觉编码器,无对比学习预训练
  • MiniTriton:K3从零实现的GPU内核编程编译器

参考来源:Kimi K3技术报告(2026)、Hugging Face模型页面(moonshotai/Kimi-K3)、36氪深度报道、Cognition/Nebius官方评价。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Kimi K3:三万亿白送开源
https://mizuki-eaf.pages.dev/posts/kimi/kimi-k3三万亿白送开源/
作者
无名之子
发布于
2026-07-28
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录