mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
6140 字
17 分钟
kimi-evolution-history
2026-08-02

从200万字到2.8万亿参数:Kimi 三年技术进化史#

一个追了七年长上下文的90后,如何把一家成立仅三年的公司送上全球开源模型之巅。

引言#

2026年7月28日深夜,月之暗面将 Kimi K3 的模型权重上传至 Hugging Face。2.8万亿参数、100万 token 上下文、自研 KDA 注意力架构——这是全球首个开源的三万亿级模型。30分钟内,它登顶了开源社区趋势榜。马斯克两度点赞,黄仁勋公开表态支持,华为昇腾宣布 Day 0 原生适配。

很少有人记得,三年前的 Kimi,只是一个”能读200万字小说”的聊天机器人。

我花了两周时间,把月之暗面从2019年的学术论文到2026年的技术报告全部梳理了一遍。从 Transformer-XL 到 KDA,从 moonshot-v1-8k 到 K3,从3亿美元天使轮到500亿美元 Pre-IPO 估值——这条路线不是简单的参数膨胀史,而是一个关于”长上下文信仰”如何一步步演化为架构范式、训练方法论和工程系统的完整故事。

本文以月之暗面历年公开论文、技术报告和关键产品版本为主干,试图还原 Kimi 的技术蜕变脉络。


第一章 伏笔:一个追了七年长上下文的人(2019—2022)#

1.1 Transformer-XL:长上下文的起点#

2019年,还在卡内基梅隆大学读博的杨植麟,以第一作者身份发表了 Transformer-XL。这篇论文解决的核心问题很朴素:标准 Transformer 的上下文窗口是固定的,超出窗口的信息被粗暴截断。Transformer-XL 引入段级循环机制和相对位置编码,让模型能够”记住”前一个片段的信息,在不增加计算量的前提下将有效上下文长度提升数倍。

这篇论文在当时并未引起大众关注,但它确立了一个技术信仰:长上下文不是锦上添花,而是通用智能的基础设施。

1.2 XLNet:预训练的另一条路#

同年,杨植麟又发表了 XLNet,提出排列语言建模(Permutation Language Modeling),试图同时吸收自回归和自编码两种范式的优点。XLNet 在20项 NLP 任务上刷新了当时的最佳成绩。

如果说 Transformer-XL 定义了 Kimi 未来的技术方向,XLNet 则证明了杨植麟团队在预训练方法论上的原创能力。这两篇论文,加上在 Google Brain 和 Meta FAIR 的工程实践,构成了月之暗面创立前的全部技术资本。

1.3 回国创业#

2023年初,ChatGPT 引爆全球。杨植麟做了一个在当时看来颇为冒险的决定:放弃硅谷的教职和巨头邀约,回国创业。他的导师、清华教授唐杰后来评价说,杨植麟是那种”认准一个方向就不会回头”的人。


第二章 奠基:200万字与长文本信仰(2023年3月—12月)#

2.1 月之暗面成立#

2023年3月,北京月之暗面科技有限公司注册成立。公司名取自 Pink Floyd 的专辑《The Dark Side of the Moon》——杨植麟是个摇滚乐迷,大学时打过鼓。

成立仅两个月,天使轮融资便宣告完成:红杉中国、真格基金、今日资本入局,金额超2亿美元,估值3亿美元。在2023年的中国创投市场,这个速度近乎疯狂。

2.2 moonshot-v1:千亿参数起步#

2023年10月,Kimi 智能助手正式上线,底层模型为 moonshot-v1,千亿参数规模,基于标准 Transformer 架构。但真正让 Kimi 一夜出圈的,不是参数量,而是一个极其朴素的能力:支持20万汉字(约200万 token)的无损上下文输入。

在那个竞品普遍支持 4K—8K 上下文的年代,Kimi 直接把长文本能力拉到了”读完一本《红楼梦》还能回答细节问题”的程度。学生群体用它读论文,职场人用它分析合同,科研工作者用它综述文献。Kimi 迅速成为”长文本”的代名词。

2.3 快速迭代#

2023年12月,moonshot-v1-202312 版本发布,改善了对话连续性和移动端弱网环境下的体验。这一阶段没有公开论文,团队的全部精力都投入在一件事上:把长上下文做到极致稳定、极致可用。


第三章 扩张:从长文本到 AI 搜索(2024年1月—10月)#

3.1 上下文窗口阶梯式扩展#

2024年上半年,Kimi 的上下文窗口经历了 8K → 32K → 128K 的阶梯式扩展。每一次扩展都不是简单的窗口拉伸,而是涉及位置编码、注意力计算和推理显存的系统性工程。moonshot-v1-128k 版本开始引入多任务学习策略,在长文本理解的基础上叠加代码生成、逻辑推理等能力。

3.2 AI 搜索:产品形态的第一次跃迁#

2024年,Kimi 做出了一个关键产品决策:从”长文本阅读器”进化为”AI 搜索助手”。Kimi 开始接入实时网络检索,将长上下文能力与搜索引擎结合——用户提出一个问题,Kimi 不仅给出答案,还附上来源链接和推理过程。

这一转型精准击中了中国用户的痛点:传统搜索引擎广告泛滥,而 ChatGPT 式对话又缺乏信息溯源。Kimi 的 AI 搜索在”可信”和”好用”之间找到了平衡点。

3.3 用户爆发与资本加注#

2024年2月至5月,月之暗面完成 A+B 轮融资,总额超10亿美元,估值跃升至30亿美元。阿里巴巴领投约8亿美元,腾讯超额认购。

资本加注的底气来自用户数据。2024年4月至10月,Kimi 进入激进的获客阶段,10月 MAU 一度达到3600万,跻身国产 Chatbot 头部阵营。

但繁荣之下暗藏隐忧:用户增长主要靠投放驱动,模型能力本身尚未形成代际领先。2025年初的一场风暴,将彻底改变 Kimi 的路线选择。


第四章 觉醒:推理能力的紧急补课(2024年11月—2025年1月)#

4.1 K0-math:数学推理的第一枪#

2024年11月16日,Kimi 发布 K0-math,这是国内首个对标 OpenAI o1 的数学推理模型。K0-math 的核心思路是:用强化学习替代人工标注的思维链,让模型在数学问题上自主探索解题路径。

K0-math 的意义不在于它本身的成绩,而在于它验证了一条路线:推理能力可以通过 RL scaling 涌现,而不必完全依赖监督学习。 这个认知,将贯穿此后 Kimi 所有模型的开发。

4.2 K1:视觉推理的萌芽#

2024年12月,K1 模型发布,首次支持图像+文本联合输入。虽然 K1 的视觉能力尚属初级,但它标志着 Kimi 开始从纯文本模型向多模态方向试探。

4.3 Kimi K1.5:强化学习 scaling 的范式确立#

2025年1月20日,Kimi K1.5 发布,技术报告同步公开(arXiv<2501>.12599)。这是 Kimi 历史上第一篇完整公开的技术报告,也是其方法论的奠基之作。

K1.5 的核心创新可以归纳为四点:

第一,纯 RL 驱动的推理涌现。 K1.5 采用在线策略镜像下降(OPMD)算法,带 KL/熵约束,不使用价值网络、MCTS 或过程奖励模型。RL 提示集强调广覆盖、难度均衡和可验证性。

第二,Long-CoT 训练范式。 通过长思维链 SFT 培养模型的计划、评估、复盘和探索能力,再用 Long2Short 技术(权重合并、最短正确样本筛选、DPO 偏好训练、长度惩罚 RL)压缩推理长度,实现”想得深但说得简”。

第三,多模态 RL。 视觉 RL 数据涵盖真实世界题目、合成视觉推理和文本渲染图像,将推理能力从文本扩展到视觉领域。

第四,部分滚动训练。 用128K 上下文和部分滚动机制复用轨迹,大幅提升 RL 训练效率。

成绩方面,长 CoT 模式下 AIME 77.5、MATH500 96.2、Codeforces 94百分位。这些数字在2025年1月足以比肩 OpenAI o1。

4.4 DeepSeek-R1 的冲击#

2025年2月,DeepSeek-R1 横空出世,以极低成本实现了顶级推理能力,整个中国 AI 行业为之震动。Kimi 做出了一个果断决定:暂停投流获客,全面转向模型研发。

这个决定在当时饱受争议——放弃增长意味着放弃市场份额。但事后回看,正是这次战略转向,让 Kimi 从”最会做产品的 AI 公司”蜕变为”最会做模型的 AI 公司”。


第五章 革命:万亿参数与 MoE 范式(2025年7月—11月)#

5.1 Kimi K2:国内首个万亿参数开源模型#

2025年7月11日,Kimi K2 发布并开源(Apache 2.0 协议),技术报告同步公开(arXiv<2507>.20534)。

K2 的参数规模令人震撼:总参数1.04万亿,激活参数仅32.6B,384个路由专家中每 token 激活8个,稀疏度高达48。与 DeepSeek-V3 相比,总参数增加54%,激活参数反而降低13%,专家数量增加50%。

但 K2 真正的技术贡献不在规模,而在三个关键创新:

MuonClip 优化器。 这是 K2 最具原创性的贡献。Muon 优化器通过矩阵正交化提升训练效率,但在大规模 MoE 模型上容易出现注意力 logit 爆炸。K2 团队提出 QK-Clip 机制:实时监测每个注意力头的最大 logit,一旦超过阈值 τ=100,就在更新后缩放 Q/K 投影权重。实验显示,未加 Clip 的 Muon logit 可超过1000,而 K2 全程控制在100附近,逐步 loss 无异常尖峰。

极致稀疏度的验证。 K2 团队系统性地证明了一个规律:在固定激活参数和算力的条件下,提高稀疏度可以降低 loss。达到验证 loss 1.5 时,稀疏度48相比稀疏度8/16/32分别节省约1.69/1.39/1.15倍 FLOPs。这个发现为后续 K3 的更大规模稀疏化奠定了理论基础。

Agent 后训练体系。 K2 构建了迄今最大规模的 Agent 训练基础设施:真实 MCP 工具3000+(来自 GitHub),合成工具20000+(由层级领域生成与领域演化产生),软件工程环境支持10000+并发沙箱。RL 覆盖数学、STEM、逻辑、编码、软件工程、安全等多个维度,开放任务采用 self-critique rubric reward。

Benchmark 成绩:SWE-bench Verified 单次65.8、多次71.6;AIME 2025 49.5;GPQA-Diamond 75.1;MMLU 89.5。K2 成为当时最强的开源 Agent 模型。

5.2 K2 的快速迭代#

K2 发布后,月之暗面展现了惊人的迭代速度:

K2-Instruct-0905(2025年9月5日): 上下文从128K 扩展至256K,SWE-bench Verified 提升至69.2%。

K2-Turbo(2025年9月): 高速推理版本,输出速度达60—100 tokens/s,面向企业级高响应场景。

K2-Thinking(2025年11月): 内置推理链,多项基准超越 GPT-5,支持深层推理与长时间工具调用。

5.3 Kimi-VL:视觉语言的独立探索#

2025年,Kimi 还发布了 Kimi-VL 系列视觉语言模型。其中 Kimi-VL-A3B-Thinking 以仅2.8B 激活参数实现了接近旗舰级的多模态推理性能,验证了 MoE 架构在视觉语言领域的高效性。这条技术线后来被整合进 K2.5 的原生多模态框架中。


第六章 融合:原生多模态与 Agent Swarm(2026年1月—4月)#

6.1 Kimi K2.5:视觉不再是外挂#

2026年1月27日,Kimi K2.5 发布(arXiv<2602>.02276)。这是 K 系列首个原生多模态旗舰模型。

K2.5 的关键设计决策是:视觉能力不是后接的模块,而是从预训练阶段就与文本深度融合。 具体而言,K2.5 在 K2-Base 的基础上,用约15万亿混合视觉/文本 token 继续预训练,新增400M 参数的 MoonViT 视觉编码器,支持图像、视频和 PDF 输入。视频通过时空池化压缩后与文本 token 统一处理。官方称整个多模态预训练过程”零不稳定问题”。

Agent 能力方面,K2.5 首次引入 Agent Swarm 概念:主 Agent 将复杂请求拆分为代码、搜索、数据分析等子 Agent 并行执行后汇总。K2.5 支持约100个子 Agent、1500步协调。

成绩:AIME 2025 96.1%、SWE-Bench Verified 76.8%、GPQA-Diamond 87.6%、OCRBench 92.3%、VideoMME 87.4%。SWE-bench 76.8% 的成绩在发布时位列全球前三。

6.2 Kimi K2.6:Agent 的操作系统#

2026年4月21日,K2.6 发布并开源(arXiv<2603>.15031)。如果说 K2.5 是”带视觉的 Agent”,K2.6 的野心则是成为”Agent 的操作系统”。

K2.6 将 Agent Swarm 的规模从100个子 Agent/1500步扩展到300个子 Agent/4000步。主模型负责编排和失败后重派,流程包含规划、并行研究、自动交叉校验和并行撰写,全程可追溯。

编程能力是 K2.6 的重点突破方向。两个内部案例极具说服力:其一,12小时内完成4000多次工具调用,将本地推理引擎从15 tokens/s 优化到193 tokens/s;其二,13小时、1000多次调用重构撮合引擎,中值吞吐和峰值吞吐分别提高185%和133%。

Benchmark:DeepSearchQA f1 92.5(GPT-5.4 为78.6);SWE-Bench Pro 58.6,四家第一;CodeBuddy 内测工具调用成功率96.60%。

6.3 商业化加速#

技术突破迅速转化为商业成果。2026年3月,Kimi ARR 突破1亿美元;仅一个月后的4月,ARR 翻倍至超2亿美元。API 定价为输入 $0.95/百万 tokens、输出 $4.00/百万 tokens,仅为同级闭源模型的十分之一。


第七章 登顶:K3 与架构的范式跃迁(2026年7月)#

7.1 2.8万亿参数的开源宣言#

2026年7月28日,Kimi K3 正式开源。模型权重、技术报告和关键 Infra 技术(MoonEP、FlashKDA、AgentEnv)一并开放。

K3 的规模再次刷新纪录:总参数2.8万亿,896个路由专家中每 token 激活16个,上下文窗口扩展至100万 token,原生支持视觉理解。这是全球首个开源的三万亿级模型。

7.2 KDA:抛弃标准注意力的勇气#

K3 最具争议也最具野心的创新是 KDA(Kimi Delta Attention)。K3 采用 KDA + Gated MLA 按3<1比例混合的注意力架构>,彻底偏离了标准 Transformer 的全注意力范式。

KDA 的核心思想是:不是所有 token 都需要与所有其他 token 做全量注意力计算。通过块级注意力残差(AttnRes)增强层间信息传递,KDA 在保持长上下文建模能力的同时,大幅降低了计算复杂度。配套开源的 FlashKDA 算子在英伟达 H20 上,prefill 速度相比 flash-linear-attention 提升1.72—2.22倍。

这个设计呼应了七年前 Transformer-XL 的初心:长上下文的关键不是窗口大小,而是信息传递的效率。

7.3 Stable LatentMoE:高稀疏训练稳定性#

K3 的 MoE 架构引入 SiTU-GLU 激活函数和 Quantile Balancing 负载均衡策略,在896个专家中激活16个的极端稀疏条件下保持训练稳定。从 K2 的 QK-Clip 到 K3 的 Quantile Balancing,月之暗面在”如何让超大 MoE 不崩”这个工程难题上积累了独到的方法论。

7.4 MoonViT-V2:从头训练的视觉编码器#

K3 的视觉编码器 MoonViT-V2 采用 next-token prediction 从头训练,不依赖传统的对比预训练。这意味着视觉理解和语言理解共享同一套训练目标,从根本上消除了模态间的表示鸿沟。

7.5 成绩与成本#

K3 的 Benchmark 表现逼近甚至超越顶级闭源模型:SWE Marathon 和 Program Bench 全球第一;Terminal Bench 2.1 88.3分,接近 GPT-5.6 Sol;FrontierSWE 81.2分,仅次 Claude Fable 5;BrowseComp 91.2分;OmniDocBench 91.1分。

更关键的是成本优势。一次游戏设计任务,K3 成本 $0.030,Claude Fable 5 为 $0.38,GPT-5.6 Sol 为 $0.11。开源权重加上极低的推理成本,让 K3 迅速被 Cognition(Devin)、Nebius、Baseten、Fireworks 等全球开发者平台接入。

7.6 资本狂飙#

K3 开源前后,月之暗面的融资节奏堪称狂飙:

  • 2025年12月,C 轮5亿美元,估值43亿美元(IDG 领投)
  • 2026年2月,超7亿美元,估值100亿美元(九安医疗、五源资本领投)
  • 2026年5月,D 轮20亿美元,估值200亿美元(美团龙珠领投,国家队入场)
  • 2026年7月,F 轮超35亿美元,估值350亿美元
  • G 轮(Pre-IPO)已提前启动,目标估值500亿美元

从3亿美元到500亿美元,月之暗面用了三年。累计融资超过50亿美金,投资方涵盖阿里、腾讯、美团、红杉、IDG 和国家级基金。公司已完成股改,杨植麟任董事长,港股 IPO 箭在弦上。


第八章 全景:Kimi 技术进化路线图#

时间模型/事件核心贡献进化意义
2019.01Transformer-XL段级循环 + 相对位置编码长上下文信仰的起点
2019.06XLNet排列语言建模预训练方法论的原创验证
2023.03月之暗面成立从学术到工业的转折
2023.10moonshot-v1 / Kimi 上线200万字无损上下文长文本能力破圈
2024 H1moonshot-v1-32k/128k上下文阶梯扩展 + 多任务学习能力横向扩展
2024.10MAU 达3600万AI 搜索产品形态用户规模验证
2024.11K0-math数学推理 RL推理路线的思想源头
2025.01Kimi K1.5OPMD + Long-CoT + Long2Short + 多模态 RL方法论奠基
2025.07Kimi K21T MoE + MuonClip + Agent 后训练万亿参数开源里程碑
2025.09K2-Instruct-0905256K 上下文 + SWE-bench 69.2%快速迭代能力
2025.11K2-Thinking内置推理链混合推理架构
2026.01Kimi K2.5原生多模态 + MoonViT + Agent Swarm视觉与语言融合
2026.04Kimi K2.6300 Agent / 4000步 + 编程突破Agent OS 雏形
2026.07Kimi K32.8T + KDA + MoonViT-V2 + 100万上下文架构范式跃迁

纵观这张时间线,Kimi 的技术进化可以归纳为三条主线:

主线一:长上下文 → 高效注意力 → 架构革命。 从 Transformer-XL 的段级循环,到 moonshot-v1 的200万字窗口,到 MLA 注意力,再到 K3 的 KDA 混合架构——杨植麟追了七年的问题,最终演化为对标准 Transformer 注意力机制的根本性改造。

主线二:监督学习 → 强化学习 → Agent RL。 从 K0-math 的数学 RL 试水,到 K1.5 确立 OPMD + Long-CoT 范式,到 K2 的大规模 Agent 后训练(3000+真实工具、20000+合成工具、10000+并发沙箱),再到 K3 的 AgentEnv 开源——推理能力的获取方式从”人教”彻底转向”自涌现”。

主线三:文本 → 视觉 → 原生多模态。 从 K1 的初步视觉试探,到 Kimi-VL 的独立探索,到 K2.5 的原生多模态融合(15T 混合 token 预训练),再到 K3 的 MoonViT-V2(next-token prediction 从头训练)——视觉不再是外挂模块,而是与语言共享同一套计算原语。


第九章 反思:Kimi 的方法论#

梳理完三年技术史,我尝试提炼出月之暗面的四条方法论原则:

第一,信仰驱动,而非热点驱动。 杨植麟从2019年 Transformer-XL 开始就押注长上下文,此后七年从未偏离。当行业追逐对话、追逐搜索、追逐短视频时,Kimi 始终在回答同一个问题:如何让模型更高效地处理超长信息流?K3 的 KDA 架构,本质上是这个信仰的最新表达。

第二,先验证再扩展。 K0-math 验证 RL 路线,K1.5 验证 Long-CoT 范式,K2 验证极致稀疏度,K2.5 验证原生多模态——每一步都是先在小规模上跑通方法论,再向万亿参数扩展。月之暗面很少做”一步到位”的豪赌。

第三,开源即战略。 K2 用 Apache 2.0 开源,K3 连 Infra 技术一并开放。这不是情怀,而是精确的商业计算:当全球开发者都在你的模型上构建应用,你就成了事实标准。K3 发布当天,Cognition、Nebius、Fireworks、华为昇腾全部 Day 0 适配——这种生态动员力,闭源模型做不到。

第四,系统工程与算法同等重要。 MuonClip 解决的是优化器稳定性,FlashKDA 解决的是算子效率,MoonEP 解决的是专家并行通信,AgentEnv 解决的是沙箱隔离。Kimi 的每一次模型跃迁,背后都有对应的系统工程突破。月之暗面不仅做模型,也做基础设施。


尾声#

2026年7月,杨植麟在接受采访时说了一句颇为感慨的话:“我每天早上起床都觉得公司要挂了。”

这话大概不全是谦虚。三年前,Kimi 是一个靠投流获客的长文本工具;两年前,DeepSeek-R1 的冲击迫使它放弃增长、回归研发;一年前,K2 的万亿参数开源让全球侧目;而今天,K3 的2.8万亿参数和 KDA 架构,已经让硅谷巨头不得不认真对待这个来自北京的竞争对手。

从 Transformer-XL 到 KDA,从200万字到100万 token,从3亿美元到500亿美元——Kimi 的三年,是中国 AI 从跟随到并跑再到局部领跑的缩影。

让我们期待 K4。


参考资料:

  • Kimi K1.5 技术报告,arXiv<2501>.12599
  • Kimi K2 技术报告,arXiv<2507>.20534
  • Kimi K2.5 技术报告,arXiv<2602>.02276
  • Kimi K2.6 技术报告,arXiv<2603>.15031
  • Kimi K3 技术报告及开源权重,Hugging Face: moonshotai/Kimi-K3
  • Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context, arXiv<1901>.02860
  • XLNet: Generalized Autoregressive Pretraining for Language Understanding, arXiv<1906>.08237
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

kimi-evolution-history
https://mizuki-eaf.pages.dev/posts/kimi/kimi-evolution-history/
作者
无名之子
发布于
2026-08-02
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录