Kimi K2.6 论文解读:300个Agent干13小时,模型聪不聪明已经不重要了
论文:Kimi K2.6 Technical Report(arXiv: 2603.15031) 作者:Moonshot AI(月之暗面)
三个月前 K2.5 把并行 Agent 推到 100 个、1500 步,大家还在感叹”这调度有点东西”。三个月后 K2.6 直接把数字翻了三倍——300 个子 Agent、4000 步协调执行,4 月 21 日还用 Modified MIT License 开源了。但你要是只盯着这些数字看,就白读这篇报告了。月之暗面这次压根没想跟你争”我家模型比你聪明”,它想证明的是另一件事:我的系统比你的系统更能干活。从”一个聪明的大脑”到”Agent 的操作系统”,这是路线层面的换轨。
一、骨架没动:进步全在”会用工具”上
1. 一模一样的架构,约20%的提升
先把架构这块说清楚,因为它几乎没什么好说的。K2.6 的模型结构和 K2.5 像一个模子刻出来的:1T 参数 MoE,每个 token 激活 32B;61 层,384 个专家里路由选 8 个再加 1 个共享专家;多头潜在注意力(Multi-Head Latent Attention);400M 参数的 MoonViT 视觉编码器;上下文 262,144 tokens。
骨架没换,进步几乎全来自训练——15.5T 预训练 token 打底,后训练阶段往上叠监督微调(SFT)、合成的 MCP/工具调用轨迹、可验证奖励强化学习(RLVR)和自批评(self-criticism)。
2. 力气花在哪了
同一套架构能拿到约 20% 的综合提升,这事本身就说明问题:月之暗面把工程力气从”造更大的模型”挪到了”让模型更会用手里的工具、更会跟别人协作”。这是个特别务实的选择,也是个信号——在 MoE 架构已经趋同的 2026 年,纯堆参数的边际收益低得可怜,真正能拉开差距的活儿都在系统层。
而系统层的核心,就是下面要讲的 Agent Swarm(智能体集群)。
二、300个Agent的调度中枢:它不写代码,它管人
1. 主模型是个PMO
Agent Swarm 的设计逻辑,你可以直接理解成一个大型项目的项目管理办公室(PMO)。主模型自己不亲自写代码、不亲自搜资料,它就干三件事:规划、分派、验收。
具体流程是这样:主模型先把一个复杂任务拆成能并行的子任务,分给最多 300 个领域专精的子 Agent;这些子 Agent 各干各的——有的搜索、有的做深度研究、有的啃文档、有的写长文;干完之后系统自动交叉校验(cross-validation),一个 Agent 的结论会被另一个 Agent 复核;最后所有结果并行汇总成文档、网页或者表格。全程每一步都可追溯。哪个子 Agent 失败了、卡住了,主模型会检测到停滞,然后重新分派,甚至把任务重新生成一遍再发下去。
2. Claw Groups:连别人家的Agent也能管
更进一步,K2.6 引入了一个叫 Claw Groups 的机制:子 Agent 不再局限于 Kimi 自家生态,第三方 Agent 可以带着自己的工具、Skills 和持久记忆加入这个集群。K2.6 负责给它们匹配任务、盯进度、管交付。
到这一步,味道就变了。这已经不是”模型调用工具”的老范式了,而是”模型在管理一个异构的劳动力市场”。当你的系统能调度别人家的 Agent,你就从一个工具使用者变成了平台。“Agent OS”这个定位的真正含义就在这儿——操作系统自己不生产应用,操作系统负责调度应用。
三、13小时重构一个引擎:编程的胜负手变成了”耐力”
1. 不是写得快,是干得久
K2.6 在编程上的突破,不是”写一个函数更快”,而是”能连续干十几个小时不崩”。技术报告给了两个相当极端的案例。
第一个:用 Zig 语言优化 Qwen3.5-0.8B 的本地推理。K2.6 连续工作超过 12 小时,执行了 4000 多次工具调用,迭代了 14 轮,把吞吐量从约 15 tokens/s 一路拉到约 193 tokens/s——比 LM Studio 还快约 20%。
第二个更狠:重构一个撮合引擎(exchange-core)。13 小时,12 种策略,1000 多次工具调用,改了超过 4000 行代码。结果中值吞吐提升 185% 到 1.24 MT/s,峰值吞吐提升 133% 到 2.86 MT/s。
2. 4000步不迷路是怎么做到的
这两个案例的共同点是长时程自主执行(long-horizon autonomous execution)。大多数模型干到几百步就开始迷失方向、重复劳动、产生幻觉。K2.6 能在 4000 步之后还死死咬住最初的目标,靠的就是后训练阶段那批大量合成的工具调用轨迹,加上自批评机制。
第三方验证也站得住:CodeBuddy 内测里,K2.6 的工具调用成功率达到 96.60%,代码生成准确率比 K2.5 提升 12%,长上下文稳定性提升 18%;factory.ai 的评估显示总体表现比 K2.5 强约 15%,指令遵循更好,那种”hacky 解法”也更少。
编程 Agent 的竞争维度正在悄悄换轨——从”单次生成质量”转向”持续工程能力”。能写一个漂亮函数不稀奇,能连续 13 小时重构一个引擎还不跑偏,这才是生产力真正的分水岭。
四、一条Prompt出一个全栈页面:前端后端一起端走
1. 评测里压过Google AI Studio
网页生成是 K2.6 的另一个重点。内部的 Kimi Design Bench 把这块能力拆成四个维度:视觉输入理解、落地页构建、全栈应用开发、创意编程。在这个评测里,K2.6 的表现优于 Google AI Studio。
2. 它到底能生成什么
落到实际能力上,K2.6 可以按一条要求生成一个完整的前端页面——结构化布局、Hero 视觉区、交互动效、滚动触发效果一应俱全,还会自己调用图片/视频生成工具去填充素材。技术栈也挺现代:oklch 色彩空间、clamp() 响应式排版、GSAP stagger 动画、lerp 视差滚动这些都用得上。
更关键的是全栈能力:登录认证、用户交互、数据库操作(日志记录、会话管理)能在一次生成里全部搞定。“前端工程师”和”后端工程师”的那道墙,在 Agent 时代正在被重新砌。当一条 Prompt 能吐出一个带数据库的全栈应用,“生成网页”就不再是个玩具,而是一个能用的 MVP 工具。
五、Benchmark实话实说:偏科,但偏得很清醒
1. 数据摆在这儿
K2.6 的 Benchmark 表现是一副清清楚楚的”偏科”长相——Agent 和编程任务强势,纯推理和视觉任务还有差距。
| Benchmark | K2.6 | GPT-5.4 | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|---|
| DeepSearchQA F1 | 92.5 | 78.6 | 91.3 | 81.9 |
| SWE-Bench Pro | 58.6 | 57.7 | 53.4 | 54.2 |
| HLE-Full(有工具) | 54.0 | 52.1 | 53.0 | 51.4 |
| HLE-Full(无工具) | 34.7 | 39.8 | 40.0 | 44.4 |
| Toolathlon | 50.0 | 54.6 | - | - |
| MCPMark | 55.9 | 62.5 | - | - |
| Terminal-Bench 2.0 | 66.7 | 65.4 | 65.4 | 68.5 |
| AIME 2026 | 96.4 | 99.2 | 96.7 | 98.3 |
| GPQA-Diamond | 90.5 | 92.8 | - | - |
2. 几个关键读数
挑几个要紧的说。DeepSearchQA 的 F1 干到 92.5,大幅领先 GPT-5.4 的 78.6,这是 Agent Swarm 并行研究加交叉校验直接换来的果实。SWE-Bench Pro 58.6,四家里第一,但跟 GPT-5.4 只差 0.9 分,统计上基本在噪声范围里。
短板也很诚实:无工具的 HLE-Full 只有 34.7,比 Gemini 低了近 10 分,裸推理这块还是软肋;Toolathlon 和 MCPMark 两项工具使用评测都落后 GPT-5.4,说明 K2.6 的工具优势集中在”长时程编排”,而不是”单次工具交互的精度”;视觉能力接近 Gemini,但整体还不及 GPT-4.5。
这副画像其实挺招人喜欢的——它不打算在所有维度上都赢,而是把资源死死压在”Agent 化执行”这条主线上。DeepSearchQA 和 SWE-Bench Pro 的领先不是运气,是 Agent Swarm 加长时程编程训练的直接产出。这种”有所为有所不为”的打法,比追求全面碾压要可持续得多。
六、6天6个会话:真实项目里的连续性才是硬道理
1. 一个比Benchmark更说明问题的细节
技术报告之外,有个实测细节特别值得拎出来:有开发者拿 Claude Code 当前端、K2.6 当后端模型,在一个社区网站项目上连续干了 6 天,开了 6 个独立会话,最长单次任务 3 小时。
结果是 K2.6 能接着之前的技术选型和代码风格往下走,不用重新 briefing。让它”优化 CMS UI”的时候,它会主动去检查约束条件、保留原始 URL,还在 README 里把风险标注出来。
2. 为什么这个细节重要
这个细节比任何 Benchmark 都重。它说明 K2.6 那 262K 的上下文,加上后训练里的持久记忆机制,确实在多日、多会话的真实工程场景里把项目一致性给维持住了。Benchmark 是考场,这种连续 6 天的协作才是工地。能在工地上不掉链子,才算真有本事。
收尾:我的一点看法
K2.6 最让我意外的,不是那些翻了三倍的数字,而是它的”克制”。在一个人人都在喊”更大、更聪明”的赛道上,月之暗面选择把架构原封不动,把全部赌注压在调度和长时程执行上。这需要点定力——因为参数规模是最好讲故事的东西,而”系统更能干活”这种话,听起来没那么性感。
但它给出的答案很扎实。300 个 Agent 并行、4000 步不迷路、13 小时重构引擎,这些东西指向的是同一个判断:在 2026 年,单个模型再聪明也有天花板,真正的杠杆在”怎么把一群 Agent 组织起来干成一件大事”。Claw Groups 允许第三方 Agent 进场这一步,战略意义甚至大过技术意义——一个只能调度自家子 Agent 的系统是工具,一个能调度异构 Agent 的系统才配叫操作系统。
它当然不完美。裸推理不如 Gemini,工具交互精度不如 GPT-5.4,视觉还有差距。可恰恰是这些”不完美”让这篇报告显得诚实:它没试图讨好所有人,而是清清楚楚地告诉你,它要在哪条线上赢。对一个开源团队来说,在不卷参数军备竞赛的前提下找到这种差异化竞争力,本身就是一件挺提气的事。
一句话总结:不做最聪明的大脑,做最可靠的调度中枢。这条路,K2.6 算是走通了。
附:核心数据速查
关键数据一览
| 项目 | 数据 |
|---|---|
| 模型规模 | 1T 参数 MoE,每 token 激活 32B |
| 结构 | 61 层,384 专家选 8 + 1 共享专家 |
| 视觉编码器 | MoonViT,400M 参数 |
| 上下文长度 | 262,144 tokens |
| 预训练数据 | 15.5T tokens |
| 并行规模 | 最多 300 个子 Agent / 4000 步协调 |
| 综合提升 | 较 K2.5 约 20% |
| Zig 推理优化 | 12+ 小时,4000+ 工具调用,14 轮迭代,15→193 tokens/s |
| 撮合引擎重构 | 13 小时,12 种策略,1000+ 工具调用,4000+ 行代码 |
| 引擎吞吐 | 中值 +185% 至 1.24 MT/s,峰值 +133% 至 2.86 MT/s |
| CodeBuddy 工具调用成功率 | 96.60% |
| 开源协议 | Modified MIT License(2026-04-21) |
关键概念清单
- Agent Swarm(智能体集群):主模型负责规划、分派、验收,最多调度 300 个领域专精子 Agent 并行执行。
- Claw Groups:允许第三方 Agent 携带自有工具、Skills 和持久记忆加入集群的开放调度机制。
- 交叉校验(cross-validation):一个 Agent 的结论由另一个 Agent 复核,保证结果可靠。
- 长时程自主执行(long-horizon autonomous execution):在数千步、十几小时尺度上保持目标一致不跑偏的能力。
- RLVR(可验证奖励强化学习):后训练阶段使用的、基于可验证奖励的强化学习方法。
- 自批评(self-criticism):模型对自身输出进行反思和修正的训练机制。
- MoonViT:Kimi 自研的视觉编码器,400M 参数。
- Kimi Design Bench:内部网页生成评测,覆盖视觉理解、落地页、全栈开发、创意编程四个维度。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





