mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2977 字
8 分钟
Kimi K2.5:百 Agent 群殴
2026-07-26

Kimi K2.5 论文解读:视觉是亲生的,一百个Agent是群殴的#

论文:Kimi K2.5: Visual Agentic Intelligence 作者:Moonshot AI(月之暗面) 一句话:这玩意儿不是给文本模型贴了个摄像头,而是从第一天起就让模型用眼睛思考。更狠的是,它第一次把”一百个Agent同时干活”写进了万亿参数模型的技术报告。15万亿混合token继续预训练,零loss spike,工程上很猛。


一、底子没换:K2的骨架原封不动#

1. 没动的部分#

先说清楚,K2.5不是推倒重来。总参数1万亿,激活参数32B,MoE的基本盘纹丝没动。61层网络、160K词表、SwiGLU激活函数——骨架跟K2一模一样。

月之暗面的思路很明确:底座已经验证过了,别折腾,往上长新器官就行。对下游部署的人来说这是好消息,迁移成本被压到最低,不用重新适配一套全新架构。

2. 动了的三刀#

变化集中在三个地方:

专家数从256扩到384。 每层还是只选8个专家(外加1个共享专家)。打个比方:菜单从256道菜扩到384道,但你每顿还是只点8道。选择空间大了,专精程度不变,推理成本不变。

上下文窗口从128K翻倍到256K tokens。 靠的是**MLA(Multi-head Latent Attention,多头潜在注意力)**把KV缓存压缩约10倍,64个注意力头、隐藏维度7168,让256K不至于变成显存黑洞。

新增MoonViT视觉编码器,400M参数。 原生支持图像、视频、PDF输入。这是最扎眼的一刀——后面单独说。


二、视觉不是外挂:MoonViT和15T混合预训练#

1. 老方案的毛病#

过去多数多模态模型怎么搞的?先训好一个纯文本大模型,再拿个现成的ViT把图像”翻译”成token序列,最后用对齐层把两者粘一块。这就像一个成年人硬学外语——语法能对付,语感永远差一截。视觉信息始终是”翻译过来的二手货”,不是模型自己消化的。

2. K2.5的做法:从预训练第一天就长眼睛#

MoonViT是月之暗面自研的400M参数视觉编码器。从Kimi-K2-Base出发,用约15万亿混合视觉/文本token做继续预训练。注意,不是”先训文本再补视觉”,而是视觉信息和文本信息在同一个token空间里共同流动、共同塑造权重。

视频输入通过**时空池化(Spatiotemporal Pooling)**压缩——把连续帧里冗余的空间信息和时间信息同时降维——然后跟文本token一起送进Transformer。不是把视频截成一堆图片分别看,而是真正在时空维度上做压缩理解。

3. 零spike,这四个字值千金#

官方特别强调:整个15T token的继续预训练过程零不稳定问题

做过大规模训练的人知道这句话有多重。多模态混合训练极易出loss spike,视觉token和文本token的梯度尺度差异巨大,稍有不慎就炸。零spike意味着数据配比、学习率调度、梯度裁剪策略全都精密设计过。这不是运气,是工程硬实力。

4. 效果:不是看图识字,是在图上推理#

这套方案直接反映在分数上:OCRBench 92.3%,MathVision 84.2%,MathVista 90.1%。这不是”认字”的水平,是在视觉信息上做数学推理的水平。视觉理解能力不再是附加功能,而是模型认知结构的有机组成部分。


三、Agent Swarm:一个项目经理带一百个打工人#

1. 传统Agent的问题#

传统Agent是串行的:一个模型接任务,想,调工具,看结果,再想,再调。一个人干所有活。任务一复杂,又慢又容易丢上下文。

2. Swarm的编排逻辑#

Agent Swarm的思路完全不同:一个主Agent当”项目经理”,把复杂请求拆成代码编写、信息搜索、数据分析等子任务,分派给约100个专精子Agent并行执行,经过约1500步协调后汇总交付。

不是一个人加班到死,是一个团队并行推进。

技术报告揭示了两个运行模式:

  • Thinking模式:主Agent先深度推理和规划,温度1.0、top_p 0.95,生成完整思维链后再分派。适合多步推理的硬任务。
  • Instant模式:跳过深度推理,快速分派。适合结构明确、不需要太多规划的活。

3. 训练方法:PARL#

月之暗面用了PARL(Parallel-Agent Reinforcement Learning,并行Agent强化学习)。最关键的设计选择:训练环境与生产环境完全一致——同样的工具、同样的prompt、同样的执行环境。不搞”训练时开挂、部署时残废”那套。

奖励信号基于结果(outcome-based):可验证的任务用确定性信号,不可直接验证的用**生成式奖励模型(Generative Reward Models)**评估。训练采用异步大规模rollout,每次更新生成大量并行轨迹。

4. 数据:18个百分点,不靠堆参数#

最直观的对比:BrowseComp基准上,单Agent模式60.6%,Swarm模式78.4%。

18个百分点的提升,模型没变大,参数没增加,纯粹是”组织方式”变了。从”更强的个体”到”更好的组织”,这个杠杆效应很猛。在模型规模接近边际收益递减的当下,“怎么组织推理”可能比”怎么扩大推理”更值钱。


四、Benchmark全景:逐项过#

1. 推理与知识#

基准K2.5备注
AIME 202596.1%avg@32
HMMT 202595.4%avg@32;GPT-5.2为93.3%
IMO-AnswerBench81.8%
GPQA-Diamond87.6%avg@8
MMLU-Pro87.1%

数学推理已经站到第一梯队最前列。HMMT 95.4%直接碾压GPT-5.2的93.3%,这不是”接近”,是实打实的超过。

2. 视觉与视频#

基准K2.5备注
MMMU-Pro78.5%
MathVision84.2%
MathVista90.1%
VideoMMMU86.6%
VideoMME87.4%
OCRBench92.3%

全面且均衡,没有明显短板。图像、视频、OCR、数学视觉推理全覆盖,原生多模态训练的优势在这里体现得很充分。

3. 代码与Agent#

基准K2.5备注
SWE-Bench Verified76.8%Claude Opus 4.5为80.9%
LiveCodeBench v685.0%
Terminal Bench 2.050.8%
PaperBench63.5%
BrowseComp60.6% / 78.4%单Agent / Swarm
DeepSearchQA77.1%
LongBench v261.0%

SWE-Bench 76.8%跟Claude Opus 4.5的80.9%还有约4个百分点差距,但考虑到这是开源权重模型,这个差距完全在可接受范围内。Agent Swarm在BrowseComp上的18个百分点增益是最亮的点。


五、部署:万亿参数怎么落地#

1. 推荐框架与硬件#

K2.5推荐vLLMSGLangKTransformers作为推理框架,目标硬件H100/H200。

2. 精度与资源#

精度存储需求最低硬件速度
FP16~2TB8x H100 80GB最快,无损
INT4 QAT~630GB8x A100 80GB快,近无损
Q2_K_XL~375GB4x A100 + 256GB RAM中等,轻微损失

3. 原生INT4不是事后压缩#

原生INT4量化(group size 32)通过**QAT(Quantization-Aware Training,量化感知训练)**实现,专门面向NVIDIA Hopper架构优化。这不是训完了再压一刀,而是训练时模型就”知道”自己最终会以4bit运行。

630GB的INT4部署门槛,8卡A100集群就能跑。万亿参数模型从”只有大厂玩得起”拉到了”中型团队可触及”的区间,这对开源生态是实打实的贡献。


收尾:我的一点看法#

K2.5最让我觉得有价值的不是某个单项分数,而是它回答了一个很实际的问题:参数规模已经够大了,下一步往哪走?月之暗面的答案是两条腿——让视觉成为母语,让协作成为本能。15T混合token的继续预训练不是小打小闹,Agent Swarm也不是demo级玩具,两者都是工程上真金白银砸出来的。

局限也很明显。SWE-Bench跟Claude Opus 4.5还差4个点,Terminal Bench 2.0只有50.8%,说明在真实工程环境的代码Agent能力上还有空间。Agent Swarm的1500步协调听起来很猛,但报告对协调失败、子Agent冲突、资源浪费这些问题的讨论偏少——生产环境里这些才是真正头疼的事。另外,15T继续预训练的计算成本报告里没有给出具体数字,“零spike”很漂亮,但代价多大,外人无从判断。

放在Kimi的路线里看,K2到K2.5的演进逻辑非常清晰:架构不动,能力叠加。不推翻重来,而是在已验证的底座上长新器官。这种克制在当下”每半年换一次架构”的风气里反而显得务实。对工程团队和下游部署者来说,迁移成本被压到最低,这才是开源模型真正的竞争力所在。

2026年的后续工作会验证这个方向到底能走多远。但至少从这份技术报告来看,工程执行的完成度和方法论的自洽性,都值得认真对待。


附:核心数据速查#

项目数值
总参数1万亿(1T)
激活参数32B
网络层数61层
专家数384(每层选8+1共享)
词表大小160K
上下文窗口256K tokens
注意力头数64
隐藏维度7168
MoonViT参数400M
继续预训练数据~15T混合视觉/文本token
Agent Swarm规模~100个子Agent,~1500步协调
KV缓存压缩~10x(MLA)
INT4部署存储~630GB
FP16部署存储~2TB

关键概念清单#

  • MoE(Mixture of Experts,混合专家):每层只激活部分专家,总参数大但激活参数小,推理成本可控
  • MLA(Multi-head Latent Attention,多头潜在注意力):压缩KV缓存的注意力机制,让长上下文不至于吃光显存
  • MoonViT:月之暗面自研的400M参数视觉编码器,原生多模态训练的核心组件
  • 时空池化(Spatiotemporal Pooling):视频输入的压缩方法,同时在空间和时间维度降维
  • Agent Swarm:主Agent拆解任务、约100个子Agent并行执行的协作架构
  • PARL(Parallel-Agent Reinforcement Learning,并行Agent强化学习):训练Agent Swarm协作策略的强化学习方法
  • QAT(Quantization-Aware Training,量化感知训练):训练时就模拟低精度推理,避免事后压缩的性能损失
  • 生成式奖励模型(Generative Reward Models):对不可直接验证的任务结果进行评估的奖励信号来源
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Kimi K2.5:百 Agent 群殴
https://mizuki-eaf.pages.dev/posts/kimi/kimi-k25百-agent-群殴/
作者
无名之子
发布于
2026-07-26
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录