mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2619 字
7 分钟
HySparse:KV 缓存降 80%
2026-07-11

HySparse 论文解读:把”选择”和”缓存”全甩给全注意力,KV Cache 直降 80%#

论文:HySparse: Hybrid Sparse Attention for Efficient Long-Context Processing(arXiv<2602>.03560,据媒体报道整理,细节以论文原文为准) 作者:小米 MiMo 大模型团队 2026 年 2 月,小米 MiMo 团队甩出这张”效率牌”。核心思路一句话:传统稀疏注意力最难的”该选哪些 token”和”KV Cache 该存多少”,全都交给少数几层全注意力(Full Attention)来干,其余稀疏注意力层直接白嫖它的选择结果。实验里一个 49 层的 80B-A3B MoE 模型只保留 5 层全注意力,能力不降反升,KV Cache 存储直接砍到原来的 1/11——这是给 Agent 时代”超长文本烧不起”这个病开的方子。


一、背景:稀疏注意力的”两朵乌云”#

稀疏注意力的大方向其实不新鲜——先选重要的 token,再只在这些位置做注意力计算,把计算量从 O(L²) 降下来。但这一路走下来,始终绕着两个根本问题打转。

第一朵乌云:选择依赖”代理”(proxy)。 绝大多数方法在真正算注意力之前,都要用一个代理信号决定”谁重要”:固定模式、启发式规则、近似估计,或者一个可学习的轻量选择模块。这些代理本质上都是对真实注意力分布的近似,不可能完全精准;在长上下文、持续生成的场景下,近似误差还会不断累积,越跑越偏。可训练的方法也只是把”人写规则”换成”可学习代理”,训练复杂度上去了,代理瓶颈没根治。

第二朵乌云:计算量降了,KV Cache 没降。 主流动态稀疏注意力主要省的是计算,可为了不把重要信息不可逆地丢掉(token 的重要性会随生成动态变化),推理时通常还得保留全量 KV Cache。结果就是算力确实省了,但显存和带宽这两个真瓶颈还卡在那儿——对长上下文推理来说,这恰恰是最贵的东西。

二、HySparse 的做法:把最难的两件事交给 Full Attention#

HySparse 的设计可以说”简洁到有点犯规”:选择交给全注意力做,缓存也交给全注意力做。

具体是 hybrid block 结构——每个 block 由 1 层 Full Attention + N 层 Sparse Attention 组成。block 内部的稀疏注意力层不再自己独立做 token 选择、也不再维护全量 KV,而是直接复用前置那层全注意力产生的重要 token 索引和 KV Cache。逻辑上讲得通:全注意力算自己那一下的时候,本来就要生成 KV Cache,也顺便算出了最准确的 token 重要性信息——这些副产品凭什么不能给后面 N 层共享?

这一下把两朵乌云都解决了:

  • 选择不再依赖 proxy——用的就是全注意力的真实注意力分布,零近似误差;
  • 稀疏层不再引入额外 KV Cache 开销——跨层共享,省到极致。

设计灵感也很”工程化”:一是学界的观察——显著 token 在相邻层之间高度稳定(如 TidalDecode),在某层选出来后面几层可以放心复用;二是跨层 KV 共享已被 YOCO、Gemma3n 等证明可行且不伤性能。HySparse 等于把这两条经验直接焊进了模型结构里,还为此专门做了联合训练。

三、稀疏层内部:不是单行道,是”全局稀疏 + 局部窗口”双轨#

别以为 HySparse 的稀疏层是单一模式。它每一层 Sparse Attention 里其实是两条分支并行:

  • 块级稀疏注意力分支(全局侧):在 TopK 索引对应的共享 KV Cache 上做全局稀疏注意力,负责抓住长距离的重要信息;
  • 滑动窗口分支(局部侧):沿用 V2-Flash 那套局部窗口注意力,负责近处的细腻建模。

两条分支的产出用一个轻量门控融合。这个”全局稀疏 + 局部窗口”的混合,可以看作是对 MiMo-V2-Flash 混合注意力(SWA + 全注意力 5<1>)的一次升级:等于给原来只有局部视野的滑动窗口层,补上了一根通往全局重要 token 的”天线”——兼容且互补,还不加 KV Cache、不显著增加计算。

四、效果:5 层全注意力扛起 49 层模型#

论文给出的核心实验是 80B-A3B MoE(总 49 层):

  • 只保留 5 层 Full Attention,其余 44 层全部是共享的稀疏注意力;
  • 模型能力不降反升,在通用、数学、代码、中文多项评测上都有提升;
  • KV Cache 存储降至原来的 1/11(约减负 80%+,不同报道口径为”降低 80%“与”降至 1/11”并存,待核实具体口径);
  • RULER 长文测试证明,即使把全注意力压到极少数,长距离关键信息检索依然稳定。

7B Dense 规模同样验证有效。小米官方表示还会继续探索”更少全注意力层”的可能。

五、和 DeepSeek DSA、Kimi 的路线怎么比#

这条技术线的赛跑者不止小米一家。DeepSeek-V3.2 的 DSA(稀疏注意力)走的是”轻量 indexer 打分 + 每 query 选 top-k 个 KV 条目”的细粒度稀疏路线,indexer 本身仍要扫一遍全序列,且要额外训练这个选择模块;HySparse 的思路则是一步到位——根本不要专门的 indexer,用现成的全注意力层兼职干选择。代价是必须保留少数全注意力层,而 DSA 理论上可以全层稀疏(只要 indexer 够准)。Kimi 家的注意力方案主打 Mamba/Kimamamba 的混合,是状态空间模型的另一条路,跟”稀疏选择”不在一个频道上。

横向看,V2-Flash 的混合注意力(SWA 为主)解决的是”短窗口下省显存”,HySparse 解决的是”超长上下文下既能全局检索又不烧 KV”,是前者在 Agent 时代的自然进化。而到了 3 月发布的 V2-Pro,小米把混合比例从 5<1> 进一步拉到了 7<1>——这条”注意力效率”主线,从 V2-Flash 一路连到了万亿级旗舰。

收尾:我的一点看法#

HySparse 最打动我的是它的”归因思路”:稀疏注意力吵了这么多年的”怎么选 token”,本质是给一个本来就有答案的问题发明代理方案——全注意力算完就已经告诉你谁重要了,何必再养一个 indexer 来猜?这个”让计算过的地方顺便提供信息,别重复造轮子”的思路,跟小米在 MiMo 系列里反复强调的”复用优于自研”一脉相承。工程上它也很聪明:跨层共享 KV 本来就是被验证过的省钱路子,HySparse 只是把它和”层间 token 稳定”两条经验焊在一起,属于那种”听完觉得很简单,但第一个想到的人值得表扬”的工作。

局限也清楚:它毕竟需要保留一定比例的全注意力层,“极致稀疏”和”全局召回”之间仍是此消彼长的权衡;当前实验规模到 80B 级,万亿参数上效果如何、训练稳定性怎么样,还要等更大规模的验证。另外把选择权完全押在少数几层全注意力上,一旦长上下文里某些关键信息碰巧在那几层被”漏选”,后面所有稀疏层都会跟着瞎——这是个值得警惕的级联风险。

放在 MiMo 的发展序列里,HySparse 的意义在于把”效率”这条技术主线从 V2-Flash 接续到了 V2-Pro/V2.5:它证明小米在注意力架构上不再只是”跟 DeepSeek 抄作业”,而是开始有自己的原创方法论——而这,恰恰是它敢把万亿参数模型拉出来打擂台的底气。

附:核心数据速查#

基本盘

项目数值
论文arXiv<2602>.03560(2026.02 发布)
核心结构Hybrid Block:1 层 Full Attention + N 层 Sparse Attention
稀疏层设计块级稀疏(全局)+ 滑动窗口(局部)双分支,轻量门控融合
关键实验49 层 80B-A3B MoE,仅保留 5 层 Full Attention
KV Cache 收益降至原来的约 1/11(减负 80%+,口径待核实)
能力表现通用/数学/代码/中文评测不降反升,RULER 长文检索稳定
验证规模7B Dense、80B-A3B MoE

技术来源

  • 显著 token 跨层稳定:启发自 TidalDecode 等观察
  • 跨层 KV 共享:参考 YOCO、Gemma3n
  • 与 V2-Flash 的关系:为 Hybrid SWA 增加全局重要 token 信息补充的升级
  • 后续应用:V2-Pro 将混合比例提升至 7<1>

关键概念清单

  • Full Attention = 全注意力(不设窗口,看全上下文)
  • Sparse Attention = 稀疏注意力(只对选中的 token 子集做注意力)
  • Hybrid Block = 混合块(1 层全注意力 + N 层稀疏注意力的组合单元)
  • proxy = 代理信号(近似真实注意力分布的选择依据)
  • KV Cache 共享 = 多层复用同一份键值缓存,省显存
  • RULER = 长上下文检索压力测试基准
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

HySparse:KV 缓存降 80%
https://mizuki-eaf.pages.dev/posts/mimo/hysparsekv-缓存降-80/
作者
无名之子
发布于
2026-07-11
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录