mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
5841 字
17 分钟
Gemini 1.5:百万上下文革命
2026-07-31

Gemini 1.5 论文解读:百万 token 上下文,把长上下文革命提前三年#

论文:Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context 作者:Google DeepMind(Gemini Team) Gemini 1.0 发布才三个月,Gemini 1.5 就甩出两张王牌:百万 token 上下文(1M)稀疏 MoE 架构。前者把上下文窗口从 32K 直接拉高 30 倍,一个模型能一次吃掉一小时视频、十一小时音频、七十万字文本;后者让 1.5 Pro 用”更省的算力”追平 1.0 Ultra。这篇论文是 Gemini 发展史”长上下文革命”的源头,也是全行业长上下文竞赛的导火索——它和 DeepSeek-V2 几乎同期验证了稀疏化路线的价值。读这一篇,看的是 Gemini 从”强”到”既强又长”的关键一跃。


一、引言:1.0 之后的三个月,谷歌决定换一条路#

2023 年 12 月 Gemini 1.0 发布时,业内最大的槽点除了剪辑视频,就是 32K 的上下文窗口——比 GPT-4 Turbo 的 128K、Claude 2.1 的 200K 都短。一个标榜”从数十万份文档中提取见解”的模型,自己却读不下长文档,这很尴尬。

2024 年 2 月 15 日(论文 2024 年 3 月挂出,arXiv<2403>.05530),谷歌甩出 Gemini 1.5 Pro,把这个问题直接炸了:

  • 上下文窗口提升到 1M token(标准版 128K,预览版 1M,内部测试做到 10M);
  • 改用稀疏 MoE(混合专家)架构,这是 MoE 第一次进入 Gemini 系列。

这两个选择放在一起是有内在逻辑的:上下文长了,每个 token 都要过一遍整个模型,稠密模型的计算成本会爆炸;MoE 让每个 token 只激活一部分专家通路,正好把长上下文带来的算力压力消化掉。所以 1.5 的路线不是”更长 or 更省”二选一,而是”又长又省”——这个组合拳让 1.5 Pro 以接近 1.0 Ultra 的性能、低得多的算力成本,同时拿下”史上最长上下文”。

📌 与 DeepSeek-V2 的巧合:2024 年 2-5 月间,DeepSeek-V2(MLA + MoE,128K 上下文)与 Gemini 1.5(MoE + 1M 上下文)几乎同期发布。两家独立走向了同一结论——大规模时代,稀疏化是必选项。这个”英雄所见略同”本身就是 2024 年架构史最值得记的一笔。

二、核心创新:1M 上下文与 MoE 稀疏架构#

创新一:百万级上下文。 论文标题直接点题——“unlocking multimodal understanding across millions of tokens of context”。1M token 是什么概念?换算一下:

  • 约 70 万字文本(英文约 70 万单词);
  • 约 1 小时视频(每秒一帧采样);
  • 约 11 小时音频
  • 超 3 万行代码

也就是一本 700 页的书、一部电影、一整天的语音记录,能一次全塞进输入里,模型还能在其中”大海捞针”式地检索和推理。论文里两个实锤案例:给 402 页阿波罗 11 号登月记录,让它推理对话细节;给《悲惨世界》全文(1382 页、约 73 万 token),只画一张草图就能问出”这一幕在第几页”——模型准确给到了页码。

创新二:MoE 稀疏架构。 MoE(Mixture of Experts,混合专家)是”有条件计算”(conditional computation)的一种实现:把 FFN 层拆成一组”专家”子网络,由一个门控路由函数(gating/routing)决定每个 token 激活哪些专家,而不是激活全部参数。1.5 Pro 是”稀疏 MoE 的 Transformer”——总参数量很大,但每个 token 只激活其中一部分通路,所以推理成本远低于同规模的稠密模型。

论文专门花篇幅回顾了谷歌自己的 MoE 血统(Sparsely-Gated MoE、GShard、Switch Transformer、M4),强调 1.5 站在谷歌十几年稀疏计算积累之上。这也解释了后来 1.5 能推出 Flash 轻量版、Flash-8B 的底气——同一个稀疏架构,蒸馏出不同规模的变体成本很低。

两者叠加的结果:1.5 Pro 在 87% 的 benchmark 上超过 1.0 Pro,对 1.0 Ultra 也打出 57.6% 的胜率(19/33),而训练算力需求显著更低。官方定位是”1.5 Pro ≈ 1.0 Ultra 的性能,但小得多、省得多”。

训练基础设施:规模与稳定性的隐形工程。 论文披露,1.5 系列在多个数据中心的 TPU v4 上以 4096 芯片为单位的 Pod 集群训练(与 1.0 一致),预训练数据涵盖网页文档、代码、以及图像/音频/视频的多模态语料,后续再做多模态指令微调与人类偏好对齐。真正关键的工程点是:百万级上下文意味着训练序列可以长到几千甚至上万 token 起跳,长序列训练时的显存与通信压力、稳定性问题成倍放大。论文虽未细讲,但从它能从 32K 直接跨到 1M,且”到 10M token 仍保持 >99% 召回”的结果看,训练侧必然做了稀疏注意力的稳定化处理。这也是谷歌”模型-系统-硬件三位一体”方法论第二次完整落地(第一次是 1.0 的 goodput 97%)。

三、长上下文的核心技术#

百万上下文不是把窗口参数调大就行,论文铺了三层技术:

1. 稀疏注意力(sparse attention)。 这是 1.5 的隐藏功臣。标准 Transformer 的 attention 计算量随序列长度平方增长(O(L²)),1M token 直接平方是天文数字。Gemini 1.5 引入了稀疏注意力机制,让模型在长序列上只对相关的 token 子集做注意力,把长上下文的计算从”不可行”压到”可行”。论文提到”improvements in attention mechanisms”支撑了超长上下文,具体实现细节保密,但效果是实打实的——1M token 内检索几乎完美,没有出现此前长上下文模型常见的”中间遗忘”(lost in the middle)退化

2. 大海捞针(Needle-in-a-Haystack)评测。 这是长上下文模型的”体检仪”:把一句关键信息(针)随机埋在超长无关文本(草垛)里,看模型能不能找出来。Gemini 1.5 Pro 的结果是:

  • 文本模态,1M token 内召回 >99.7%;官方博客口径”在 1M token 的数据块中 99% 找到嵌入文本”;
  • 扩展到 10M token(约 700 万字)仍保持 >99% 召回
  • 音频模态:11 小时(约 9.7M token)内隐藏音频片段 100% 找回;官方博客口径 11 小时音频 100%;
  • 视频模态:3 小时(约 9.9M token)视频内隐藏视觉元素 100% 找回
  • 多针测试(multi-needle):在 1M 上下文中埋 100 根针,1.5 Pro 能找回约 60 根且稳定,而 GPT-4 Turbo 超过 128K 后直接归零——对比惨烈

3. 长上下文的真实推理,而不只是检索。 论文强调检索不等于推理。它专门做了”长上下文 + 多步推理”的评测:多文档问答(MRCR,Multi-round Reasoning over Retrieved Context)、长视频问答(1H-VideoQA)、长上下文语音识别(Long-context ASR),在这些任务上 1.5 Pro 全面刷新 SOTA,而且超过了外接检索增强(RAG)的竞品组合——意思是”上下文里自带的检索”比”外部再挂一个检索器”还强,这让 RAG 派系压力山大。

四、多模态长上下文:一小时视频、三小时电影、十一小时音频#

论文最有味道的部分,是它证明”长上下文”可以跨模态。三个标志性案例:

1 小时视频理解。 1.5 Pro 能对每秒一帧采样的一小时视频做逐秒时间戳定位。论文用了 44 分钟的默片大师巴斯特·基顿(Buster Keaton)的《Sherlock Jr.》(684K token,2674 帧),让它总结剧情、定位关键道具出现的帧和时刻,甚至”给一张手绘草图,问这是电影里的哪一幕”——它从整部电影里找了出来。后来社区的经典玩法是拿它看 3 小时电影长片做全程推理,这是发布时没有任何模型能做到的事。

11 小时音频。 一次吃下近一天的语音,做”大海捞针”:把一段 30 秒的语音”秘钥”埋进 11 小时音频流里,1.5 Pro 100% 找回,还能带时间戳。对比实验里,用 Whisper 逐段转写再接 GPT-4 Turbo 的”外挂方案”准确率只有 94.5%,原生多模态 + 长上下文完胜。

70 万字文本。 一本《悲惨世界》全文进上下文,跨章节推理、页码定位、剧情细节问答全部在线。论文里还有一个亮点实验——上下文学习(in-context learning):给 1.5 Pro 一份 500 页的卡兰语言(Kalamang,巴布亚新几内亚一种不到 200 人使用的语言)语法手册,它就能学会做英语翻译,质量达到”从相同材料学习的人类”的水平。这就是”百万 token 即长程记忆 + 即学即用”的具象化。

论文还做了一个”长上下文到底省多少时间”的实测:让 1.5 Pro 与专业人士协作完成 10 类工作任务,实测节省 26%–75% 的工作时间——从文档摘要、代码评审到会议整理。虽然这是谷歌自家口径、有宣传成分,但它指出了一个真问题:长上下文的商业价值不只在”能处理”,更在”不用再手工分段喂给模型”。这个”时间节省”叙事后来成了 Gemini 系列面向企业客户的固定卖点。

五、核心能力成绩(论文最终版口径)#

除了长上下文,1.5 Pro 在核心基准上(技术报告 v5/最终版口径,即 2024 年 5 月更新版):

  • MMLU 85.9%(5-shot);多数投票(majority vote)最高 91.7%
  • MMMU 62.2%HumanEval 84.1%GPQA 59.1%
  • MATH 67.7%、GSM8K 90.8%、BIG-Bench Hard 89.2%、MGSM 87.5%;
  • 视觉:MathVista 63.9%、DocVQA 90.1%、InfographicVQA 81.0%、V* Bench 71.7%(较 2 月版 +23.7 点);
  • 对 1.0 Ultra 的对比:数学与科学多数打平或反超(GPQA +5.8 点、AMC +7.2 点、PhysicsFinals 从 25 分提到 39 分),编码反超(Natural2Code 超越 1.0 Ultra),多语言持平。

⚠️ 口径说明:论文 2024 年 2 月首发版与 5 月更新版分数差异明显(如 MMLU 81.9%→85.9%、HumanEval 71.9%→84.1%、MMMU 58.5%→62.2%)。本文取技术报告最终版口径,与《Gemini 发展史》一致;引用时务必注明版本。此外 GPQA 59.1% 为论文更新版/第三方聚合(llm-stats)口径,官方表格中 GPQA 0-shot 为 46.2%,两者评测配置不同。

六、后续衍生:Flash、Flash-8B 与生产级降价#

论文发布后 1.5 家族迅速扩张,这条演进线是理解 Gemini 商业逻辑的关键:

1.5 Flash(2024.05,I/O 2024)。 通过蒸馏(distillation)1.5 Pro 的知识得到的轻量版,共享 1M(后升至 2M)上下文,主打低延迟高吞吐——一次能分析 1500 页文档 / 3 万行代码。Flash 在注意力和 FFN 上采用并行计算优化,论文给出的实测是英语输出速度超过 650 字符/秒,比第二名 Claude 3 Haiku 快 30%+,同时质量只比 1.5 Pro 掉一点(“minimal regression”)。Vinyals 当时的总结:1.5 Pro > 1.0 Ultra,1.5 Flash ≈ 1.0 Ultra

2M 上下文预告(2024.05.14)。 I/O 大会上谷歌宣布 1.5 Pro 将支持 2M token 上下文(waitlist 预览)——长上下文再翻一倍,为后来 2.0 Pro”一次读完整套《哈利·波特》“埋下伏笔。

1.5 Flash-8B(2024.09)。 一个 80 亿参数的端侧/低成本变体,是 Gemini 首次明确公开参数的模型,主打性价比。

生产级更新与降价(2024.09.24)。 1.5 Pro/Flash 升级为生产级模型(-002 版),质量大涨:MMLU-Pro +7%、MATH/HiddenMath +20%、视觉与代码 +2-7%;同时 API 输入降价 64%、输出降价 52%(10 月 1 日生效);输出提速 2 倍、延迟降 3 倍。这次降价把 Gemini 的 API 价格直接打到了同档模型的地板价,配合 1M 上下文,成了 2024 下半年企业客户转向 Gemini 的关键推力。

📌 口径提示:《Gemini 发展史》里特别标注过——1.5 的 GA 是 2024-05-30,2024-09-24 是 -002 大版本更新(含降价与 Flash-8B),两个时间点别混。本文沿用这一口径。

六·五、长上下文带来的范式冲击#

1.5 的意义不只是”窗口更大”,而是改写了应用层的工作方式,社区在发布后很快把这种变化总结成几种新模式:

  • RAG 的动摇。此前”把文档切成块、检索、再拼接”的 RAG(检索增强生成)是长文档问答的标准解法。1.5 Pro 直接把整本文档塞进上下文,检索与推理在模型内部一步完成,论文的 MRCR 评测还证明它强于外接检索方案。社区由此开始反思:“还要不要 RAG?“——虽然后来业界的主流结论是”短上下文用 RAG 省钱、长上下文用原生上下文图省事”,但 Gemini 1.5 是把这个问题摆上台面的第一作;
  • “上下文即记忆”。1M token 让模型能把”整段对话史”或”整个项目背景”常驻输入,诞生了”用上下文当外部记忆”的玩法。1.5 Pro 后期被用来一次性分析整个代码仓库(JAX 全仓库 74.6 万 token)、给 bug 视频找问题——这种”喂一个仓库进去问”的用法,是 32K 时代不可想象的;
  • 成本曲线的改变。长上下文 token 费钱(1.5 Pro 后期输入 $3.50/M 量级),但谷歌在 2024.09 把价格直接打到地板,说明”长上下文”对谷歌来说不是炫技,而是要真让开发者用起来的产品战略。这个”先铺能力、再降价格”的节奏,和 2.0、3.0 时代的定价策略一脉相承。

第三方评测也基本验证了官方数据:权威评测聚合站(如 llm-stats)对 1.5 Pro 的 MMLU 85.9%、GPQA 59.1%、HumanEval 84.1% 与论文最终版口径一致;社区实测的”大海捞针”从 128K 到 1M 全程绿(success),对比 GPT-4 Turbo 在 128K 上限处”没得测”——长上下文这个维度,1.5 在 2024 年上半年确实没有对手。

七、结论与局限#

论文结论:Gemini 1.5 是”下一代高算力效率的多模态模型”,在长上下文检索上近完美召回(>99%),刷新长文档 QA、长视频 QA、长上下文 ASR 的 SOTA,核心能力匹配甚至反超 1.0 Ultra,且更省算力。

局限也如实写:

  • 上下文越长,绝对性能仍有轻微衰减:1M 的检索召回(>99.7%)略低于 530K 时(100%),10M 时约 99.2%——虽然衰减很小,但长上下文并非完全无损;
  • 多针检索仍有短板:100 根针找不全(约 60%),说明”多路并行检索”不是长上下文的天然强项;
  • 评测基准的应变:论文自己承认,现有基准越来越测不动这种长上下文多模态模型,需要设计新的评测(MRCR、1H-VideoQA 等);
  • 老问题依旧:知识不更新、可能幻觉、参数量保密。

收尾:我的一点看法#

Gemini 1.5 是 Gemini 发展史上被低估的一作。Gemini 1.0 喊的是”最强”,2.0 喊的是”Agentic”,2.5 喊的是”思考”——但1.5 做的”百万上下文”是真正改变产品形态的能力。没有它,后来的”一次读完整本书、整部电影、整个代码仓库”都不存在,2.0 的 Deep Research、3 系的 Agent 长任务、乃至 2026 年 Spark 个人智能体接 30+ 工具,全都建立在这个”超长记忆”的地基上。从发展史时间线看,1.5 把”长上下文革命”这一阶段撑了起来(2024.02–2024.09),是名副其实的里程碑。

MoE 这一步棋的深意也值得多说两句。1.5 是 Gemini 系第一次用稀疏架构,而这恰恰发生在行业争论”稠密 vs 稀疏”的当口。同期 DeepSeek-V2 用 MLA+MoE 证明了开源侧的稀疏化路径,Gemini 1.5 证明了闭源侧的稀疏化路径——两条线殊途同归地宣告:规模再往上走,稠密模型的成本墙到了。之后 GPT-4 的”8 个专家”传闻被反复讨论,整个行业都在往稀疏化挪。回头看,1.5 和 V2 是这根曲线上几乎同时站上去的两个点。

技术层面我最佩服的是”长上下文评测”这块。别的团队发长上下文模型,往往就贴一张”窗口多大”的规格表;Gemini 1.5 专门建了一整套评测体系——大海捞针的文本/音频/视频三模态版本、多针测试、1H-VideoQA、MRCR。这种”自己发明体检仪来证明自己健康”的做法,逼着整个行业跟着建立了长上下文评测的规范。今天任何一个长上下文模型的发布,都绕不开”大海捞针”这个名词,源头就是这篇论文。

当然要泼一点冷水。1M 上下文的能力很强,但”长上下文推理”不等于”长上下文都值得用”——很多时候文档量没那么大,塞进 1M 反而慢。1.5 发布初期预览版响应要 20 秒到 1 分钟,体验并不好。另外论文自己的数据也承认 10M 时召回从 >99.7% 滑到 99.2%,多针只有 60%,长上下文的能力边界其实比宣传的窄。还有那个老话题:参数量依旧保密,MoE 到底多少专家、每个 token 激活多少,外界全靠猜。技术透明度和营销口径之间,谷歌始终留着一层纱。

把两篇解读连起来看:1.0 解决了”模型强不强”,1.5 解决了”模型长不长、省不省”。没有 1.0 的原生多模态,1.5 的”跨模态大海捞针”无从谈起;没有 1.5 的 MoE,2.0 之后的 Gemini 在算力成本上根本撑不起 Agent 时代的规模。1.0 定义了 Gemini 是谁,1.5 决定了 Gemini 能走多远。


附:核心数据速查#

模型配置

项目Gemini 1.5 ProGemini 1.5 Flash
架构稀疏 MoE Transformer(首个使用 MoE 的 Gemini 系)MoE,蒸馏自 1.5 Pro
上下文标准 128K / 预览 1M / 内部测试 10M同享 1M(后至 2M)
参数量未公布未公布(Flash-8B 为 8B)
输入模态文本 / 图像 / 音频 / 视频同左
训练硬件TPU v4(4096 芯片 Pod × 多数据中心)同左

上下文长度演进对比(Gemini 系)

模型上下文时点
Gemini 1.032K2023.12
GPT-4 Turbo(对照)128K2023.11
Claude 2.1(对照)200K2023.11
Gemini 1.5 Pro 标准版128K2024.02
Gemini 1.5 Pro 预览1M(内部测 10M)2024.02
Gemini 1.5 Pro 扩展2M2024.05 预告 / 2024.06 上线
Gemini 2.0 Pro(后续)2M2025.02

关键 benchmark(1.5 Pro,技术报告最终版口径)

基准成绩备注
MMLU85.9%多数投票最高 91.7%
MMMU62.2%
HumanEval84.1%
GPQA59.1%第三方聚合口径;官方 0-shot 为 46.2%
MATH / GSM8K67.7% / 90.8%
大海捞针(1M 文本)召回 >99.7%10M 文本仍 >99%
大海捞针(11h 音频)100%
大海捞针(3h 视频)100%
多针测试(1M 内 100 针)约 60%GPT-4 Turbo 128K 后归零
对 1.0 Pro / Ultra 胜率87.9%(29/33)/ 57.6%(19/33)

后续衍生(-002 生产级,2024.09.24)

  • MMLU-Pro +7%、MATH/HiddenMath +20%、视觉代码 +2-7%
  • API 降价:输入 −64%、输出 −52%(缓存 −64%)
  • 输出提速 2 倍、延迟降 3 倍;发布 Flash-8B

关键概念清单

  • MoE = Mixture of Experts,混合专家(每个 token 只激活部分专家通路)
  • routing / gating = 路由 / 门控(决定 token 走哪些专家)
  • conditional computation = 有条件计算(按输入动态分配算力)
  • distillation = 蒸馏(用大模型知识训练小模型)
  • context window = 上下文窗口(一次能处理的 token 数)
  • needle-in-a-haystack = 大海捞针(长上下文检索评测)
  • multi-needle = 多针测试(一次检索多个目标)
  • lost in the middle = 中间遗忘(长上下文模型对中段信息的退化)
  • in-context learning = 上下文学习(从提示中即时学习,无需微调)
  • MRCR = Multi-round Reasoning over Retrieved Context,多轮检索推理
  • 1H-VideoQA = 一小时视频问答(长视频理解评测)
  • Long-context ASR = 长上下文语音识别
  • RAG = Retrieval-Augmented Generation,检索增强生成
  • token = 词元(模型处理文本/图像/音频/视频的基本单位)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Gemini 1.5:百万上下文革命
https://mizuki-eaf.pages.dev/posts/gemini/gemini-15百万上下文革命/
作者
无名之子
发布于
2026-07-31
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录