mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
5776 字
17 分钟
Gemini 2.x:快慢两用
2026-08-05

Gemini 2.x 系列解读:从”快”到”快慢两用”的转折点#

系列:Gemini 2.0 Flash(2024.12.11)→ 2.0 Pro / Flash-Lite(2025.02.05)→ 2.5 Pro(2025.03.25)→ 2.5 Flash(2025.04.17)→ 2.5 Pro Deep Think(2025.05.20,I/O)→ 2.5 Pro / Flash GA(2025.06.17)→ 2.5 Deep Think(2025.08.01) 作者:Google / Google DeepMind Gemini 2.x 是 Gemini 体系里承上启下的一代:2.0 用”Agentic 时代”宣言把模型从”回答问题”推向”替你做事”,2.5 用”思考模型”把 Gemini 从”快但不深”扳回”先想后答”。从”快”到”快慢两用”,Gemini 的推理哲学在这两代里完成了定型,后面 3 系的混合推理和真实智能体,地基全在这。

本系列无正式技术论文,解读依据官方博客、模型卡与技术发布。


第一篇 Gemini 2.0:Agentic 时代的宣言#

2024 年 12 月 11 日发布。Google 官宣”the agentic era”(智能体时代),第一作是 2.0 Flash 实验版。原生多模态输出、原生工具调用,配上 Jules / Mariner / Astra 三个 Agent 原型,Gemini 第一次把”模型”做成”能行动的系统”。

一、背景:从”理解信息”到”让信息有用”#

Pichai 在发布里给 2.0 定了性:如果说 Gemini 1.0 是组织和理解信息,那么 2.0 是让信息变得更有用。这话翻译一下就是——AI 不能只当问答机,得能替你干活。

这个转向有清晰的时代压力:2024 年 OpenAI 已把 ChatGPT 推向 Agent 化,Anthropic 也发布了 Claude 的 Computer Use(计算机操作)能力;Google 手里握着搜索、地图、Gmail、Android 这些 Agent 最需要的”工具生态”,却一直被诟病”模型会答不会做”。2.0 就是 Google 对”AI 该替你干活”这场竞赛的正面回应——而且它有一张别人没有的牌:自家产品矩阵就是最好的 Agent 试验场

干活的前提有三个:看得懂世界(多模态)、叫得动工具(tool use)、记得住上下文(长语境)。2.0 正好把这三样一次性补齐。此前 1.5 Pro 已经铺好 1M 上下文和 MoE 架构的底子,2.0 是在这上面把”行动力”做出来的一代。

二、核心能力:原生工具调用 + 原生多模态输出#

原生工具调用(native tool use) 是 2.0 的立身之本——模型在预训练里就把”调用工具”当作一等公民能力,而不是靠提示词工程拼装。2.0 Flash 能原生调用 Google 搜索、代码执行、以及第三方用户自定义函数,不需要外部编排层。这是 Agentic 路线的地基:模型自己决定什么时候搜、什么时候跑代码、什么时候调 API。

原生多模态输出 是另一根支柱。此前 Gemini 只擅长多模态”输入”(读图、听音频),2.0 首次实现原生”输出”:原生图像生成(图片和文字在同一个输出流里混排)和 原生音频输出(可控的多语言文本转语音,TTS)。

配套发布了一个面向开发者的 Multimodal Live API:支持实时音视频流输入,让开发者做出”对着摄像头边看边聊”的交互式应用——这是后来 Project Astra 式实时助手的 API 底座。

三、关键成绩:以 1.5 的速度跑出 1.5 Pro 的性能#

  • 2.0 Flash 在关键基准上以两倍于 1.5 Pro 的速度反超 1.5 Pro——这是 Gemini 历史上第一次”轻量级反杀旗舰级”;
  • 同日上线 Deep Research:基于长语境 + 多步推理的自主研究 Agent,帮用户调研复杂主题并自动出报告;
  • 算力侧,2.0 完全跑在自研 Trillium(第六代 TPU) 上,“模型-系统-硬件”三位一体从此闭环。

三个 Agent 原型 是这场发布会真正的主角:

  • Jules:整合进 GitHub 工作流的编程 Agent,能修 bug、写代码、在开发者监督下自动开 PR;
  • Project Mariner:浏览器 Agent,理解网页里的文字、代码、图像和表单并替你操作,在 WebVoyager 基准上拿到 83.5%;购物等敏感操作强制要用户确认;
  • Project Astra:实时多模态通用 Agent,能用搜索、镜头、地图等工具,具备 10 分钟会话记忆,并开始给原型智能眼镜测试。

“Agentic”的三个落点 值得拆开看:Jules 证明了 Agent 能进开发流程(写代码的 Agent),Mariner 证明了 Agent 能操作真实网页(浏览器的 Agent),Astra 证明了 Agent 能理解实时世界(多模态的 Agent)。三者合起来,勾勒出 Google 对”通用助理”的完整想象——不是聊天框里多几个按钮,而是模型真的接管一段任务流。

四、技术底座:Trillium 与”三位一体”闭环#

2.0 有一个常被忽略但极其重要的技术事实:它 100% 运行在自研第六代 TPU——Trillium 上,从训练到推理全链路自研算力,当天 Trillium 也同步对云客户开放。Pichai 称之为”十年全栈创新投入的回报”。“模型-系统-硬件三位一体”(Gemini 发展史总结的第四条方法论)至此真正闭环——此后 Gemini 每个登顶时刻,都建立在自研算力底座上,不再依赖英伟达供应链。

官方口径还有一个低调的技术注脚:2.0 Flash Thinking——一个展示推理过程的实验版,让模型”边想边说”。它后来被视作 Gemini 思考模型的第一个胎动,2.5 的”thinking model”正是从它演进而来。

五、2.0 全家族(2025.02.05):Flash / Pro / Flash-Lite 三档齐发#

  • 2.0 Flash GA:定价 $0.10/百万输入 token,成为主力工作模型;
  • 2.0 Pro(实验版):当时最强的编码与复杂指令模型,2M token 上下文——一次能读完《哈利·波特》全 7 册,这是 Gemini 长上下文能力的新天花板;
  • 2.0 Flash-Lite:最性价比的轻量版,$0.075/百万输入 token(缓存后低至 $0.01875),质量仍优于 1.5 Flash。

三档布局的潜台词很清楚:Flash 打日常、Pro 打复杂、Flash-Lite 打规模。这种”按价格-能力-延迟分档”的产品矩阵,后来被 2.5、3 代全盘继承。

六、生态与影响:产品矩阵全面接入#

2.0 从发布起就快速铺进 Google 全家桶:Gemini App、搜索的 AI Overviews(AI 摘要)、NotebookLM。当年 AI Overviews 月活已破 10 亿,2.0 把多步推理能力灌进搜索,让用户能问”更复杂的问题”。此外 2.0 的 Agent 触角还伸向游戏(配合 Genie 2 造可玩 3D 世界,与 Supercell 合作做游戏内智能体)和机器人(探索把空间推理用在现实世界)——Agent 不只是写代码,还有数字与物理世界的双重野望。

对开发者而言,2.0 Flash 实验版发布当天就通过 Gemini API(Google AI Studio + Vertex AI)开放,全部开发者可用多模态输入 + 文本输出,TTS 和原生图像生成向早期合作方开放,2025 年 1 月全面开放。这个”实验版先行、开发者优先”的节奏,和 Gemini App 端”模型下拉菜单可选 2.0 Flash”同步进行——2.0 是 Gemini 第一次把”开发者生态”和”消费者产品”在同一天拉齐,也为 2.5/3 代的”预览-迭代-GA”节奏定了调。

七、局限#

2.0 的 Agent 能力还很”原型”:Mariner 承认”并不总是准确、完成任务速度很慢”;Jules 只面向受信任测试者。原生图像和音频输出一开始仅对早期合作方开放。更重要的是,2.0 依然是”快”的模型——它把 Agent 的地基打好,但”深度思考”要到 2.5 才补上。换句话说,2.0 能”动手”但”脑子”还不够深,这个缺口被 2.5 精准接住。

收尾:我的一点看法#

2.0 最容易被忽略的价值,是它把”Agent”从一个演示概念变成了工程事实。原生工具调用这个选择尤其关键——它不是给模型外挂一个 tool-calling 层,而是把工具使用烙进模型本体,这让 Jules、Mariner、Astra 这类 Agent 有了统一的行动底座。放到 Gemini 发展史的坐标里,2.0 是”聊天”到”真实智能体”的第一级台阶,虽然还很毛糙,但方向对了。回头看,Mariner 那个 83.5% 和 Astra 的 10 分钟记忆,正是后来 3 系真实 Agent 能力的原始胚胎。


第二篇 Gemini 2.5:学会思考#

2025 年 3 月 25 日发布 2.5 Pro,Gemini 历史上第一次在 LMArena 登顶,也是第一个官方定义的”思考模型”。之后 2.5 Flash 把思考预算做成可调,Deep Think 把推理扩展到并行假设。Gemini 从”快”正式转向”先想后答”。

一、背景:被”快但不深”卡住的 Gemini#

2.0 把速度拉到极致,但 Gemini 的推理深度一直被诟病”不如 OpenAI 的 o 系列”。2024 年 9 月 OpenAI o1 发布,把”推理时思考”变成行业新范式,随后 DeepSeek R1 证明开源也能做。Google 需要正面回应:让 Gemini 也会思考

这里有个时间压力:2.0 Flash Thinking 虽然存在,但只是”展示思路”的实验品,没有系统化的推理能力;而竞争对手的”思考模型”已经是产品。Google 内部显然把”会不会思考”提升到了战略高度——2.5 的发布博客开篇就写”going forward, we’re building these thinking capabilities directly into all of our models”(今后要把思考能力直接内建进所有模型)。这句话后来被证明不是口号:2.5 之后,Gemini 的每代模型都默认带思考,3 系甚至把它做成可调旋钮。

二、核心能力:思考模型与可调思考预算#

2.5 Pro 是 Gemini 第一个官方定义的思考模型(thinking model)——在给出最终回答前,先在内部做一段推理。官方口径是:不是简单的 chain-of-thought 提示,而是把”先想后答”内化成模型能力,配合强化学习把推理计算用在刀刃上。技术报告口径(虽无正式论文,但有公开技术报告)显示,2.5 系列显著增加了分配给强化学习的训练计算,并结合可验证奖励(verifiable reward)与基于模型的生成奖励,提供更复杂、可扩展的反馈信号;同时优化了大规模训练稳定性、信号传播与优化动态——这批”训练稳定性工程”是它在长推理下不掉链子的幕后功臣。

架构层面,2.5 系列是**稀疏混合专家(sparse MoE)**模型,原生支持文本、视觉、音频输入;它还是 Google 第一个在 TPU v5p 上训练的模型系列(此前是 v4/v5e),用同步数据并行在多个数据中心的 8960 芯片 pod 上预训练。预训练数据是覆盖网络文档、代码、图像、音频、视频的大规模多模态语料,截止时间从 2.0 的 2024 年 6 月推进到 2025 年 1 月。单条 2.5 的路程很短,但它在长上下文上延续了 1.5 的遗产:1M token 输入的处理能力在同期是独一档(OpenAI o3-mini 等同期模型多为 128K 档)。

更关键的设计在 思考预算(thinking budget):开发者可以控制模型”思考多久、花多少 token 再回答”。这条是 Gemini 后来”快慢两用”哲学的起点——同一个模型,想让它快就压低预算,想让它深就放开预算。

Deep Think 是这一代最激进的能力扩展(2025.05.20 I/O 发布):使用 并行假设推理(parallel thinking) 技术——同时探索多个假设再收敛到答案,而不是一条链走到底。这是”思考模型”之上再加一层”并行思考”,专攻数学、竞赛级编程这类”需要多条思路撞一撞”的任务。

三、关键成绩#

2.5 Pro(2025.03.25,实验版):

  • LMArena 登顶 #1——首款登顶的 Google 模型,约领先第二名 40 ELO(当时约 1370 Elo);
  • SWE-Bench Verified 63.8%(智能体编码基准)、GPQA Diamond 84%(研究生级科学知识)、AIME 2025 86.7%(数学竞赛)、MMMU 81.7%、MRCR 长上下文 83.1%;
  • 上下文最高 1M token。

基准对照(2025.03 时点,官方口径):

基准2.5 Pro同期对比
LMArena#1(约 1370 Elo)领先第二名约 40 ELO
SWE-Bench Verified63.8%同期 Claude 3.7 Sonnet 70.3%,纯编码仍略逊
GPQA Diamond84%独立验证 84%,超过博士专家水平
AIME 202586.7%无工具时领先,低于 o4-mini
HLE18.8%当时唯一破 18% 的模型

注:官方明确 2.5 Pro 在数学上仍略逊于 OpenAI o4-mini、图像理解略低于 o3-high;LMArena 登顶更多来自人类偏好的综合风格,而非全面碾压——这个口径在理解”登顶”含义时很重要。

2.5 Flash(2025.04.17): 第一个可切换思考预算的混合推理模型——日常任务可以不开思考直接答,复杂任务放开预算深想。

2.5 Pro Deep Think(2025.05.20):

  • 2025 USAMO 数学竞赛 49.4%(当时最难的数学基准之一);
  • LiveCodeBench 80.4%、MMMU 84.0%;WebDev Arena ELO 1415 登顶。

2.5 Pro / Flash GA(2025.06.17): 上下文扩至 2M token,思考预算全面可调,新增原生音频输出;定价 $1.25/百万输入、$10/百万输出(超长上下文档 $2.50/$15)。

2.5 Deep Think(2025.08.01): 并行推理正式产品化,面向 AI Ultra 订阅用户开放,USAMO、LiveCodeBench 保持领先。

四、生态与影响#

2.5 Pro 成为 Gemini App 高级用户的默认模型,也是当时编码社区公认的最强模型之一。I/O 2025 上,2.5 系列还接入了 原生音频输出、思考摘要(thought summaries)和 MCP 工具支持。长上下文 + 视频理解成为它的招牌组合:单次调用可处理长达 3 小时的视频内容,MRCR(多轮指代消解)等长上下文基准拿到 83.1%。更重要的是,2.5 完成了”思考模型(默认)+ 可调预算(Flash)+ Deep Think(并行扩展)“的三件套设计——这个”深度与速度解耦”的框架,直接定义了后面 3 系的模型形态。对比同期竞品:OpenAI o 系列固定走”思考模式开/关”两态,DeepSeek R1 是”超长思考”一条路,Gemini 2.5 第一个把思考深度做成了连续可调的旋钮。

另一个容易被忽视的生态动作:2.5 Pro 整合了 LearnLM(Google 与教育专家共建的模型家族),在教育评测中成为”学习导向”模型的领先者,head-to-head 评测中教育专家更偏爱 2.5 Pro。这说明 2.5 不只是”能思考”,还开始往”会教人思考”的方向渗透——Google 把思考能力向教育、办公这类垂直场景下沉的动作,从这一代就开始了。

五、局限#

思考模型天然”慢且贵”:2.5 Pro 的响应延迟明显高于 2.0,Deep Think 更是分钟级;官方也承认 Deep Think”处于技术前沿,需要额外时间做前沿安全评估”,发布初期只对受信任测试者开放。思维链的透明性问题(是否展示完整推理过程)被社区反复讨论,Google 最终以”思考摘要”折中。定价上 $1.25/$10 也明显高于 2.0,且 2.5 Pro 在数学上仍略逊于 OpenAI o4-mini、图像理解略低于 o3-high——登顶不意味着全面碾压。另外 2.5 的”思考”还是单模型内完成,没有达到 3 系”思考量可调 + 混合推理”那样系统化的程度。

收尾:我的一点看法#

2.5 是 Gemini 体系里真正的”转折点”:它用一次 LMArena 登顶,终结了”Google 只会堆工程不会做推理”的质疑;用思考预算,提前抢占了”思考深度与速度解耦”这个后来全行业都抄的方向。回头看 DeepSeek 同期的 R1 走的是”开源 + 超长思考”,Gemini 走的是”闭源 + 可调思考”,两条路线各有拥趸,但 Gemini 这套”默认思考、可调预算、Deep Think 扩展”的三段式,后来被证明在工程上更好用——3 Flash 的混合推理就是它的直系后代。2.5 最大的遗产,是把”快慢两用”从口号变成了可配置的工程能力。

还有一个细节值得单独说:2.5 的发布节奏本身就是一次方法论升级。3 月 25 日实验版 → 5 月 I/O 加 Deep Think → 6 月 GA 推 2M 上下文,三个半月内完成”验证 → 扩展 → 稳定”的闭环。对比 1.5 时代”先预告再慢慢铺”,2.5 的”实验版快速迭代”路线明显更贴近 OpenAI 的发布节奏。这个”预览先行、快速 GA”的打法,后来成为 Gemini 3 系的标配——也是 Google 从”研究型发布”转向”竞争型发布”的转折信号。


系列总评#

Gemini 2.x 两个世代放在一起,是一条清晰的”从快到聪明再到可控”的进化线:2.0 解决”模型能不能行动”(原生工具 + Agent 原型),2.5 解决”模型能不能想深”(思考模型 + Deep Think),而”思考预算可调”把两者缝合成同一套体系。放在 Gemini 发展史的大背景里,2.0 是 Agentic 时代的分水岭,2.5 是 思考模型的分水岭——恰好就是发展史标注的两大转折点。后来的 3 系(真实智能体、混合推理)不是凭空冒出来的,2.x 已经把零件造好了。

如果给这一代打分,我会说:2.0 解决了”为什么做 Agent”,2.5 解决了”怎么做对 Agent”。前者确立了方向,后者让模型在行动之前先想清楚——而”先想清楚再行动”,正是 Gemini 3 口中”真实智能体”的完整定义。2.x 是 Gemini 从”问答工具”蜕变为”智能体平台”的最后一块跳板。


附:核心数据速查#

版本时间线

时间版本关键点
2024.12.112.0 Flash(实验)Agentic 时代宣言、原生工具调用、Multimodal Live API
2025.02.052.0 Pro / Flash GA / Flash-Lite2M 上下文;Flash $0.10/M,Flash-Lite $0.075/M
2025.03.252.5 Pro(实验)首个思考模型;LMArena #1(约 1370 Elo,领先约 40)
2025.04.172.5 Flash首个可调思考预算的混合推理模型
2025.05.202.5 Pro Deep Think并行假设推理;USAMO 49.4%、LiveCodeBench 80.4%
2025.06.172.5 Pro / Flash GA2M 上下文、思考预算可调;定价 $1.25/$10(超长上下文 $2.50/$15)
2025.08.012.5 Deep Think(AI Ultra)并行推理产品化

2.5 Pro 关键 benchmark(2025.03–06 时点)

  • LMArena #1(约 1370 Elo,领先约 40)
  • SWE-Bench Verified 63.8%
  • GPQA Diamond 84%
  • AIME 2025 86.7%
  • MMMU 81.7%;MRCR(1M 上下文)83.1%

2.5 Pro Deep Think

  • 2025 USAMO 49.4%;LiveCodeBench 80.4%;MMMU 84.0%;WebDev Arena ELO 1415

2.5 Flash(2025.06 时点,预览版)

  • GPQA Diamond 约 73%;比 2.5 Pro 少 20–30% token 开销;日常任务思考预算可关

定价速览(每百万 token)

模型输入输出
2.0 Flash$0.10
2.0 Flash-Lite$0.075(缓存 $0.01875)
2.5 Pro(≤200K)$1.25$10.00
2.5 Pro(>200K)$2.50$15.00

关键概念清单

  • agentic era = 智能体时代(模型替你执行任务)
  • native tool use = 原生工具调用(搜索 / 代码执行 / 函数调用)
  • Multimodal Live API = 实时音视频流输入 API
  • Trillium = 第六代 TPU(2.0 训练推理 100% 自研算力)
  • Deep Research = 自主研究 Agent
  • thinking model = 思考模型(回答前先内部推理)
  • thinking budget = 思考预算(可调思考深度)
  • Deep Think = 增强推理模式(并行假设推理,parallel thinking)
  • parallel thinking = 并行假设推理(同时探索多假设再收敛)
  • sparse MoE = 稀疏混合专家(按需激活专家子集)
  • TPU v5p = 第五代可编程 TPU(2.5 首个在其上训练的系列)
  • thought summaries = 思考摘要(API 中展示推理过程的摘要)
  • MCP = Model Context Protocol(模型上下文协议,工具互操作标准)
  • MRCR = Multi-Round Coreference Resolution(多轮指代消解)
  • USAMO = 美国数学奥林匹克
  • SWE-Bench Verified / GPQA Diamond / AIME / LMArena = 编码、科学、数学、人类偏好基准
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Gemini 2.x:快慢两用
https://mizuki-eaf.pages.dev/posts/gemini/gemini-2x快慢两用/
作者
无名之子
发布于
2026-08-05
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录