Gemini 3 系列解读:从”模型”到”智能体平台”的里程碑
系列:Gemini 3 Pro + Deep Think + Antigravity(2025.11.18)→ 3 Deep Think(2025.12.04)→ 3 Flash(2025.12.16)→ 3.1 Pro(2026.02.12)→ 3.5 Flash / Omni / Spark(2026.05.19,I/O)→ 3.6 Flash / 3.5 Flash-Lite(2026.07.21) 作者:Google / Google DeepMind Gemini 3 是 Gemini 发展史上真正的”里程碑”:2.0 宣告 Agentic 时代,2.5 学会思考,而 3 把两件事合起来——模型不仅能想,还能在 Antigravity 平台上真实地替你干活。全面登顶的基准、混合推理、世界模型、个人智能体,Gemini 从”一个模型”长成了”一套能落地的智能体平台”。
本系列无正式技术论文,解读依据官方博客、模型卡与技术发布。
第一篇 Gemini 3 Pro:全面登顶与真实 Agent
2025 年 11 月 18 日发布,距 2.5 代仅 8 个月。Gemini 3 Pro + Deep Think 模式 + Antigravity 平台三件套同台,官方定位”通往 AGI 的重要一步”。基准全面登顶,同时第一次把”Agent 能力”当作卖点中心。
一、背景:8 个月憋出的全面反超
2.5 之后,行业进入”推理竞赛下半场”:OpenAI 出了 GPT-5、GPT-5.1,Anthropic 出了 Claude Sonnet 4.5。Google 8 个月没发新旗舰,外界质疑声不断。11 月 18 日 Gemini 3 Pro 落地,一口气在几乎所有主流基准上刷新 SOTA,被媒体评价为”谷歌夺回技术领导权的一作”。
二、核心能力:原生多模态 + 真实 Agent 能力 + Antigravity
原生多模态。 延续 Gemini 1.0 以来的路线,从零联合预训练文本、图像、音频、视频。1M token 上下文 / 64K 输出,官方口径基于稀疏 MoE(参数量未公开,据泄露模型卡),TPU v5p 训练。
真实 Agent 能力。 官方明确说 3 Pro 是”目前世界上多模态理解最强、交互最深的智能体”——能规划并自动执行多步任务,比如整理邮件、处理工具链调用,而不只是给建议。配合 Generative UI(动态生成可点击的交互界面),模型可以直接产出应用和工具。
Antigravity 平台。 这次发布的重头戏不是模型卡,而是一个面向智能体开发的平台:Agent 能同时操作编辑器、终端和浏览器——写代码、起服务器、在浏览器里验证效果,全程异步,不用人盯着。它内置浏览器自动化(基于 Gemini 2.5 Computer Use),还能维护知识库、跨工作区管理多个 Agent。这等于 Google 正式下场跟 Cursor、Claude Code、OpenAI Codex 抢”智能体编程”这个盘子。
三、关键成绩:全面登顶(2025.11 时点)
- LMArena 1501 Elo 登顶(首个突破 1500 的模型,此前 GPT-5.1 约 1470、Claude 4.5 约 1465);
- Humanity’s Last Exam(无工具)37.5%,破了 GPT-5 Pro 的 31.64 纪录;
- GPQA Diamond 91.9%、SimpleQA Verified 72.1%、ARC-AGI-2 破纪录(31.1%)、AIME 2025 带代码执行 100%;
- SWE-bench Verified 76.2%(较 2.5 Pro 大幅提升)、Terminal-Bench 2.0 54.2%、WebDev Arena 1487 Elo、LiveCodeBench Pro 2439 Elo。
生态数据(Pichai 发布): AI Overviews 月活 20 亿;Gemini App 月活 6.5 亿;开发者 1300 万;Alphabet Q3 营收 1023.46 亿美元(+16%)。API 定价:输入 $2.00 / 输出 $12.00(超 200K token 后 $4.00/$18.00)。
竞争态势: 全面压制 GPT-5.1 与 Claude Sonnet 4.5;Anthropic 当天宣布与英伟达、微软结盟;奥特曼评价”看起来很不错”。
四、生态与影响
3 Pro 发布即成为 Gemini App 与 AI Mode 的旗舰,Antigravity 公开预览免费开放(Mac / Windows / Linux 三端)。“真实 Agent”从原型(Jules/Mariner 时代)升级为正式卖点,智能体平台成为 Google 对抗 OpenAI Codex、Claude Code 的主战场。
五、局限
- 3 Pro 是”预览旗舰”,发布时上下文 1M(“2M”是后续 3.1 Pro 与 3.5 Pro 的规格),且没有独立 Flash 版——轻量线要等到 12 月中;
- 参数量、训练细节均未公开(据泄露模型卡推断稀疏 MoE);
- 事实准确率仍有质疑:有评论指出它在”替你完成工作”上的可靠性还不足以完全替代人工;
- 定价偏高,超长上下文翻倍收费,挡住了一部分高频 Agent 调用场景。
收尾:我的一点看法
Gemini 3 Pro 最狠的一刀不是基准分数,而是 Antigravity。基准登顶只是把 GPT-5.1 压下去,Antigravity 是直接把”AI 会写代码”变成”AI 平台替你开项目、跑服务、验效果”——这是从模型到产品的跃迁。放到发展史坐标里,3 Pro 是”真实智能体”的正式起点:2.0 的 Agent 还叫 Project(原型),3 的 Agent 有了平台、有了生态、有了定价。Pichai 那句”20 亿 AI Overviews 月活、6.5 亿 Gemini App 月活”才是真正的护城河——别人在卖模型,Google 在卖一个已经接入 20 亿人的智能体网络。
第二篇 3 Deep Think 与 3 Flash:并行推理登顶,混合推理反超
2025 年 12 月,两个补位选手先后登场:12.04 的 3 Deep Think 把推理扩展推向并行极限;12.16 的 3 Flash 用混合推理把轻量模型做到”反超旗舰”,并成为 Gemini App 的默认模型。
一、背景:Pro 之外的补全
3 Pro 解决了”最强”,但两个缺口还在:一是”最难”的任务还需要更强的推理(Deep Think);二是”日常”的任务需要快而便宜的主力模型(Flash),毕竟 3 Pro 的 $2/$12 定价不适合做 Agent 循环。
二、3 Deep Think:推理时扩展的极限(2025.12.04)
3 Deep Think 不是独立模型,而是 3 Pro 的推理时扩展模式,面向 AI Ultra 订阅($249.99/月)。它把计算更多地花在推理阶段,基于获 IMO / ICPC 金牌的 2.5 Deep Think 增强版:
- HLE 41.0%(无工具)、GPQA Diamond 93.8%、ARC-AGI-2 45.1%——ARC Prize 亲自验证,称为”空前”。
这是”深度与速度解耦”哲学的极端形态:需要数分钟级深度推理的任务,交给它。
三、3 Flash:混合推理,SWE-bench 反超 Pro(2025.12.16–17)
3 Flash 是 Gemini 3 系的主力,发布即成 Gemini App 默认模型(替换 2.5 Flash),也是搜索 AI Mode 的默认模型。
混合推理(hybrid reasoning) 是它的核心:模型能自己决定”想多少”——简单任务少想甚至不想,复杂任务放开来想。这是 2.5 Flash”可调思考预算”的系统化升级,思考量可调成为正式产品能力。
关键成绩:
- SWE-bench Verified 78%——反超 3 Pro(76.2%),成为当时编码 Agent 最强;
- GPQA Diamond 90.4%、HLE 33.7%;
- 日常任务 token 消耗比 2.5 Pro 少 30%,速度快约 3 倍;
- 定价 $0.50 输入 / $3.00 输出;
- 发布时 API 日处理量已破 1 万亿 token。
“反超”的意义: 这是”快慢两用”哲学的胜利——在编码这个 Agent 高频场景,轻量模型靠混合推理赢过了旗舰,价格却只是零头。
四、局限
3 Deep Think 只对 Ultra 订阅开放,普通用户用不上;3 Flash 发布时仍是预览状态,稳定性待观察;ARC-AGI-2 等部分成绩依赖工具(代码执行),与无工具分数口径需区分。
收尾:我的一点看法
第二篇这两款把 3 Pro 的”一面”补成了”一面多棱”:Deep Think 往深,Flash 往快,同一代里出现 41% HLE 和 78% SWE-bench 两种极致。特别是 3 Flash 反超 Pro 这件事,信号价值极大——它证明”思考量可调 + 轻量架构”可以同时拿到智能和速度,这是给所有”堆参数学派”的一记提醒:未来的竞争不在参数大小,而在思考调度。这也正是 2.5 留下的伏笔在这一代的结果。
第三篇 3.1 Pro:首个 “.1” 增量,AI 的”认真版本”
2026 年 2 月 12 日应用内上线、2 月 19 日官方发布。首次采用 “.1” 增量命名。GPQA 94.3% 公开最高、ARC-AGI-2 77.1%(3 Pro 的两倍多)。Gemini 3 的”冷静加强版”。
一、背景:3 Pro 之后,质量还能怎么挤
3 Pro 已经全面登顶,但 Google 在 2026 年初仍觉得旗舰有提升空间——尤其是 ARC-AGI-2 这类抽象推理,3 Pro 只有 31.1%,离”泛化智能”的叙事还差口气。
二、核心能力:同样的框架,更硬的推理
3.1 Pro 沿用稀疏 MoE 与 1M 上下文(Vertex 企业版 2M),输出提升到 66K,定价维持 $2/$12 不变。变化在推理质量上:GPQA、HLE、ARC-AGI-2 全线刷新。
三、关键成绩(2026.02 时点)
- GPQA Diamond 94.3%(无工具)——公开最高分;
- HLE 44.4%(带工具 51.4%);
- ARC-AGI-2 77.1%——3 Pro 的两倍多,被解读为”抽象推理接近实用”的关键一步;
- SWE-bench 80.6%、LiveCodeBench Pro 2887;
- LMArena 保持约 1501 Elo。
四、局限与影响
“.1” 命名背后是 Google 对”增量迭代”节奏的试水——不再等大版本,能力到点就发。代价是 3.1 Pro 的定位有点尴尬:它是 3 Pro 的”加强版”,但距离下一代(3.5 系列)只有 3 个月。它最大的意义是证明了 3 代架构仍有挖掘空间,也为后续 Flash 系列定下了”以 Pro 为锚”的基准。
收尾:我的一点看法
3.1 Pro 的价值不在惊艳,而在”稳”。ARC-AGI-2 从 31.1% 到 77.1% 这个跳跃尤其值得记一笔——抽象推理历来是 LLM 的软肋,这个数字说明 3 代架构在推理上还没到顶。它像是 Google 给投资人吃的一颗定心丸:即使 3.5 Pro 难产,3 代血统仍能靠打磨持续产出 SOTA。
第四篇 2026:世界模型、个人智能体与性价比旗舰
2026.05.19 I/O 发布 3.5 Flash / Omni / Spark;2026.07.21 发布 3.6 Flash / 3.5 Flash-Lite。这一年 Gemini 从”更强的模型”走向”更大的平台”:世界模型、24/7 个人智能体、9.5 亿月活、3200 万亿 token/月。
一、背景:I/O 2026,智能体成为主题
2026 年 I/O 的核心主题是”智能体 Gemini 时代”。Pichai 开场的数据很硬:Gemini App 月活 超 9 亿(一年前 4 亿)、AI Overviews 月活 25 亿、平台月处理 3200 万亿 token(同比 ×7)、开发者 850 万+、API 每分钟 190 亿 token。
二、Gemini 3.5 Flash:速度 4 倍、成本减半的智能体主力(2026.05.19)
3.5 Flash 是 3.5 系列首款模型,“结合前沿智能与行动能力”,目标是”不再需要在质量与速度之间二选一”。
- 输出速度约为其他前沿模型的 4 倍;Antigravity 内置优化版可达 12 倍;
- 全面超 3.1 Pro:Terminal-Bench 2.1 76.2%(3.1 Pro 70.3%)、GDPval-AA 1656 Elo(3.1 Pro 1314)、MCP Atlas 83.6%、CharXiv 84.2%;
- 定价 $1.50 输入 / $9.00 输出,比 3 Flash 贵 3 倍但比 3.1 Pro 便宜约 40%;官方口径”比其它前沿模型成本低一半以上”;
- 成为 Gemini App 与搜索 AI Mode 的全球默认模型。
三、Gemini Omni:世界模型(2026.05.19)
Omni 是”任意输入 → 任意输出”的世界模型系列,首款 Omni Flash 从视频输出起步:融合 Gemini 的推理 + Veo 的视频能力 + Nano Banana 的图片能力,能基于任意参考(图/文/视频/音频)生成连贯视频,支持对话式编辑——用一句话改角色、换背景、加特效。生成内容全部带 SynthID 水印。
官方叙事:未来 Omni 将”根据任何输入生成任何输出”。这是 Gemini 多模态主线的终点形态——从 1.0 的”原生多模态理解”走到”原生多模态生成万物”。
四、Gemini Spark:个人智能体(2026.05.19)
Spark 是 24/7 云端个人智能体,运行在 Google Cloud 专用虚拟机上,关掉电脑也能继续干活。深度集成 Gmail、Docs 及 30+ 三方工具:自动解析信用卡账单、盯收件箱提取截止日期、发每日摘要。配套 Daily Brief 个性化简报。
这是 Agent 主线从”开发者平台”(Antigravity)下沉到”普通用户助理”的产品化——对标行业热议的”龙虾”(OpenClaw)类个人代理。
五、3.6 Flash / 3.5 Flash-Lite:性价比双旗舰与 3.5 Pro 的难产(2026.07.21)
3.6 Flash(定价 $1.50 / $7.50)主打”更少 token 做同样的事”:
- 输出 token 平均省 17%,DeepSWE 类编码任务最高省 65%;
- 基准全面提升:DeepSWE 37% → 49%、MLE-Bench 49.7% → 63.9%、OSWorld-Verified 78.4% → 83%、GDPval-AA v2 1421;
- 计算机操作(computer use)变成 API 的内建客户端工具。
3.5 Flash-Lite(定价 $0.30 / $2.50)是 3.5 家族最快最便宜:350 token/秒,在 SWE-Bench Pro、OSWorld 等基准上反超更大的 3 Flash。
3.5 Pro 跳票与 Gemini 4: 原定 6 月发布的 3.5 Pro(2M 上下文 + Deep Think)因编码性能不达标一再推迟,6 月底重置训练数据仍不如预期,截至 7 月下旬仅限企业与政府伙伴测试。同一天 Google 宣布史上最激进的预训练已启动——Gemini 4。Q2 财报: Gemini App 月活 9.5 亿、日活同比 ×3;Antigravity 周活 240 万;单季资本开支 449 亿美元(+100%)。
六、局限
3.5 Flash 的”快”伴随 token 用量上升,实际运行成本按 Artificial Analysis 估算比 3 Flash 高 5 倍多;Omni 首版仅视频输出,与顶级视频模型的差距被部分评论诟病;Spark 的隐私边界(读取邮箱/账单)仍是敏感话题;3.5 Pro 跳票说明”旗舰 + 编码强”的目标比想象中难,Gemini 4 是被迫提前还是战略换挡,还要看 2027。
收尾:我的一点看法
2026 这一年,Gemini 的主战场从”模型排行榜”转移到了”生态落地”。3.5 Flash 的 4 倍速、Omni 的世界模型、Spark 的 24/7 助理,加上 9.5 亿月活和 3200 万亿 token/月的平台数据——Google 真正卖的不再是某个模型,而是”搜索 + 工作流 + 云端 + 硬件”这张网。3.5 Pro 跳票反而暴露了一个有意思的事实:连 Google 这样的巨头,在”旗舰模型既要最强又要稳定”上也照样翻车。它提醒我们,Gemini 的叙事从来不只是”模型多强”,而是”这套体系能不能闭环”——从这个角度,Gemini 4 才是真正的下一个里程碑。
系列总评
Gemini 3 系列放在 Gemini 发展史里,是”从模型到智能体平台”的完成态。3 Pro 用 Antigravity 把 Agent 从原型变成平台,3 Flash 用混合推理证明”快慢两用”不是口号,3.1 Pro 用抽象推理的跃迁证明架构还有余量,3.5/3.6 一代则把战场推向成本、速度与生态规模。三个分水岭(1.0 原生多模态、2.0 Agentic、2.5 思考)在 3 代汇流成同一件事:能理解世界、能深度思考、能自动干活的真实智能体。而 3.5 Pro 的跳票与 Gemini 4 的启动,又提醒我们这条线远未到终点——Google 的下一个故事,已经悄悄开讲。
附:核心数据速查
版本时间线
| 时间 | 版本 | 关键点 |
|---|---|---|
| 2025.11.18 | 3 Pro + Deep Think + Antigravity | 全面登顶、真实 Agent、Antigravity 平台 |
| 2025.12.04 | 3 Deep Think(AI Ultra) | HLE 41%、ARC-AGI-2 45.1% |
| 2025.12.16 | 3 Flash | 混合推理,SWE-bench 78% 反超 Pro |
| 2026.02.12–19 | 3.1 Pro | GPQA 94.3%、ARC-AGI-2 77.1% |
| 2026.05.19 | 3.5 Flash / Omni / Spark | 4 倍速、世界模型、个人智能体 |
| 2026.07.21 | 3.6 Flash / 3.5 Flash-Lite | 性价比双旗舰;Gemini 4 预训练启动 |
3 Pro 关键 benchmark(2025.11)
- LMArena 1501 Elo;HLE(无工具)37.5%;GPQA Diamond 91.9%;SimpleQA Verified 72.1%
- SWE-bench Verified 76.2%;ARC-AGI-2 31.1%;AIME 2025(带代码执行)100%
3 Flash / 3 Deep Think / 3.1 Pro
| 项目 | 数值 |
|---|---|
| 3 Flash SWE-bench | 78%(反超 3 Pro) |
| 3 Flash 定价 / 速度 | $0.50/$3.00;比 2.5 Pro 快 3 倍、token 少 30% |
| 3 Deep Think | HLE 41.0%、GPQA 93.8%、ARC-AGI-2 45.1% |
| 3.1 Pro | GPQA 94.3%、HLE 44.4%(带工具 51.4%)、ARC-AGI-2 77.1%、SWE-bench 80.6% |
定价速览(每百万 token,输入/输出)
| 模型 | 输入 | 输出 |
|---|---|---|
| 3 Pro / 3.1 Pro(≤200K) | $2.00 | $12.00 |
| 3 Pro / 3.1 Pro(>200K) | $4.00 | $18.00 |
| 3 Flash | $0.50 | $3.00 |
| 3.5 Flash | $1.50 | $9.00 |
| 3.6 Flash | $1.50 | $7.50 |
| 3.5 Flash-Lite | $0.30 | $2.50 |
2026 生态数据(I/O 2026 / Q2 财报)
- Gemini App 月活 9.5 亿(I/O 时超 9 亿);AI Overviews 月活 25 亿
- 平台月处理 3200 万亿 token(同比 ×7);API 每分钟 220 亿 token
- Antigravity 周活 240 万;单季资本开支 449 亿美元(+100%)
关键概念清单
- Antigravity = 智能体开发平台(编辑器 + 终端 + 浏览器三端操作)
- Generative UI = 动态生成可交互界面
- hybrid reasoning = 混合推理(思考量可调)
- Deep Think = 深度推理扩展模式(并行假设推理)
- world model = 世界模型(任意输入 → 任意输出)
- SynthID = 生成内容数字水印
- computer use = 计算机操作能力(GUI 自动化)
- GDPval-AA / Terminal-Bench / MCP Atlas = 真实工作/终端/工具调用基准
- AI Ultra = 顶级订阅档($249.99/月 → $200/月,另设 $99 档)
- MAU = Monthly Active Users,月活跃用户
附:Gemma 开源线速览
Gemini 是闭源旗舰,但 Google 同时在开源一条同源分支——Gemma,与 Gemini 共享数据与蒸馏技术,却走完全不同的发布节奏:
- Gemma 1(2024.02.21):2B / 7B 两档开源,从 Gemini 技术蒸馏而来,首个”源可用”的 Gemini 后代;
- CodeGemma / RecurrentGemma / PaliGemma(2024.04–05):代码专用、Griffin 线性循环架构、视觉语言三路开花;
- Gemma 2(2024.06.27):9B / 27B,滑窗 + 全局注意力交替,27B 靠知识蒸馏从大模型提炼,8K 上下文;
- Gemma 3(2025.03.10):1B / 4B / 12B / 27B,多模态 + 128K 上下文 + 140+ 语言,可函数调用;
- 之后还有 Gemma 3n、MedGemma、PaliGemma 2 等垂直变体,2026 年更推出了 Apache 2.0 协议的 Gemma 4。
Gemma 与 Gemini 的关系,是”同一棵技术树上开的两朵花”:Gemini 追求封闭的前沿极致,Gemma 输出可落地的开源普惠。对社区而言,Gemma 最大的价值是让普通人能跑上”Gemini 血统”的模型;对 Google 而言,它是生态占位的战略棋子——用开源守住开发者基本盘,用 Gemini 打前沿阵地。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





