mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
5092 字
15 分钟
Gemini 1.0:原生多模态
2026-07-20

Gemini 1.0 论文解读:原生多模态,从零开始把五路感知揉进一个模型#

论文:Gemini: A Family of Highly Capable Multimodal Models 作者:Google DeepMind(Gemini Team,含 Google Research),Hassabis 挂帅 Gemini 是 Google DeepMind 合并后的第一个孩子,也是”原生多模态”这条路线第一次被完整走通。它把文本、代码、音频、图像、视频五种模态从零一起预训练,而不是像 GPT-4V 那样事后拼接视觉编码器。这篇论文定义了整个 Gemini 世系的底层哲学,之后 1.5、2.0、3 系全是在这条地基上盖楼。理解 Gemini 发展史的分水岭①,就理解这一篇。


一、引言:2023 年底,谷歌必须出一张牌#

时间回到 2023 年末。ChatGPT 已经统治舆论场近一年,GPT-4 凭 86.4% 的 MMLU 成为公认最强的通用模型;谷歌内部却还在用”拼接式多模态”的思路追赶——给一个纯文本 LLM 外接视觉编码器,凑出一个能看图的模型。这种拼装货看图说话可以,一到跨模态复杂推理就露怯。

转折点是 2023 年 4 月 20 日,Google Brain 与 DeepMind 合并为 Google DeepMind,Hassabis 任 CEO。新部门立项的第一个重点项目,就是这个 Gemini。项目名字起得意味深长——双子座,两套血统合一:DeepMind 带来 AlphaGo、AlphaFold 那套研究驱动的科学 AI 文化,Google Brain 带来 Transformer、TPU 的基建基因。

2023 年 12 月 6 日,Pichai 官宣 Gemini 1.0,定位”迄今规模最大、能力最强的通用模型”。这篇论文(arXiv<2312>.11805)随之公开。

二、核心创新:原生多模态,而不是拼接#

论文第一个要解决的问题:什么叫”多模态”?

之前的主流做法(拼接式):先分别训练一个纯文本 LLM 和一个视觉编码器(如 CLIP),推理时把图像过编码器,把图像特征”塞”进文本模型的输入序列。GPT-4V、LLaVA 都是这个路子。好处是省事,坏处是视觉信息和语言信息是两个空间拼出来的,跨模态推理(看图还要推数学、推理因果)明显吃力,常常要外挂 OCR 把图里的字抠出来才能干活。

Gemini 的做法(原生多模态,natively multimodal):从一开始就用文本、代码、音频、图像、视频五种模态的数据做联合预训练(joint pretraining)。训练时模型直接吃原始信号(图像像素、音频波形、视频帧),而不是吃”别人先提好的特征”。论文的原话是”natively multimodal”——多模态不是后装的功能,而是模型天生的属性。

原生多模态直接带来的红利

  • 无需 OCR 辅助就能端到端理解图像。谷歌官方的图说:图像基准里 Gemini Ultra 在没有 OCR 的情况下超越了之前所有 SOTA;
  • 音频直接理解。音频帧可以作为 token 流进模型,Gemini Ultra 的语音识别和语音翻译分数双双超过 Whisper(那是当时最强的专用语音模型);
  • 跨模态推理是原生的。看图 + 听音 + 读题能在一个模型内同时发生,而不是靠外部拼装。

一句话概括这篇论文的技术主张:模态是统一的计算原语,从零一起训,比事后拼接强。这句话后来成了 Gemini 发展史方法论里的第二条原则——“原生多模态优于拼接”。

三、模型家族:Ultra / Pro / Nano 三档#

Gemini 1.0 不是单点,而是一个家族(family),论文标题里就写着:

  • Gemini Ultra:最大、最强,面向高度复杂任务。基准霸榜的主角,MMLU 90.0% 就是它拿的;
  • Gemini Pro:多任务通用主力,性能/成本平衡,发布当天就接管 Bard;
  • Gemini Nano:端侧模型,跑在手机上。又细分为 Nano-1(1.8B 参数,低内存设备)和 Nano-2(3.25B 参数,高内存设备),首发预装 Pixel 8 Pro(录音摘要、Gboard 智能回复)。

三档尺寸验证了一个谷歌一直想做的事:从数据中心到手机,同一个模型家族无缝覆盖。这也解释了为什么后来 1.5 会发展出 Flash 轻量线、2.0 会继续做 Flash-Lite——家族化的产品思路从 1.0 就定下了。

四、核心技术细节#

多模态编码器与信号处理。 论文对多模态编码器(multimodal encoder)着墨不多,但点明了关键:图像/视频/音频各有专门的编码模块把原始信号变成序列,其中图像与视频采用时序整合(temporal integration)——视频是一帧一帧进编码器,再把帧序列在时间轴上拼成 token 序列喂给 Transformer。这是后来 1.5 能”看懂一小时视频”的技术伏笔。

算力底座:TPU。 Gemini 1.0 在 TPU v4 和 v5e 上大规模预训练,同日谷歌还发布了更强的 TPU v5p。论文里罕见地给出一个工程数字:通过检查点优化、静默数据损坏检测(silent data corruption detection)和 GSPMD 并行框架,训练好效率(goodput)做到 97% 以上——意思是每 100 单位算力时间,97 以上是真在训练模型,而不是空转或等待。这背后是谷歌”模型-系统-硬件三位一体”的方法论,也是 Gemini 后来每次迭代都快的原因之一。

上下文窗口 32K。 放在 2023 年底不算最长,但对视频理解已经够用。论文里 Ultra 在 32K 内做长上下文检索准确率约 98%。

评测方法论:把”思考时间”算进分数。 Gemini 1.0 的评测有个容易被忽略的设计——论文系统性地给语言任务加了思维链(Chain-of-Thought,CoT)提示自一致性采样(self-consistency,多次采样后多数投票)。MMLU 的 90.0% 就是 CoT@32 的成绩:让模型先”想”再答,采样 32 次取最优。这套做法后来成了 Gemini 系(以及整个行业)刷推理类基准的标准姿势。它带来一个好处(推理能力被真正榨出来),也埋下一个隐患(同样的模型,换评测口径分数可以差好几个点,GPT-4 对比时要看准是不是同一口径)。

超参选择的哲学:Chinchilla 最优规模律。 论文提到模型配置遵循 DeepMind 的 Chinchilla 计算最优规模律(compute-optimal scaling),即模型参数和数据量按算力预算协同缩放,而不是无脑堆参数。这也解释了为什么 Ultra 的参数量始终保密——对谷歌来说,参数量本来就是按算力倒推出来的工程变量,不是宣传卖点。

五、评估成绩:MMLU 首破人类专家线#

先说最扎眼的数字。MMLU(大规模多任务语言理解,覆盖数学、物理、历史、法律、医学、伦理等 57 个学科)上,Gemini Ultra 以 CoT@32(32 次思维链采样)拿到 90.0%,成为第一个超过人类专家(89.8%)的模型,GPT-4 是 86.4%。

32 项学术基准里,30 项超过当时的 SOTA。 Hassabis 在发布会上亲自对比过:“我们跑了 32 个基准和 GPT-4 比,30 项大幅领先。”

其他关键成绩(全为 Ultra):

  • MMMU 59.4%(多学科多模态理解,GPT-4V 56.8%);
  • HumanEval 74.4%(0-shot,代码生成,GPT-4 API 67.0%);
  • GSM8K 94.4%、MATH 53.2%、BIG-Bench Hard 83.6%;
  • 视觉全面超 GPT-4V:VQAv2 77.8% vs 77.2%、TextVQA 82.3% vs 78.0%、DocVQA 90.9% vs 88.4%、InfographicVQA 80.3% vs 75.1%、MathVista 53.0% vs 49.9%
  • 视频超 Flamingo:VATEX 62.7% vs 56.0%、Perception Test MCQA 54.7% vs 46.3%;
  • 音频超 Whisper:CoVoST 2 语音翻译 40.1 vs 29.1、FLEURS 语音识别 WER 7.6% vs 17.6%(越低越好)。

注意一个有意思的对比:MMLU 是纯文本任务,Gemini 靠”思维链 + 多采样”拿了 90.0%,超过 GPT-4 的 86.4% 近 4 个点——这说明它的推理能力是真强,不只是多模态方面。这一点后来被 1.5 继承:MMLU 多数投票能到 91.7%。

AlphaCode 2:Gemini 驱动竞赛编程。 论文没有细讲,但配套发布的 AlphaCode 2 是理解 Gemini 编码能力的另一面镜子。它以专门微调的 Gemini 为引擎,配合搜索和重排序,在 Codeforces 竞赛编程平台上的表现超过 85% 的参赛者(初代 AlphaCode 只有约 50%)。这说明 Gemini 1.0 的代码能力不是只会在 HumanEval 上背题,而是能扛住真实竞赛题的压力。竞赛编程成了 Gemini 系后续几代反复秀肌肉的保留节目,直到 2025 年的 2.5 Deep Think 拿到 USAMO 49.4%,这条线越拉越强。

六、与 GPT-4 / 其他模型的对比#

论文里的对比表格见下(官方口径,GPT-4V 指 OpenAI 视觉版):

能力域基准Gemini UltraGPT-4 / GPT-4V备注
语言MMLU(CoT@32)90.0%86.4%(GPT-4)首超人类专家 89.8%
代码HumanEval(0-shot)74.4%67.0%(GPT-4 API)
数学GSM8K / MATH94.4% / 53.2%92.0% / 52.9%(GPT-4)
通用推理BIG-Bench Hard83.6%未提供
图像MMMU59.4%56.8%(GPT-4V)多模态推理
图像VQAv2 / TextVQA / DocVQA77.8 / 82.3 / 90.977.2 / 78.0 / 88.4全超
视频VATEX62.756.0(Flamingo)GPT-4V 无视频
音频CoVoST 2 翻译40.129.1(Whisper v2)原生音频优势

表中的规律很清晰:纯文本接近但略超 GPT-4,多模态(尤其视频、音频)直接甩开竞品一个身位。这印证了”原生多模态”的路线收益——拼接式模型的短板,恰是 Gemini 的强项。

七、争议与传闻:光鲜背后的两朵乌云#

演示视频剪辑风波。 发布时谷歌放出一段 Gemini 用语音实时识别画鸭子、猜房间朝向的演示视频,观感惊艳。但很快被扒出视频是剪辑过的——实际是用静态图像帧按序列喂给模型、再叠字幕和语音合成,并非视频实时输入。DeepMind 研究副总裁 Oriol Vinyals 后来承认:“视频里的交互是真实发生的,但为了演示效果被缩短了。“这成为 Gemini 1.0 口碑上的最大污点,也给”谷歌发布会演示 = 演示”的行业刻板印象添了素材。

参数量传闻。 论文没有公布参数量。SemiAnalysis 在 2023 年 11 月(发布前)报道,Gemini Ultra 约 1.8 万亿参数(MoE 架构),并猜测训练算力是 GPT-4 的 5 倍。但谷歌始终不予证实,这个数字只能当传闻。直到 2026 年今天,Ultra 的确切参数规模仍是行业未解之谜。

另外发布节奏上也有插曲:The Information 曾报道 Pichai 临时取消了几场线下发布活动,因为 Gemini “处理某些非英语查询时不可靠”。这也是为什么 Gemini 1.0 的多语言宣传相对低调。

八、落地:Bard 换芯、Pixel 预装、API 开放#

论文之外,1.0 的落地节奏也值得记一笔,因为它是 Google DeepMind 第一次把”模型-产品-硬件”三者拧在一起:

  • 发布当天(2023.12.06):Bard 换用专门微调的 Gemini Pro 内核(Bard 自上线以来最大升级),面向 170+ 个国家/地区开放英文版;
  • Pixel 8 Pro 首发 Nano:录音摘要、Gboard 智能回复(先支持 WhatsApp);
  • 2023.12.13:开发者通过 Google AI Studio 和 Vertex AI 的 Gemini API 用上 Pro;
  • 2024.02.08:Bard 正式更名 Gemini,Ultra 上线 Gemini Advanced 订阅(Google One AI Premium,$19.99/月)。

这步棋把 Gemini 从”一个模型”变成了”一条产品线”。后续 1.5、2.0、3 系的每一次发布都沿用这个”模型发布即全产品线接入”的节奏——这在行业里是谷歌独有的分发优势。另外注意时间口径:Bard 更名 Gemini 是 2024 年 2 月 8 日,2023 年 12 月 6 日只是 Bard 换用 Gemini Pro 内核,两者常被混为一谈(详见《Gemini 发展史》附录 C)。

九、结论与局限#

论文的结论自信而克制:Gemini 1.0 系列在 32 项基准中 30 项超 SOTA,多模态能力全面领先,验证了”从零联合预训练”的路线。

局限也同样坦承:

  • 语言覆盖不均衡,非英语尤其是低资源语言表现不稳(发布前连发布活动都为此取消过);
  • 推理仍是短板的领域存在:HellaSwag 87.8% 落后 GPT-4 的 95.3%(论文承认常识推理偏弱);
  • 上下文只有 32K,长文档、长视频处理能力有限——这个问题被 1.5 的百万上下文直接解决;
  • 模型太大、推理成本高,Ultra 到 2024 年 2 月才随 Gemini Advanced 开放。

还有一个必须记入局限的教训:评测口径与营销的错位。90.0% 的 MMLU 是 CoT@32 刷出来的,演示视频是剪辑出来的,加上参数量保密、非英语能力不稳,1.0 给业界留下了”谷歌数字要打折看”的坏印象。技术本身的成色是实的,但第一代发布的传播管理是失败的——这个教训直到 2.5 Pro 用 LMArena 登顶才真正洗白。


收尾:我的一点看法#

Gemini 1.0 在我眼里是 2023 年最重要的模型论文之一,重要性甚至被低估了。它不是 GPT-4 的又一个竞品,而是把”多模态”从一个补丁升级成了内核。回头看,GPT-4V 是”文本模型的视觉外挂”,Gemini 是”五模态的原生公民”。这个路线选择的分量,在 1.0 时还看不太出来,但两年后 Gemini 3 系的多模态全面登顶、DeepMind 方法论明确把”原生多模态优于拼接”列为原则,当初的赌注赢麻了。

那个 goodput 97% 的细节我特别想点出来。Gemini 1.0 能在 2023 年底赶出来,靠的不只是研究,还有谷歌二十年攒下的 TPU 和分布式训练工程。很多团队在同样的时间只有研究没有基建,Gemini 是”模型-系统-硬件三位一体”的第一块完整拼图,这一条后来成为它持续快速迭代的隐形护城河。

MMLU 90.0% 超过人类专家 89.8%,数字上是象征性的,但象征性本身很重要——它第一次让”模型超过人类平均水平”从口号变成可复现的 benchmark。当然,90.0% 靠 CoT@32 多采样堆出来的,评测口径要谨慎看待,后面 Gemini 1.5 的 91.7% 多数投票、以及后来 MMLU 被刷到接近饱和,都说明这个基准本身已经不够用了。

争议也要记下账:演示视频剪辑说明谷歌的营销团队跑在了工程前面,这种”先讲故事再补细节”的做法伤害了信誉。而在发布之前临时取消活动、承认非英语语言不稳,又说明 1.0 的产品完成度并没有宣传里那么高。原生多模态的路线是对的,但第一代产品并不完美——这一点,Gemini 1.5 用三个月后的百万上下文回答了一切。

最后说历史地位。把这篇论文放回 Gemini 发展史的时间轴上:它是三个分水岭的第一个(1.0 原生多模态确立),后面 2.0 的 Agentic 转向、2.5 的思考模型,全部建立在”五模态原生统一”这个地基上。甚至可以说,Gemini 1.0 确立的不只是谷歌自己的路线——它证明了”原生多模态”是一个可行的主叙事,逼着全行业重新思考多模态模型的架构选择。两年后回头看,OpenAI 的 GPT-4o、GPT-5 系列也转向了”原生统一多模态”(而不是继续拼接),这正是 1.0 种下的路线被验证的信号。单凭这一点,这篇论文就配得上”分水岭”三个字。


附:核心数据速查#

模型家族

型号定位关键参数/备注
Gemini Ultra最强,复杂任务参数量未公布(SemiAnalysis 传闻 ~1.8T MoE,未证实)
Gemini Pro通用主力,驱动 BardMMLU 79.1%、HumanEval 67.7%
Gemini Nano端侧Nano-1 1.8B / Nano-2 3.25B,Pixel 8 Pro 首发

训练与架构

  • 原生多模态:文本/代码/音频/图像/视频五模态从零联合预训练
  • 算力:TPU v4 + v5e,同日发布 TPU v5p
  • 上下文:32K(32K 内长上下文检索准确率约 98%)
  • 工程:GSPMD、静默数据损坏检测,goodput >97%
  • 后续对齐:SFT + RLHF(PPO,基于人类偏好奖励模型)

关键 benchmark(Ultra)

基准Gemini Ultra对比
MMLU(CoT@32)90.0%人类专家 89.8%、GPT-4 86.4%
MMMU59.4%GPT-4V 56.8%
HumanEval(0-shot)74.4%GPT-4 API 67.0%
GSM8K / MATH94.4% / 53.2%GPT-4 92.0% / 52.9%
VQAv2 / TextVQA / DocVQA77.8 / 82.3 / 90.9GPT-4V 77.2 / 78.0 / 88.4
VATEX(视频)62.7Flamingo 56.0
CoVoST 2(音频翻译)40.1Whisper v2 29.1
32 项基准30 项超 SOTAHassabis:“30/32 领先 GPT-4”

关键概念清单

  • natively multimodal = 原生多模态(从零联合预训练,非事后拼接)
  • joint pretraining = 联合预训练(五模态数据一起训)
  • VLM = Vision-Language Model,视觉-语言模型(拼接式代表)
  • multimodal encoder = 多模态编码器(图像/视频/音频信号 → token 序列)
  • temporal integration = 时序整合(视频帧序列的时间轴拼装)
  • CoT@32 = Chain-of-Thought 思维链采样 32 次
  • self-consistency = 自一致性(多次采样多数投票)
  • MMLU = Massive Multitask Language Understanding,57 学科综合测试
  • MMMU = Multimodal Multidisciplinary Understanding,多学科多模态推理
  • goodput = 训练好效率(真实训练算力占比)
  • GSPMD = General and Scalable Parallelization for MDL,谷歌大规模并行框架
  • silent data corruption = 静默数据损坏(训练中未被发现的内存/传输错误)
  • OCR = Optical Character Recognition,光学字符识别
  • MoE = Mixture of Experts,混合专家架构(SemiAnalysis 传闻 Ultra 为 MoE,未证实)
  • compute-optimal scaling = 计算最优规模律(Chinchilla 定律,参数与数据按算力协同缩放)
  • AlphaCode 2 = 基于 Gemini 的竞赛编程系统(Codeforces 超 85% 参赛者)
  • Codeforces = 全球知名竞赛编程平台
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Gemini 1.0:原生多模态
https://mizuki-eaf.pages.dev/posts/gemini/gemini-10原生多模态/
作者
无名之子
发布于
2026-07-20
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录