mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4417 字
12 分钟
DALL-E 与 CLIP 与 Whisper:多模态暗线
2026-07-13

《DALL-E 与 CLIP 与 Whisper》解读:OpenAI 的多模态暗线,在 ChatGPT 之前就铺好了#

大多数人聊 ChatGPT 历史只看文本这一条线:GPT-1 → GPT-2 → GPT-3 → InstructGPT → ChatGPT → GPT-4。但 OpenAI 从 2021 年初就开始在另一片战场悄悄囤货——多模态。DALL-E(图像生成)、CLIP(图文对齐)、Whisper(语音识别)是三条相对独立的暗线:2021 年 1 月同一天放出前两条,2022 年 9 月放出第三条。当时没多少人当回事,等到 GPT-4V、DALL-E 3、GPT-4o 陆续登场,你才发现那些当年”只是能玩”的模型,全是同一盘棋的棋子。这篇就把这三条线按时间顺序拆开看。


DALL-E 解读:把 GPT-3 的”续写”搬到图像上#

论文:Zero-Shot Text-to-Image Generation 作者:Aditya Ramesh 等,OpenAI 发布背景一句话:2021-01-05 发布(arXiv<2102>.12092),核心主张是”自回归 Transformer 可以零样本生成图像”;在 ChatGPT 发展史上,它是 OpenAI 把”一切皆 token”哲学推到图像模态的第一次尝试,也为后来的 DALL-E 2/3 定下了路线。

一、引言:图像生成卡在”必须专门训练”四个字上#

2021 年之前的 text-to-image 是 GAN 的天下:AttnGAN、DF-GAN、DM-GAN 这些模型在 MS-COCO、CUB 这类固定数据集上练得有模有样,但本质上是针对某个标签分布做深度过拟合,换个数据集、换种画风立刻露馅,每接一个新任务都得重新标数据、重新训练。

DALL-E 的赌注很 OpenAI:不针对任何数据集,直接从互联网抓 2.5 亿(250 million)图文对,把图像当成一串 token,用 GPT-3 式的自回归 Transformer 去”续写”。既然语言模型能靠”预测下一个词”涌现出写作能力,为什么图像不能靠”预测下一个图像 token”涌现出画图能力?

还有一个容易忽略的点:DALL-E 和 CLIP 是同一天(2021 年 1 月 5 日)发布的,CLIP 不是配角——DALL-E 推理时要靠 CLIP 给候选图打分重排。这对”生成 + 对齐”的组合,后来成为 OpenAI 多模态的标配打法。

二、方法:dVAE 压缩 + 自回归 Transformer 续写#

训练分两个阶段。Stage 1:训练一个 dVAE(discrete variational autoencoder,离散变分自编码器),把 256×256 的 RGB 图像压缩成 32×32 = 1024 个图像 token,每个 token 从 8192 大小的码本里取值。压缩到这种程度,Transformer 的上下文长度直接缩减 192 倍,模型的容量不用浪费在像素级高频细节上,可以专心建模”低频结构”——轮廓、语义、物体关系。

Stage 2:把最多 256 个 BPE 编码的文本 token 和 1024 个图像 token 拼成一个序列,训练自回归 Transformer 建模两者的联合分布(目标等价于最大化 ELBO)。整个模型约 120 亿(12B)参数——论文摘要里写得明明白白,不是传闻。dVAE 用连续松弛(continuous relaxation)训练,避开了 VQ-VAE 常见的码本坍缩、死码恢复等一堆麻烦。

推理时有个关键 trick:temperature=1 采样 512 个候选图,用 CLIP 按文本-图像匹配度打分,取前 32 个展示。这个”生成 + 检索”两步走,很大程度上弥补了自回归生成在细节上的拉胯。

三、成绩:零样本 FID 追平 SOTA,人类投票更买账#

在 MS-COCO 上做零样本评估(完全不看训练标签):不 blur 时 FID 约 28,和当时最好的监督方法基本打平;给验证集和生成图同时加一点高斯模糊(radius 1),FID 反超当时 SOTA 约 6 分。这里必须说实话:FID 是加了模糊之后算的,论文自己也承认 dVAE 的重压缩让高频细节(尤其是文字、人脸)一塌糊涂。

人类评估是它的主场。和当时最强的 DF-GAN 对比,90% 的投票认为 DALL-E 样本更真实,93% 认为更贴合标题。

能力盘点:组合概念(“穿企鹅装的鳄鱼""把胡萝卜做成喂鸟器”)非常惊艳;零样本风格迁移(“梵高风格的椅子”)也很能打;但物体计数不准(“5 个红色方块”数不对)、图内文字渲染基本不可用。一到窄分布就露馅:细粒度鸟类数据集 CUB 上,零样本 FID 和当时领先方法差了近 40 分

收尾:我的一点看法#

今天回看 DALL-E,我最佩服的不是它画出了什么,而是它把”scaling + 自回归 + 把一切变成 token”这套 GPT 哲学硬搬到图像上,而且居然成立了。它证明 OpenAI 想做的不是一个”语言模型”,而是一个”通用序列模型”——语言、图像、声音,在它眼里都是同一件事。这个思想比 DALL-E 本身值钱得多。

但我对”零样本”这个宣传口径一直保留意见。512 个候选 + CLIP 重排,本质上是”生成后检索”,FID 的漂亮数字有一部分是重排给的,不是模型纯生成的。直到 DALL-E 2/3 改用 CLIP 图像嵌入做 prior、配上扩散模型,细节问题才真正被解决。

放在 ChatGPT 史里,DALL-E 的意义是”练手”:它让 OpenAI 提前两年摸清了多模态对齐的路子,也为 DALL-E 3 的 prompt rewriting 埋了伏笔——等 GPT-4 学会写长提示词,文生图的质量就会借这股力起飞。


CLIP 解读:用 4 亿图文对,把视觉变成可检索的向量#

论文:Learning Transferable Visual Models From Natural Language Supervision 作者:Alec Radford 等,OpenAI 发布背景一句话:2021-01-05 发布(arXiv<2103>.00020),核心主张是”自然语言监督可以替代人工标注,让视觉模型零样本迁移”;在 ChatGPT 发展史上,它是 OpenAI 多模态储备里最值钱的一块地基——DALL-E 2/3、GPT-4V 的视觉理解全都踩在它的肩膀上。

一、引言:视觉模型被”固定标签”锁死了#

传统 CV 的流水线是:定义 1000 个类 → 雇人标注 → 训练分类头。这套东西的天花板很早就摸到了——标签集合是死的,模型永远学不会”标签之外的东西”,每次新增类别都要重新标一轮。

CLIP 换了个极其朴素的想法:不定义类。直接把一张图像和它旁边的自然语言描述拉进同一个向量空间,标题就是监督信号。下游任务想要什么类,用一句话”写”出来就行,连训练集都不用。

二、方法:对比学习,而不是生成式预测#

架构是双塔:图像编码器(ResNet 或 ViT)+ 文本编码器(12 层 Transformer)。训练时每个 batch 拿 N 个图文对,把图像向量和文本向量都投影到同一空间,算出一个 N×N 相似度矩阵,对角线是正样本,其余 N²−N 个全是负样本,用交叉熵做对比损失(contrastive loss,对比学习)。没有分类头,没有生成任务。

为什么不用”预测下一个词”式的生成目标?论文给了硬数据:同样的 4 亿图文对、同样的 ResNet-50 骨干,要把零样本 ImageNet 做到 30% 精度,生成式目标要 1.5 个 epoch,词袋预测要 0.5 个,对比学习只要 0.4 个——效率差出约 4 倍。对比目标把”跨模态对齐”直接作为任务本身,是 CLIP 全部方法论的核心。

数据是 WIT(WebImageText):从互联网抓的 4 亿(400 million)图文对。最大号的 ViT-L/14 训练大约烧掉 2 万 GPU 日。

三、成绩:零样本打平监督训练#

招牌数字:在 ImageNet 上零样本 top-1 达到 76.2%(ViT-L/14@336px + 80 个 prompt 模板集成),而同期在 128 万张标注图上监督训练的 ResNet-50 是 76.1%。一个从没见过 ImageNet 的模型,追平了专门在 ImageNet 上练过的模型——这件事在 2021 年之前被普遍认为不可能。

27 个分类基准(OCR、卫星图、医学图、动作识别、细粒度分类等)上做零样本 vs 监督线性探针(linear probe)对比,CLIP 赢了 16 个数据集,而且赢在 Kinetics700 动作识别(+14.5)、UCF101(+7.7)这类需要理解”动词/行为”的任务上。

工程细节也很重要:prompt 模板(“a photo of a {label}.”)单独贡献 +1.3%,80 个模板的 embedding 集成再贡献 +3.5%,总共提升接近 5 个点,推理成本几乎为零。局限同样明显:车型、鸟种、肿瘤亚型这类细粒度识别弱;CLEVR 计数、交通标志这种合成/抽象任务直接崩盘。

收尾:我的一点看法#

CLIP 是我认为 OpenAI 整个多模态布局里回报率最高的一篇论文。它不抢眼球,但 DALL-E 2 的 prior 用它的图像嵌入,GPT-4V 的视觉编码和它同源,后来 DeepSeek-VL、LLaVA 这些开源多模态模型,几乎全在抄它的对比预训练配方。它是真正的”标准件”。

我更看重它”用语言指定分类器”这个动作——这本质上是视觉版的提示工程(prompt engineering):下游任务不需要训练集,只需要一句话。这个思想在 2021 年 1 月相当叛逆,两年后在 ChatGPT 时代变成了人人都会的常识。

它的毛病也实实在在:数据偏置(网络图文对严重偏向英语和欧美视觉语境)、对细粒度视觉感知(精确计数、空间关系)天然不擅长。CLIP 对齐的是”语义”,不是”视觉几何”。这两条直到今天仍是所有多模态模型的通病。


Whisper 解读:680,000 小时弱监督,把语音识别做成”以量取胜”#

论文:Robust Speech Recognition via Large-Scale Weak Supervision 作者:Alec Radford、Jong Wook Kim 等,OpenAI 发布背景一句话:2022-09-21 发布(arXiv<2212>.04356),核心主张是”用海量弱监督数据替代精细人工标注,让单一模型吃下识别/翻译/语言识别多任务”;在 ChatGPT 发展史上,它是 OpenAI 唯一把旗舰模型权重完全开源的先例,也是后来 GPT-4o 原生语音能力的底层引擎。

一、引言:语音识别的老问题是”数据太贵”#

2022 年前的 ASR 走的是”小数据 + 精细标注”路线:LibriSpeech 只有 960 小时带人工转写的音频,人工标注每分钟语音的成本极高。结果就是模型只能适应特定口音、特定环境,换个场景就要微调,还必须让用户先录一段话做 enrollment(声纹注册)。

Whisper 的逻辑很简单粗暴:与其纠结标注质量,不如把”质量”换成”数量”。它从网上抓了 68 万小时(680,000 hours)音频,配上机器生成、粗糙但海量的转写文本,弱监督硬训。规模上远超当时所有公开语音数据集的总和。

二、方法:一个 Transformer,五种尺寸,一套任务#

架构是标准的编码器-解码器 Transformer。音频切成 30 秒片段,转成 80 通道 log-Mel 频谱图,过两层一维卷积下采样,再进编码器;解码器自回归吐文本。最大的 large 版本约 15.5 亿(1.55B)参数,编码器和解码器各 32 层

多任务靠特殊 token 在一个模型里切换:<|startoftranscript|> 标记开头,<|zh|> 这类语言标签做语言识别,<|translate|> 把任意语言翻成英文,<|timestamps|> 决定要不要输出时间戳。语音识别、翻译、语言识别、时间戳对齐、语音活动检测,全是同一套权重。

模型分五档:tiny 39M / base 74M / small 244M / medium 769M / large 1.55B,方便不同算力部署。支持 99 种语言的转写,任意语言→英文翻译。

三、成绩:接近人类水平,还破天荒开了源#

在 Common Voice 英语集上,large 的 WER(word error rate,词错误率)降到 5.9% 附近,已经逼近人类水平(人工约 3%);在 LibriSpeech test-clean 上 WER 约 2.7%

鲁棒性才是它真正的卖点:不需要 enrollment,嘈杂环境、陌生口音、专业术语直接硬扛,零微调迁移到新领域。论文称在几乎所有评测集上都逼近甚至超过此前专门训练的模型。

最特殊的是开源决策:MIT 许可证,权重完全公开。这个决定后来被证明价值巨大——faster-whisper(提速约 4 倍)、whisper.cpp(纯 CPU 可跑)、WhisperX(词级时间对齐)长成了一个完整生态,Whisper 成了开源语音识别的事实标准。

收尾:我的一点看法#

Whisper 是我眼里 OpenAI 最”无私”的一篇——它是唯一一个把旗舰模型权重完整放出来的 OpenAI 模型,GPT 系列全都锁在 API 后面。我猜这不是情怀,是战略:语音不是 OpenAI 当时的核心收入线,把权重放出去换生态话语权和行业标准地位,这笔买卖划算。

技术上它验证了一个朴素到很多人不愿意承认的道理:数据量级上去之后,标注质量就没那么重要了。68 万小时弱监督,打平甚至超过精心标注的小数据模型——这就是 scale 的统治力,和 CLIP 的”4 亿对就够”是同一个故事的语音版。

放在 ChatGPT 史里,Whisper 是语音这条线的伏笔:GPT-4o 的原生语音对话、GPT 的语音输入,底层全是 Whisper 的技术。文本(GPT)、图像(DALL-E/CLIP)、语音(Whisper)三条线在 2024 年汇流成多模态。回头再看 2021-2022 年这几篇论文,全是同一盘棋,只是当时没人看清棋盘。


附:核心数据速查#

关键数字表格

模型指标数值对比/备注
DALL-E参数量120 亿(12B)论文自报,自回归 Transformer
DALL-E训练数据2.5 亿 图文对互联网抓取
DALL-EMS-COCO 零样本 FID28(不 blur)轻微 blur 后反超当时 SOTA 约 6 分
DALL-E人类评估90% 更真实 / 93% 更贴题对比 DF-GAN
CLIP预训练数据4 亿 图文对(WIT)对比学习
CLIPImageNet 零样本 top-176.2%追平监督 ResNet-50(76.1%)
CLIP27 数据集零样本对比16对手为监督线性探针 ResNet-50
Whisper训练数据68 万小时 弱监督音频远超当时所有公开语音数据之和
Whisper支持语言99任意语言→英文翻译
Whisper模型尺寸tiny 39M ~ large 1.55B五档,MIT 开源
WhisperCommon Voice 英语 WER5.9%人类约 3%,接近人类水平

关键概念清单

  • dVAE(discrete variational autoencoder,离散变分自编码器)= 把图像压成离散 token 的压缩器,DALL-E 的第一阶段
  • contrastive learning(对比学习)= 让正样本对靠近、负样本对远离的表示学习方法,CLIP 的核心
  • zero-shot(零样本)= 不经过任何下游数据训练,直接迁移到新任务
  • linear probe(线性探针)= 在冻结的特征上训练一层线性分类器,用来衡量特征质量
  • WER(word error rate,词错误率)= 语音识别里错词占比,越低越好
  • FID(Fréchet Inception Distance)= 生成图像分布与真实图像分布的差距,越低越好
  • weak supervision(弱监督)= 用机器生成或粗糙标签替代人工精细标注
  • BPE(byte pair encoding)= 子词切分算法,文本 token 化的常用方法
  • MoE、prompt rewriting 详见 GPT-4 与 DALL-E 3 解读,此处不展开
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

DALL-E 与 CLIP 与 Whisper:多模态暗线
https://mizuki-eaf.pages.dev/posts/chatgpt/dall-e-与-clip-与-whisper多模态暗线/
作者
无名之子
发布于
2026-07-13
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录