《GPT-4o 系统卡》解读:耳朵、眼睛、嘴长在同一张脸上——全模态原生模型的诞生
论文:GPT-4o System Card(系统卡)+ Hello GPT-4o(官方博客) 作者:OpenAI 发布背景一句话:2024-05-13 随 Spring Update 发布,核心主张是”用单个神经网络端到端处理文本、音频、图像、视频”,取代此前语音对话的”三模型流水线”;前置知识提示:GPT-4V 补了眼、DALL-E 3 补了手、Whisper 补了耳,但它们是拼装的多模态(上一站),GPT-4o 是第一个原生全模态(omni)模型,也为两个月后 GPT-4o mini 的”白菜价小模型”策略埋下伏笔。
一、引言:语音对话原来一直是个”翻译接力”
在 GPT-4o 之前,你跟 ChatGPT 说一句语音,背后其实跑着三个模型:第一个(Whisper)把你的话转成文字(ASR,自动语音识别),第二个(GPT-3.5 或 GPT-4)基于文字想答案,第三个再把答案转回语音(TTS,文本转语音)。一句对话的平均延迟,GPT-3.5 时代约 2.8 秒,GPT-4 时代更是拖到 5.4 秒。
三模型流水线最致命的问题还不是慢,而是丢信息。文字转录会把你的语气、情绪、背景噪音、几个人在说话全部滤掉;反过来,模型也说不出口笑、唱歌、语气起伏——因为它从没”听”过声音,只在一层文字里打转。OpenAI 自己说得很直白:流水线里”最聪明的那个模型”(GPT-4)恰恰是最瞎、最聋的那一个。
GPT-4o 的 o 是 omni(全模态/全能)的缩写。它用一个端到端训练的神经网络同时处理文本、视觉、音频,所有输入输出走同一个模型。这是 OpenAI 第一次把多模态从”拼装”做成”原生”——不是三辆车挂一个车厢,而是造了一辆多功能车。
它还很会做生意:文本和代码能力对标 GPT-4 Turbo,但 API 快 2 倍、价格便宜 50%,而且免费开放给所有 ChatGPT 用户。在 Llama 3、Gemini 接连压境的 2024 年 5 月,这一招既秀肌肉,又抢用户。
二、方法:一个网络,三种模态,一套 tokenizer
系统卡里能确认的架构信息不多,但有一条很关键:GPT-4o 是自回归(autoregressive)的全模态模型,文本、图像、音频统一编码成 token,由同一个 transformer 处理,音频输出也不走外部 TTS,而是模型直接生成。这就是”语音到语音”(speech-to-speech)的端到端路径——不做先转录、再回答的中间步骤。
代价是音频这条路需要专门处理:音频要先压缩成离散表示再进模型,训练数据里也加了海量音视频。所以系统卡的安全评估里,一大半篇幅都在审音频能力——说话人识别(speaker identification)、未经授权的语音克隆(voice cloning)、无根据推断(ungrounded inference)、不当音频内容生成。
音频输入要先过一层专门的编码器压缩成离散 token,再和文本 token 混进同一个序列。这套设计让模型天然掌握了”语音情感”——它听到的不是”文字加标点”,而是语速、音高、停顿。发布会现场它之所以会叹气、咳嗽、抢话、唱歌,就是因为音色和情绪是它的原生输入,不是事后加工。
训练数据按系统卡披露主要三块:公开网页数据、代码与数学数据、多模态数据(图像/音频/视频),外加数据合作方(比如和 Shutterstock 的图片合作)。语言方面换了一个新的统一 tokenizer,非拉丁语系的表示效率大幅提升——古吉拉特语能省约 4.4 倍的 token,泰卢固语 3.5 倍,这解释了它支持约 50 种语言的底气,也让多语言 API 的成本明显下降。
训练侧的过滤也没闲着:系统卡披露,预训练阶段就用 Moderation API 和安全分类器滤掉了 CSAM、仇恨言论、暴力、以及 CBRN 类有害内容,图像生成数据也单独做了过滤。OpenAI 的立场很明确:预训练过滤只能挡粗的,真正细的安全工作得靠后训练(post-training)和产品层的缓解措施来做。
数据上它也没有避讳:公开网页 + 代码数学 + 多模态数据 + 商业数据合作。“数据合作”这个词值得圈一下——OpenAI 从 2024 年起开始花钱买版权数据,Shutterstock 是第一批合作方。这既是补训练原料,也是给日益增多的版权官司提前买保险。它的对手们后来也照做了,但 OpenAI 起步最早。
系统卡的语音评测也分了细类:语音识别(ASR)、语音翻译、情感识别、多说话人场景。它把”听清”和”听懂”分开测——这在以前的模型卡里几乎没有。GPT-4o 是第一个让”音频能力”拥有独立评测维度的旗舰模型,后来的语音模型(包括字节、Google 的语音 AI)基本都照这个框架来。
安全部分是这份系统卡的重头戏,它也是第一个完整按 OpenAI Preparedness Framework(准备度框架)评估的旗舰模型:网络安全、生物威胁、说服力、模型自主性四类里,前三项是”低”,说服力一项压线在”中”。按 OpenAI 自己的规则,缓解后评分必须到”中”或以下才能上线——刚好卡线通过。整个评估动用了 70 多名外部专家做红队测试(red team)。
但它一发布就惹了个大麻烦:语音演示里的”Sky”音色被普遍认为神似演员斯嘉丽·约翰逊,后者公开谴责 OpenAI 在未获同意的情况下使用她的声音并要求下架,OpenAI 最终撤掉了 Sky。这个插曲和系统卡里”未经同意克隆声音”的风险评估叠在一起,成了 AI 语音产品绕不开的教材案例——评估报告写得再好,也管不住产品决策的擦边球。
三、成绩:232 毫秒开口,50 种语言,价格砍半
最震撼的数字是语音延迟:最短 232 毫秒,平均 320 毫秒,已经逼近人类对话的自然反应时间(约 210 毫秒)。对比之前 GPT-4 语音模式平均 5.4 秒,这是一次量级上的飞跃——AI 的”接话速度”第一次像真人。
文本能力:MMLU 88.7%,与 GPT-4 Turbo 基本打平,代码能力接近,非英语文本显著提升。API 定价每百万输入 token $2.5、输出 $10,比 GPT-4 Turbo 便宜 50%,速度翻倍。视觉和音频理解是它相对”拼装版”的最大增量:边看边聊、实时翻译、识别情绪、在多人对话里分辨说话人。
加上免费开放,GPT-4o 直接把”全模态助手”下沉到了每个普通用户手里。产品史上,这是 ChatGPT 从”文字聊天框”走向”随身 AI 助手”的关键一役——发布会当天演示的实时翻译、教人数学、识别情绪,全都长在”一个模型”这个地基上,而不是靠调度流水线。
基准上它也不是没对手。多语言这块,M3Exam(多语言考试基准)零样本成绩领先;视觉理解上,它把 GPT-4V 时代的”能看图”升级成了”边看边理解动作和空间”。发布会那段”和可汗学院的萨尔·可汗在镜头前实时解数学题”的演示,靠的就是视觉、音频、文本三条通道同时工作——这三条线,也是它和 DALL-E 3、Whisper 那批”拼装模型”最本质的区别。
也要说句公道话:GPT-4o 的文本能力不是没有对手。MMLU 88.7% 在当时已不是断层第一(Claude 3 Opus、Gemini 1.5 Pro 各有千秋),它赢在”全面且便宜”——文本、视觉、音频三项都够到旗舰水准,价格却砍半。这份性价比,才是它敢免费开放的底气。
语音模式的上线过程也一波三折:发布后先只对少数 Plus 用户开放 alpha 测试,还因为”声音太像真人”引发伦理讨论,直到 2024 年 7 月底才向 Plus 用户全面开放。换句话说,“232 毫秒”这个数字在系统卡里是模型能力,在真实产品里是几个月后才兑现的用户体验。
系统卡真正的续集,是两个月后的 GPT-4o mini(2024-07-18)。它用更小的模型打出了惊人的性价比:MMLU 82%(碾压同价位竞品),MGSM(数学)87.0%、HumanEval(代码)87.2%、MMMU(多模态推理)59.4%;定价每百万输入 token $0.15、输出 $0.60,比 GPT-3.5 Turbo 便宜 60% 以上;上下文窗口 128K;发布当天就在 ChatGPT 里顶替了 GPT-3.5 Turbo。
mini 的定价有个非常凶的注脚:OpenAI 说自 2022 年的 text-davinci-003 以来,单位 token 成本下降了 99%——2022 年全世界最先进的模型,比现在的便宜模型贵了 100 倍,能力还差得远。另外,GPT-4o mini 是第一个应用 instruction hierarchy(指令分层)的产品级模型:把”系统指令 > 用户指令 > 外部输入”的优先级写进训练,专门用来抗越狱(jailbreak)和提示注入(prompt injection)。
产品策略上 4o mini 也很有意思:它没有把”便宜的聪明模型”藏着掖着,而是直接设为默认选项。免费用户、Plus、Team 当天就能用,企业用户一周后接入。这步棋让 OpenAI 在开源小模型价格战的围剿下守住了开发者生态——成本,就是它的护城河。
别忘了 4o mini 还挂着一个营销上的彩蛋:它在 LMSYS 大模型竞技场的聊天偏好评测里超过了 GPT-4 本体。一个便宜一个数量级的小模型,在用户观感上干掉了自己的旗舰——这比任何技术指标都更能说明”小模型的时代来了”。
4o mini 的价格冲击在几天内就传导给了整个行业,更重要的是它替 OpenAI 解决了毛利问题:免费用户跑在 4o mini 上,旗舰模型专供付费用户。“免费”不再等于赔钱,而成了引流漏斗的第一层。从这天起,ChatGPT 的免费档和付费档,用的已经不是同一个大脑了。
收尾:我的一点看法
我的评价是:GPT-4o 是 2024 年 AI 产品史的分水岭,但也是一件巨大的妥协品。分水岭在于,它第一次证明”全模态”可以是一个模型而不是一堆模型的拼盘,语音延迟从秒级压到毫秒级,产品形态从聊天框变成实时助手。妥协在于,发布会上那些惊艳的语音能力(唱歌、抢话、实时翻译)真正全面放开是几个月之后的事,最初几周语音模式甚至没上线——demo 和产品之间,隔着一段真实的工程距离。
我更想说”免费”这个决定。GPT-4o 免费开放,表面是福利,实则是被开源和竞品逼出来的战略动作。同时它把”聪明”拆成两档产品:贵的旗舰负责秀肌肉,便宜的小模型(4o mini)负责打地基,用成本阶梯覆盖不同用户。这套”旗舰引流、mini 走量”的打法,后来被整个行业抄了个遍。
安全方面我的批评很直接:系统卡把语音克隆、说话人识别的风险写得头头是道,但 Sky 音色事件暴露的是同一个问题——系统卡审的是模型,管不住产品决策的擦边球。70 个红队专家堵不住一个营销选择。AI 安全不能只靠评估报告,得靠流程和问责。
最后放回时间线:GPT-4o 是文本、视觉、语音三条线汇流成一条的”合流之作”,也是 2024 年上半年的终点站。它把多模态的形态定义好了,接下来的故事从”怎么聊”转到了”怎么想”——两个月后登场的 o1,接的就是这一棒。
附:核心数据速查
关键数字表格
| 指标 | 数值 | 对比/备注 |
|---|---|---|
| 语音响应延迟 | 最短 232ms,平均 320ms | 人类自然反应约 210ms |
| 旧语音模式延迟 | GPT-3.5 2.8s / GPT-4 5.4s | 三模型流水线(ASR→LLM→TTS) |
| 文本能力(MMLU) | 88.7% | 对标 GPT-4 Turbo |
| M3Exam(多语言考试) | 零样本领先 | 多语言能力证明 |
| API 定价 | $2.5 / $10(百万 token 入/出) | 比 GPT-4 Turbo 便宜 50%、快 2 倍 |
| 支持语言 | 约 50 种 | 新 tokenizer 压缩非拉丁语系 |
| 古吉拉特语表示 | 省约 4.4 倍 token | 泰卢固语 3.5 倍 |
| 免费开放 | 全部 ChatGPT 用户 | 产品策略转折点 |
| 4o mini MMLU | 82% | Gemini Flash 77.9%、Claude Haiku 73.8% |
| 4o mini 代码/数学 | HumanEval 87.2% / MGSM 87.0% | 均超同期小模型 |
| 4o mini 定价 | $0.15 / $0.60 | 比 GPT-3.5 Turbo 便宜 60% 以上 |
| 4o mini 上下文 | 128K(输出 16K) | 知识截止 2023-10 |
| LMSYS 聊天偏好 | 4o mini 超过 GPT-4 | 便宜一个数量级仍胜旗舰 |
| text-davinci-003 以来 | 单位 token 成本降 99% | 2022 年的模型贵约 100 倍 |
| 红队评估 | 70+ 名外部专家 | Preparedness 四类评分 |
| 语音模式全面开放 | 2024-07 底(Plus 用户) | 发布后约两个月 |
| 数据来源 | 网页 + 代码数学 + 多模态 + 商业合作 | Shutterstock 等首批合作 |
| 音频评测维度 | ASR / 语音翻译 / 情感 / 多说话人 | 音频能力首次独立评测 |
关键概念清单
- omni(全模态)= 单个模型处理文本/音频/图像/视频等多种模态
- ASR(automatic speech recognition,自动语音识别)= 语音转文字
- TTS(text-to-speech,文本转语音)= 文字转语音
- speech-to-speech(语音到语音)= 输入输出均为语音的端到端路径
- Preparedness Framework(准备度框架)= OpenAI 评估前沿风险的框架
- red team(红队测试)= 外部专家主动攻击模型以发现漏洞
- speaker identification(说话人识别)= 判断音频中说话人身份的能力
- voice cloning(语音克隆)= 复制特定人声的能力
- ungrounded inference(无根据推断)= 模型在证据不足时做出的推断
- Moderation API(审核 API)= OpenAI 用于过滤有害内容的分类工具
- post-training(后训练)= 预训练之后的对齐与微调阶段
- CBRN(化学/生物/辐射/核威胁)= 预训练过滤的高风险内容类别
- M3Exam = 多语言考试基准,衡量非英语能力
- alpha(内测)= 小范围用户先行的测试阶段
- Shutterstock 合作 = 商业图片数据授权合作,OpenAI 首批数据合作方
- instruction hierarchy(指令分层)= 按指令来源优先级约束模型行为的对齐方法
- jailbreak(越狱)= 用特殊提示绕过模型安全限制
- prompt injection(提示注入)= 诱导模型执行非预期指令的攻击
- text-davinci-003 = 2022 年的 GPT-3.5 系列模型,单位成本对比基准
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





