《GPT-4 技术报告》解读:史上最有名的一份”啥都没说”的报告
论文:GPT-4 Technical Report 作者:OpenAI(署名仅”OpenAI”,未列出具体个人) 发布背景一句话:2023-03-14 发布(arXiv<2303>2303>.08774),核心主张是”多模态、能过专业考试、可预测扩展”,但架构、参数量、算力、数据一律不公开;在 ChatGPT 发展史上,GPT-4 是第一个真正的分水岭——从”能聊天的玩具”变成”能干活的专业工具”,同时亲手关上了 OpenAI 的透明大门。
一、引言:一份不谈技术的”技术报告”
2022 年 11 月 30 日 ChatGPT 上线,到 2023 年 3 月 14 日 GPT-4 发布,中间只有 3 个多月。这三个月里用户疯狂涌入,也把 OpenAI 骂了个遍:幻觉、拒绝回答、小学数学都算错。
所以 GPT-4 的发布,既是能力宣示,也是给自家产品挽尊。它一上来就甩出三张牌:多模态(能吃图和文字)、MMLU 86.4%、模拟律师考试进前 10%。
普通人的第一反应是”它变聪明了”。我的第一反应却是——它居然不告诉我这模型是怎么训出来的。
报告白纸黑字写着:鉴于竞争环境与安全考虑,不提供架构(含模型大小)、硬件、训练算力、数据集构建、训练方法等任何细节。这跟 GPT-3 论文里白纸黑字写 175B 参数、写清数据配比形成刺眼对比。
那一刻 OpenAI 完成了角色转变:从”发表论文的研究机构”变成”发布系统卡(system card)的商业公司”。学术界和媒体都愣了——原来”技术报告”可以什么都不说。
但别急着失望。这份报告有两个真实的信息量:一是能力评测覆盖了社会能看懂的人类考试,二是提出并实践了 predictable scaling(可预测扩展)。前者改变舆论,后者改变工程。
二、方法:能说的很少,但有一条值得反复嚼
唯一能确认的训练配方只有一句话:预训练做 next token prediction(预测下一个 token),再用 RLHF(reinforcement learning from human feedback,基于人类反馈的强化学习)对齐——这是从 InstructGPT、ChatGPT 一路继承下来的固定流程。
真正值得细读的是可预测扩展。OpenAI 用算力少 1,000 倍到 10,000 倍的小模型做同样的训练,先预测大模型在特定任务上的表现曲线,再据此锁定最终训练配置。
这等于把 scaling law 从”事后解释现象”升级成”事前锁定预算”的工程纪律——先算清楚多大的模型能到多少分,才决定烧多少钱。GPT-3 是”赌一把大的”,GPT-4 是”先算账再下注”。
可预测扩展还有个实际用途:解释为什么 GPT-4 敢直接上 8K/32K 上下文、为什么敢把视觉和文本一起训——每一步都先在小模型上验证过才放大。
但代价是,所有能验证这套说法的数据都不公开,scaling 曲线是真是假,外界无从稽考。这是”闭源 scaling law”:只有 OpenAI 自己知道它成立。
至于模型本身长什么样,报告一个字没说,只剩一个未经证实的传闻:业界(SemiAnalysis 分析师 Dylan Patel 的估算)认为 GPT-4 是一个约 1.8 万亿参数的 MoE(mixture of experts,混合专家)模型,8 个专家、每个约 220B、Top-2 路由、每个 token 只激活约 280B。
OpenAI 从未确认也从未否认。我把它当传闻写进来,因为它是目前唯一能同时解释”性能这么高”和”推理这么贵”的合理猜测——但我建议你引用时永远加上”未经证实”四个字。
三、成绩:一群让社会看得懂的考试分数
学术基准全面碾压上一代。MMLU(57 个学科的多选题)86.4%,GPT-3.5 只有 70.0%,当时最强的开源系模型 U-PaLM 是 75.2%。
HellaSwag 95.3%;HumanEval(Python 代码生成)67.0%,GPT-3.5 是 48.1%;GSM8K(小学数学应用题)92.0%,GPT-3.5 是 57.1%。翻译版 MMLU 上,26 种语言里有 24 种超过当时的英语 SOTA。
人类考试才是让全社会震动的部分。模拟美国律师资格考试得分 298/400,排进考生 前 10%,而 GPT-3.5 是 垫底 10%——从最差到最好,只隔了一代模型。
LSAT 约 88 分位;GRE 语文 169/170(约 99 分位)、GRE 数学 163/170(约 80 分位)。这里我要顺手纠正一个网上流传的说法:GRE 数学是 80 分位,不是常被引用的”91 分位”,原报告表格写得很清楚。
再补一个工程上的增量:上下文窗口从 GPT-3.5 的 4K 拉到 8K / 32K 两档。“记住更长对话”这件事,比任何单科分数都更影响日常使用,也是企业愿意掏钱的直接原因。
安全方面,系统卡给出的核心指标是:违规内容(disallowed content)响应比 GPT-3.5 减少 82%。至于幻觉率,报告本身没有给统一口径,第三方 RAG 摘要一致性评测(Vectara)里 GPT-4 约为 3.0%、GPT-3.5 约为 3.5%——注意这是”给定文档做摘要”的窄口径,别拿它当全局幻觉率的准数。
定价倒是明码标价:8K 上下文 $0.03/$0.06(每千 token 输入/输出),32K 版 $0.06/$0.12。从这一刻起,“模型多强”和”用起来多贵”第一次被摆在同一张价目表上,AI 进入了按量计费的时代。
收尾:我的一点看法
GPT-4 为什么是 ChatGPT 史的分水岭?不是因为 MMLU 高了几分,而是它第一次把 AI 能力锚定在社会通用的坐标系里——律师考、GRE、AP。
媒体不用再解释”困惑度下降”,直接说”AI 能过司法考试”。能力第一次有了大众可验证的坐标,这也是为什么 2023 年之后,监管、教育、白领职业的所有讨论都突然有了实感。
我的批评也很直接:这份报告的评测,是 OpenAI 自己挑尺子量自己。考试题库存在污染风险——报告自己承认有少数题目在训练期出现过。而且考试分数和工作能力是两回事,MMLU 满分的人也未必能写好一份合同。
更麻烦的是,它把保密当成了行业常态,此后所有闭源大厂都跟着学,透明性在 2023 年之后成了奢侈品。能说出”参数量、算力、数据”的论文,从此几乎绝迹。
但反过来,它给开源世界留了窗口。正因为 GPT-4 不公开配方,Meta 的 LLaMA、Mistral、Qwen、DeepSeek 这些开源模型才有了生存空间。整个 2023-2024 的开源追赶潮,某种程度上就是被 GPT-4 的”闭关”逼出来的。这段因果,值得每个骂 OpenAI 保密的人同时感谢它。
至于它到底是不是 1.8T 参数的 MoE——我倾向于信,因为可预测扩展已经证明了 scale 的收益是真实且可预估的。但这也意味着它永远无法被复现,我们可能永远不知道 GPT-4 的真实配方。这就是 ChatGPT 史最吊诡的地方:最重要的一步棋,是藏着下出来的。
最后说它对 OpenAI 自身的塑造。GPT-4 之后,公司明显从”每代发个新模型”转向”围绕一个模型做全家桶”:GPT-4V 补视觉、DALL-E 3 补绘图、Code Interpreter 补执行,直到 GPT-4o 把语音也原生塞进去。GPT-4 不只是下一个 GPT-3,它是 OpenAI 从”单模型公司”变成”多模态平台”的枢纽——这一点,比它考了多少分重要得多。
配套能力一:GPT-4V——GPT-4 的”眼睛”补上了
GPT-4 发布时其实自带多模态能力(图像 + 文本输入),但普通用户用不上。直到 2023 年 9 月 25 日,ChatGPT 才向 Plus/Enterprise 用户全量开放视觉版(GPT-4 with vision)。
大家第一次能在对话框里扔截图、照片、表格,让它读图、OCR、解释图表。对普通人来说,“把文档拍照扔给 AI”第一次变成了靠谱的用法。
其实 GPT-4V 在发布当天(2023 年 3 月)就开始真实世界测试了——OpenAI 与盲人辅助 App Be My Eyes 合作,用 GPT-4V 帮视障用户”看图说话”。这是它最早的落地场景,也顺便给报告攒了一批真实案例。
机制上,图像被切成 patch 编码成视觉 token,和文本 token 一起喂进 Transformer(细节同样不公开)。从技术谱系看,它就是 CLIP 那条”图文对齐”线的直接后代——没有 CLIP 式的图文编码器,GPT-4 的”眼睛”根本无从谈起。
但 GPT-4V 初期暴露的问题也很典型:它擅长读图、识图、解释,却不擅长精确的空间推理——“图里第三个物体和第四个物体谁离门近”这种问题经常答错。“看得见”和”看得懂空间”是两码事,这个坑 OpenAI 当时也才刚刚开始填。
配套能力二:DALL-E 3——会”听话”的文生图模型
2023 年 10 月,DALL-E 3 集成进 ChatGPT,官方同时发布系统卡《DALL·E 3 System Card》(2023-10-03)。
它和前两代最大的不同,是引入了 prompt rewriting(提示词重写):用户只写”画一只戴帽子的猫”,ChatGPT/GPT-4 会先把它扩写成一大段详细、结构化的图像提示词,再交给扩散模型出图。
这个设计很聪明。文生图模型最大的瓶颈一直是”理解长句、遵循复杂指令”,而 GPT-4 恰好是这个领域最强的东西。把语言理解外包给 LLM,把图像生成留给扩散模型,两个最擅长的事拼在一起,效果直接上一个台阶。
最直观的证明是图内文字渲染:招牌、书名、标语这些 DALL-E 2 时代几乎不可用的内容,DALL-E 3 好了不止一个量级。这是它最大的卖点,也让”用 AI 做海报”第一次变得现实。
争议也随之而来:训练数据来自互联网抓取的图文(包含大量在世艺术家的作品),引发了多起版权诉讼,直到今天仍是文生图行业最大的雷区之一。技术领先和伦理欠账,在 DALL-E 3 上被同时摆上台面。
另外,它的系统卡还首次把”图像生成安全”单独拎出来做专门测试:内容政策过滤、色情暴力拒绝、以及用户提示词训练时的隐私问题。作为第一个”ChatGPT 原生”的生成模型,它顺带定义了一套后来所有文生图产品都跟着抄的安全作业流程。
站在 ChatGPT 史上回看:GPT-4V 补上了”眼睛”,DALL-E 3 补上了”手”,加上 Whisper 的”耳朵”,2023 年底的 OpenAI 已经是一个五感俱全的多模态体。下一站 GPT-4o,就是把它们全部原生集成、端到端打通——而那条路,正是 2021 年 DALL-E/CLIP 那批论文早就铺好的。
附:核心数据速查
关键数字表格
| 指标 | 数值 | 对比/备注 |
|---|---|---|
| MMLU(57 学科多选) | 86.4% | GPT-3.5 为 70.0%,U-PaLM 为 75.2% |
| HellaSwag / HumanEval / GSM8K | 95.3% / 67.0% / 92.0% | GPT-3.5 为 85.5% / 48.1% / 57.1% |
| 模拟律师资格考试 | 前 10%(298/400) | GPT-3.5 为垫底 10% |
| GRE 语文 | 169/170,约 99 分位 | GPT-3.5 约 63 分位 |
| GRE 数学 | 163/170,约 80 分位 | 网上流传的”91 分位”有误 |
| 翻译版 MMLU(26 语言) | 24 种超英语 SOTA | 多语言能力 |
| 违规内容响应 | 比 GPT-3.5 减少 82% | 系统卡口径 |
| 第三方摘要幻觉率 | GPT-4 约 3.0% / GPT-3.5 约 3.5% | Vectara RAG 摘要评测,窄口径 |
| 上下文窗口 | 8K / 32K 两档 | GPT-3.5 为 4K |
| 参数量(传闻) | 约 1.8T MoE,8×220B,Top-2 | SemiAnalysis 估算,未经证实 |
| 可预测扩展 | 用少 1,000–10,000× 算力的小模型预测 | 工程化 scaling law |
| API 定价(8K 版) | $0.03 / $0.06(千 token 入/出) | 32K 版 $0.06/$0.12 |
关键概念清单
- RLHF(reinforcement learning from human feedback,基于人类反馈的强化学习)= 用人类偏好数据对齐模型行为的训练方法,InstructGPT 时代确立
- MoE(mixture of experts,混合专家)= 多个子网络分工、每次只激活部分专家的模型架构
- Top-2 routing = 每个 token 只激活最相关的 2 个专家,GPT-4 传闻配置
- predictable scaling(可预测扩展)= 用小规模训练预测大模型性能的工程方法,scaling law 的落地形态
- system card(系统卡)= 官方发布的模型安全、风险、缓解措施说明文档
- prompt rewriting(提示词重写)= GPT-4 把用户简短提示扩写成详细图像提示,DALL-E 3 的核心机制
- MMLU = 57 个学科的多选题基准,衡量通用知识与推理能力
- 分位(percentile)= 成绩在全体考生中的相对位置,如”99 分位”意为超过 99% 的考生
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





