系列:LLM 与 Transformer 关键论文深度解读(第 4/8 篇) | 其他论文见本目录 01–08 | 合集见工作区根目录《LLM与Transformer关键论文深度解读.md》。
[规模即能力] GPT-3:上下文学习与少样本能力
论文信息
- 标题:Language Models are Few-Shot Learners
- 作者:Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal 等(OpenAI,署名 30 余人)
- 发表年份:2020 年
- 会议/期刊来源:Advances in Neural Information Processing Systems 33(NeurIPS 2020),页 1877–1901
- arXiv:2005.14165
- 引用量级:数万次(截至 2025 年,NeurIPS 历史上被引最多的论文之一)
一、研究背景与核心问题
GPT-1/BERT 时代的范式是”预训练 + 任务级微调”:每接入一个新任务,都要收集数千乃至数万条标注样本、跑一遍梯度更新。论文指出三个痛点:
- 标注成本高:每个新任务都需要定制数据集,无法扩展;
- 泛化脆弱:微调可能学到训练分布中的虚假相关性,而非任务本身的能力;
- 范式失配:人类学一个新任务往往只需几条示例或一句说明,而无需大规模重训。
GPT-3 的假设是:当模型足够大、预训练数据足够多时,“学会执行任意文本任务”的能力会内化进参数中,用户只需在提示(prompt)里写下任务描述和几条示例,模型即可在不更新任何参数的情况下完成任务——即”上下文学习”(in-context learning)。
二、核心方法与架构创新
-
史无前例的规模:1750 亿参数的自回归 Transformer,比此前最大的非稀疏模型(GPT-2,15 亿)大 100 倍以上。结构沿用 GPT-2(解码器 + 预归一化),96 层、隐层 12288、96 个头,交替使用稠密注意力与局部带状稀疏注意力以节省计算。上下文窗口 2048 token。
-
无梯度更新的任务适配:定义三种设置——
- Zero-shot:仅给任务描述,不给示例;
- One-shot:任务描述 + 1 条示例;
- Few-shot:任务描述 + 若干条示例(通常 10–100 条,受上下文窗口限制)。
所有设置都只改变输入文本,模型权重全程不变。这是对”微调”范式的彻底挑战:把”训练”变成了”提示工程”。
-
训练数据:约 570GB 过滤去重文本(以经质量过滤的 Common Crawl 为主,辅以 WebText2、Books1、Books2、英文维基),共约 3000 亿 token;训练 batch size 从 32K 逐步增加到 320 万 token,配合 warmup 学习率调度。
-
系统性规模实验:训练 8 个规模(1.25 亿 → 1750 亿参数),刻画”能力-规模”曲线。
三、关键公式与模块设计原理
3.1 上下文学习的统一表述
将任意任务转化为条件文本生成:给定上下文示例集合 S_k(k 条任务示例)与新输入 x,模型输出:
参数不变,仅靠注意力机制”在上下文里检索”示例中的输入-输出模式。直觉上,这与最近邻检索类似:示例提供了一个”任务原型”,模型在输出空间中朝该原型靠拢。
3.2 规模定律的经验证据
论文的核心经验规律(后经 Kaplan 等系统化为缩放定律):few-shot 性能随参数规模呈平滑、可预测的幂律增长,且规模越大,模型从上下文示例中获益越多(zero-shot 与 few-shot 的差距随规模扩大而拉大)。这意味着”能力涌现”不是偶然,而是规模的结构性结果。
四、实验设置与主要结果
- 评测面:翻译、问答、完形填空、常识推理、单词重构、算术、新词造句等 40 余个任务/基准。
- 代表性结果(few-shot,对比基线):
- TriviaQA:71.2% 准确率,接近带外部检索的微调 SOTA;
- LAMBADA(完形填空):86.4%,超过此前 SOTA 逾 18 个百分点;
- SuperGLUE:few-shot 逼近微调后的 BERT-Large(部分任务持平),但在需要双向上下文的任务上仍落后;
- 翻译:few-shot 超过此前无监督方法,但仍低于有监督 SOTA;
- 算术/单词重构/新词造句:可”即时”完成,展示动态推理能力。
- 局限确认:在若干任务上 few-shot 仍不敌微调;论文亦坦承网络语料与测试基准存在重叠(数据污染)的方法论风险。
- 额外发现:GPT-3 生成的新闻文章令人类评估者难以与人类写作区分(约 52% 的判定率接近随机),由此引出对深度伪造与信息安全的讨论。
五、局限性与后续影响
局限性:
- 成本与能耗极高,训练一次耗资数百万美元量级;推理亦昂贵;
- 存在偏见放大、毒性文本、幻觉等社会风险(论文设有专节讨论,并给出模型卡);
- 上下文窗口(2048)有限,few-shot 示例数量受限;
- 单向解码架构在需要双向理解的基准上吃亏。
后续影响:GPT-3 直接定义了”基础模型(foundation model)+ 提示工程”时代——催生 GPT-3 API 与整个提示词经济;其规模定律思想推动 Chinchilla、PaLM、GPT-4 的扩展决策;“规模即能力”的结论同时刺激了高效化研究(稀疏专家模型、蒸馏、后续 LLaMA 的过度训练路线)。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





