mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1572 字
4 分钟
04_[规模即能力]_GPT-3_上下文学习
2026-07-25

系列:LLM 与 Transformer 关键论文深度解读(第 4/8 篇) | 其他论文见本目录 01–08 | 合集见工作区根目录《LLM与Transformer关键论文深度解读.md》。

[规模即能力] GPT-3:上下文学习与少样本能力#

论文信息#

  • 标题:Language Models are Few-Shot Learners
  • 作者:Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal 等(OpenAI,署名 30 余人)
  • 发表年份:2020 年
  • 会议/期刊来源:Advances in Neural Information Processing Systems 33(NeurIPS 2020),页 1877–1901
  • arXiv:2005.14165
  • 引用量级:数万次(截至 2025 年,NeurIPS 历史上被引最多的论文之一)

一、研究背景与核心问题#

GPT-1/BERT 时代的范式是”预训练 + 任务级微调”:每接入一个新任务,都要收集数千乃至数万条标注样本、跑一遍梯度更新。论文指出三个痛点:

  1. 标注成本高:每个新任务都需要定制数据集,无法扩展;
  2. 泛化脆弱:微调可能学到训练分布中的虚假相关性,而非任务本身的能力;
  3. 范式失配:人类学一个新任务往往只需几条示例或一句说明,而无需大规模重训。

GPT-3 的假设是:当模型足够大、预训练数据足够多时,“学会执行任意文本任务”的能力会内化进参数中,用户只需在提示(prompt)里写下任务描述和几条示例,模型即可在不更新任何参数的情况下完成任务——即”上下文学习”(in-context learning)。

二、核心方法与架构创新#

  1. 史无前例的规模:1750 亿参数的自回归 Transformer,比此前最大的非稀疏模型(GPT-2,15 亿)大 100 倍以上。结构沿用 GPT-2(解码器 + 预归一化),96 层、隐层 12288、96 个头,交替使用稠密注意力与局部带状稀疏注意力以节省计算。上下文窗口 2048 token。

  2. 无梯度更新的任务适配:定义三种设置——

    • Zero-shot:仅给任务描述,不给示例;
    • One-shot:任务描述 + 1 条示例;
    • Few-shot:任务描述 + 若干条示例(通常 10–100 条,受上下文窗口限制)。

    所有设置都只改变输入文本,模型权重全程不变。这是对”微调”范式的彻底挑战:把”训练”变成了”提示工程”。

  3. 训练数据:约 570GB 过滤去重文本(以经质量过滤的 Common Crawl 为主,辅以 WebText2、Books1、Books2、英文维基),共约 3000 亿 token;训练 batch size 从 32K 逐步增加到 320 万 token,配合 warmup 学习率调度。

  4. 系统性规模实验:训练 8 个规模(1.25 亿 → 1750 亿参数),刻画”能力-规模”曲线。

三、关键公式与模块设计原理#

3.1 上下文学习的统一表述#

将任意任务转化为条件文本生成:给定上下文示例集合 S_k(k 条任务示例)与新输入 x,模型输出:

P(ySk,x)=jP(yjSk,x,y<j)P(y \mid S_k, x) = \prod_{j} P(y_j \mid S_k, x, y_{<j})

参数不变,仅靠注意力机制”在上下文里检索”示例中的输入-输出模式。直觉上,这与最近邻检索类似:示例提供了一个”任务原型”,模型在输出空间中朝该原型靠拢。

3.2 规模定律的经验证据#

论文的核心经验规律(后经 Kaplan 等系统化为缩放定律):few-shot 性能随参数规模呈平滑、可预测的幂律增长,且规模越大,模型从上下文示例中获益越多(zero-shot 与 few-shot 的差距随规模扩大而拉大)。这意味着”能力涌现”不是偶然,而是规模的结构性结果。

四、实验设置与主要结果#

  • 评测面:翻译、问答、完形填空、常识推理、单词重构、算术、新词造句等 40 余个任务/基准。
  • 代表性结果(few-shot,对比基线):
    • TriviaQA:71.2% 准确率,接近带外部检索的微调 SOTA;
    • LAMBADA(完形填空):86.4%,超过此前 SOTA 逾 18 个百分点;
    • SuperGLUE:few-shot 逼近微调后的 BERT-Large(部分任务持平),但在需要双向上下文的任务上仍落后;
    • 翻译:few-shot 超过此前无监督方法,但仍低于有监督 SOTA;
    • 算术/单词重构/新词造句:可”即时”完成,展示动态推理能力。
  • 局限确认:在若干任务上 few-shot 仍不敌微调;论文亦坦承网络语料与测试基准存在重叠(数据污染)的方法论风险。
  • 额外发现:GPT-3 生成的新闻文章令人类评估者难以与人类写作区分(约 52% 的判定率接近随机),由此引出对深度伪造与信息安全的讨论。

五、局限性与后续影响#

局限性

  • 成本与能耗极高,训练一次耗资数百万美元量级;推理亦昂贵;
  • 存在偏见放大、毒性文本、幻觉等社会风险(论文设有专节讨论,并给出模型卡);
  • 上下文窗口(2048)有限,few-shot 示例数量受限;
  • 单向解码架构在需要双向理解的基准上吃亏。

后续影响:GPT-3 直接定义了”基础模型(foundation model)+ 提示工程”时代——催生 GPT-3 API 与整个提示词经济;其规模定律思想推动 Chinchilla、PaLM、GPT-4 的扩展决策;“规模即能力”的结论同时刺激了高效化研究(稀疏专家模型、蒸馏、后续 LLaMA 的过度训练路线)。


分享

如果这篇文章对你有帮助,欢迎分享给更多人!

04_[规模即能力]_GPT-3_上下文学习
https://mizuki-eaf.pages.dev/posts/llm-papers/04_规模即能力_gpt-3_上下文学习/
作者
无名之子
发布于
2026-07-25
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录