《InstructGPT》解读:比 GPT-3 小 100 倍,却被人类标成更好用——对齐才是真正的分水岭
论文:Training language models to follow instructions with human feedback(arXiv<2203>2203>.02155,NeurIPS 2022) 作者:Long Ouyang、Jeff Wu、Xu Jiang、Diogo Almeida 等,OpenAI(对齐团队) 发布背景一句话:2022 年 3 月 4 日挂上 arXiv,核心主张是”模型不听话不是不够大,而是没被教会听人话”;前置知识提示:GPT-3 的 few-shot(少样本学习)能力与”会续写但不会执行指令”的毛病(上一站);这篇为哪一步埋下伏笔——RLHF(人类反馈强化学习)从实验室方法变成量产工艺,一年后 ChatGPT 就是它最成功的产品化。
一、引言:背景与核心问题
GPT-3 已经把”大力出奇迹”这件事做到了极致:1750 亿参数,few-shot 在手,翻译、摘要、问答样样能露一手。
但真拿它干活的人很快就发现一个尴尬的事实——它很聪明,但它不听话。
你让它回答问题,它可能接着你的话茬往下编一段问题列表;你让它遵守字数限制,它当没看见;你问它不懂的事,它面不改色地一本正经胡说。论文里把这种毛病统称为”模型与用户意图不一致”(misalignment)。
细想一下,这个毛病几乎是必然的。GPT-3 的训练目标只有一个:最大化下一个 token 的预测概率。
这个目标天然奖励”继续写得像人话”,而不奖励”正确执行用户指令”。所以模型不是坏,是它的优化目标里从来就没有”听话”这个选项。
OpenAI 在 GPT-3 时代就已经意识到:单纯靠堆参数,解决的只是”模型有没有能力”,而不是”模型愿不愿意按人的要求办事”——这两件事是分开的。
InstructGPT 的立场很明确:与其继续把模型做大,不如花力气把已有的能力引导到用户想要的方向上。
这就是”对齐”(alignment)这个概念的正式登场——让模型变得 helpful(有用)、honest(诚实)、harmless(无害)。注意这三个词:对齐不是让模型更聪明,是让模型更”懂事”。
所以这篇论文要解决的核心问题,不是”怎么让模型更强”,而是”怎么用人的偏好信号,把模型驯成一个愿意听指令、不乱编、有分寸的助手”。
它给出的答案,是后来所有大模型公司都绕不开的三段式工艺:SFT 微调 → 奖励模型 → PPO 强化。
二、方法:架构/数据/训练细节
InstructGPT 没有发明新架构,底座就是 GPT-3 的 decoder-only(仅解码器)Transformer,做了三个尺寸:1.3B、6.7B、175B。真正的新东西是训练管线,分三步走。
第一步,SFT(Supervised Fine-Tuning,监督微调)。
约 1.3 万条标注员手写的示范数据(一部分来自 OpenAI API Playground 的真实用户请求,一部分由标注员自己编写),每条数据是”指令 → 理想回答”。
模型在这上面微调,训练 16 个 epoch,用余弦学习率衰减,残差 dropout 设为 0.2。
有个细节很有意思:选 checkpoint 不是看验证集 loss,而是用奖励模型打分来选——因为作者发现验证 loss 跟最终质量并不对齐。这本身就是一次小小的”用直觉对齐目标”的示范。
第二步,奖励模型(Reward Model,简称 RM)。
收集约 3.3 万条比较数据:每个 prompt 让模型生成 K=4~9 个回答,标注员按质量排序,两两配对训练一个打分器。
损失是经典的 pairwise ranking loss(配对排序损失),本质是 Bradley-Terry 模型——让更受欢迎的回答得分更高。
奖励模型用了 6B 参数,而不是 175B——作者明确说 175B 的 RM 训练不稳定,6B 反而好用。这个反直觉的选择背后是工程直觉:奖励模型只是信号源,够准、够稳就行,不需要够大。
第三步,PPO(Proximal Policy Optimization,近端策略优化)。
约 3.1 万条 prompt 上场,策略模型(就是 SFT 后的模型)生成回答,奖励模型打分,然后用 PPO 更新。
为了防模型钻奖励模型的空子(reward hacking,奖励黑客攻击),目标函数里加了一项对 SFT 模型的 KL 散度惩罚:可以追求高分,但别飘太远。
这还不够——纯 PPO 会让模型在公共 NLP 基准上退化,这就是著名的”对齐税”(alignment tax)。于是有了 PPO-ptx 变体:在目标函数里再混入预训练的语言建模损失,让模型一边对齐一边别忘本。
人从哪来?约 40 名外包标注员,通过筛选(要能识别有害输出)上岗,标注员之间的一致性约 73%。
数据全部脱敏去重,来自真实 API 请求分布——论文强调”在真实用户分布上训练和评估”,这比刷基准分数实在得多。
注意,第二步和第三步不是一次性的:新策略生成的回答会被拿回去继续收集比较数据,奖励模型和策略模型是迭代着一起进化的。
三、成绩:关键实验数字
核心结果一句话就能说完,但也够吓人的:13 亿参数的 InstructGPT,在人类偏好评估中击败了 1750 亿参数的 GPT-3——参数量相差 100 倍。
人类标注员在两个模型各自的回答里二选一,更喜欢 InstructGPT。这不是小胜,是体系性的胜利:175B 的 PPO-ptx 模型对 175B GPT-3 的胜率是 85%±3%,对 few-shot 提示版的 GPT-3 也有 71%。
看整体趋势也很有意思:SFT 模型就比 GPT-3 略好,PPO 又上一个台阶,PPO-ptx 最好——三个尺寸(1.3B/6.7B/175B)都是这个单调趋势。
换句话说,人对”有没有在认真听指令”这件事是有共识的,奖励信号是稳定的,这也是整套方法能成立的根基。
而不同尺寸之间的胜率差,远小于”对齐 vs 不对齐”之间的差——规模带来的差距,在对齐面前不值一提。
更值得注意的是泛化性:作者用一批**没参与过数据标注的”新标注员”**重新评估,结果他们同样偏好 InstructGPT,说明模型学到的不是对那 40 个人的谄媚,而是某种通用的”有用性”。
再看具体维度。真实性(truthfulness):在 TruthfulQA 上,真实且信息量足够的回答比例大约翻了一倍(约从 30% 提到 45%);API 分布上人工标注的”幻觉率”从 GPT-3 的 41% 降到 21%。
毒性(toxicity):在 RealToxicityPrompts 上,配合”请用礼貌语气”的提示,毒性输出大约下降 25%。
但作者自己也承认:在偏见基准(Winogender、CrowS-Pairs)上没有明显改善——RLHF 治得了嘴,治不了心。
还有一顶”税”要交:纯 PPO 模型在 SQuAD、DROP、翻译等公共基准上明显退化,PPO-ptx 基本把损失找了回来,只留下微小回撤。
另外有个彩蛋式发现:训练数据基本是英文指令,但 InstructGPT 对外语指令和代码问答也有一定的泛化能力——“对齐”像是一种可迁移的行为模式,它改变的不只是某类问题的答案,而是模型”应答”的整套姿态。
这些成果很快就落地成了产品:InstructGPT 后来被部署为 API 里的 davinci-instruct-beta(也就是 text-davinci-001 的前身),是 GPT-3 之后第一个真正”会听话”的商用模型。论文到产品的距离,在这里只有几周。
收尾:我的一点看法
InstructGPT 厉害在哪?它第一次用实验证明了”能力”和”对齐”是两个正交的维度,而且对齐的边际收益大于扩规模。
1.3B 打爆 175B,这句话放在 2022 年之前没人敢想。它把强化学习从 RL 学术圈的玩具变成了大模型工业化的标准工序——现在每一家大厂的对话模型,管线里都流着这篇论文的 DNA。对齐(alignment)这个赛道,就是它开的。
另外我特别服气它的”选 RM 而非看 loss”、“PPO-ptx 加回预训练项”这些务实细节——真做工程的人都知道,论文里最值钱的往往不是公式,是这种踩过坑之后的判断。
缺陷也是明摆着的。第一,“对齐到谁的价值”:40 个标注员加几个研究员,代表不了全人类,论文自己都承认这点。
第二,幻觉没根除,只是从 41% 降到 21%,降了一半但离”可信”还远。第三,偏见完全没改善,说明 RLHF 对深层次的社会偏见基本无能为力。
第四,奖励模型本身就是个新误差源,PPO 一上头就会过优化——作者反复强调 PPO-ptx 更好,其实就是在跟奖励模型的缺陷搏斗。
我还有一个略带悲观的观察:这篇论文确立的”人类偏好”路线,后来被证明是有天花板的。偏好数据反映的是”看起来好不好”,而人类的判断会被模型的表现影响——模型说得越自信,人越觉得它对。这为后来 ChatGPT 时代的”过度自信幻觉”埋下了一个隐患,只是当时没人注意。
历史位置这东西,得放到时间线里看。Codex(2021.07)先证明了”代码训练”的价值,InstructGPT(2022.03)证明了”人告诉模型怎么答”的价值——两条线在 2022 年底汇合,撞出了 ChatGPT。
InstructGPT 是”对齐路线”的正式起点,也是 ChatGPT 的工艺蓝本。没有它,ChatGPT 只是又一个能续写下一个 token 的玩具;有了它,模型才第一次学会”回答你”而不是”接着写”。
附:核心数据速查
关键数字表格
| 指标 | 数值 | 对比/备注 |
|---|---|---|
| SFT 示范数据 | 约 1.3 万条 | 标注员手写 + API 真实 prompt |
| RM 比较数据 | 约 3.3 万条 | 每 prompt 生成 K=4~9 个回答排序 |
| PPO 训练 prompt | 约 3.1 万条 | 全部来自 API 真实请求 |
| 标注员数量 | 约 40 名 | 外包,筛选上岗,一致性约 73% |
| 奖励模型参数 | 6B | 175B 的 RM 训练不稳定,被弃用 |
| 1.3B InstructGPT vs 175B GPT-3 | 人类偏好胜出 | 参数少 100 倍 |
| 175B PPO-ptx vs 175B GPT-3 | 85%±3% | few-shot 版 GPT-3 为 71% |
| TruthfulQA 真实性 | 约翻倍 | 约 30% → 45% |
| 幻觉率(API 分布) | 41% → 21% | 人工标注元数据 |
| RealToxicityPrompts 毒性 | 约降 25% | 配合”礼貌”提示 |
| 偏见基准(CrowS-Pairs 等) | 无明显改善 | RLHF 的短板 |
| 模型尺寸 | 1.3B / 6.7B / 175B | 三个规模同管线对比 |
关键概念清单
- RLHF = 人类反馈强化学习,用人的偏好作为奖励信号训练模型
- Alignment = 对齐,让模型输出与人类意图(helpful/honest/harmless)一致
- SFT = 监督微调,用标注示范数据直接训练
- Reward Model = 奖励模型,为回答打分的学习器
- PPO = 近端策略优化,用于强化学习阶段的策略更新算法
- KL 散度惩罚 = 限制策略偏离 SFT 模型的正则项,防 reward hacking
- Reward hacking = 奖励黑客攻击,模型钻奖励模型漏洞获得虚高分数
- Alignment tax = 对齐税,对齐过程导致的公共基准能力退化
- PPO-ptx = 在 PPO 目标中混入预训练损失的变体,缓解对齐税
- TruthfulQA = 真实性评估基准,检测模型是否胡编事实
- Bradley-Terry 模型 = 从成对比较中估计偏好分数的经典模型
- Held-out labelers = 未参与训练数据标注的评估员,用于检验泛化性
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





