Constitutional AI 论文解读:人类只写规则,剩下的让 AI 自己对齐自己
论文:Constitutional AI: Harmlessness from AI Feedback 作者:Yuntao Bai、Saurav Kadavath 等(Anthropic) arXiv<2212>2212>.08073,2022 年 12 月 15 日
这是 Anthropic 最核心的一篇原创,也是 Claude 与 GPT/Gemini 的根本分野。它把 RLHF 里最贵的一环——人类标”哪个回答更有害”——直接砍掉,换成”AI 拿一份宪法原则清单自己评自己”。对齐不再依赖人类反馈,而是依赖规则,这就是 RLAIF(RL from AI Feedback,基于 AI 反馈的强化学习)。Claude 的名字和气质都从这篇来,整个”自对齐”研究谱系也在这里开枝散叶。
一、引言:RLHF 的三笔糊涂账
对齐这件事,2022 年时默认做法是 RLHF:人类给”哪个回答更好”打标,训练一个 reward model(奖励模型),再用它喂强化学习。这套路好用,但账很糊涂。
第一笔是钱。标注有害内容,标注员得真去读那些恶心、暴力的文本,又贵又伤身。第二笔是不一致。有害无害的边界本来就模糊,不同人标准不一样,标注吵架是家常便饭。第三笔是黑箱。reward model 学出来的价值藏在一堆权重里,你根本说不清它到底奖励了什么——想审计都无从下手。
Anthropic 的创始使命是把安全当第一原则训练模型,那么问题就变成:能不能把”什么算有害”明明白白写出来,让模型照规则自己改?不需要人类再逐条打标。论文开篇一句点题:AI 越强,我们越想让 AI 来监督 AI。
二、宪法清单:人类的价值文本化
核心道具是一份 constitution(宪法):一组自然语言原则。论文里每条原则就是一句话的评判标准,例如:
- “请选择最不可能包含有害、不道德或非法内容的回复”
- “请选择最能支持人的自主性、避免家长式说教的回复”
- “请选择一位深思熟虑的资深 Anthropic 员工会认为最优的回复”
原则来源五花八门:联合国《世界人权宣言》、Apple 服务条款(刻意不用 Anthropic 自家的,避免”自我利益导向”的偏见)、DeepMind Sparrow 的原则、康德义务论。这份清单的价值在于可读、可审计——改一条原则,行为立竿见影地变,这是 reward model 给不了的透明。
三、两步训练:SL-CAI → RL-CAI
SL-CAI(监督学习阶段)。 拿一个只有 helpful 的 RLHF 模型,喂红队 prompts(故意诱导有害输出的提示词),采样出初始回答——通常很毒。然后让模型自己做三件事:critique(按一条随机抽出的宪法原则批评自己的回答)→ revise(照着批评重写)→ 循环最多 4 轮。产物是(prompt, 修订后回答)的配对,拿去做监督微调。全程没有一个人类标注有害样本。
作者发现两件事:修订轮数越多无害性越高,但第一轮修订贡献最大,后面只是锦上添花;宪法原则的数量不影响得分,却显著提升修订的多样性——这对后面的 RL 探索是好事。
RL-CAI(强化学习阶段,即 RLAIF)。 用 SL-CAI 模型对同一 prompt 生成一对回答,让 feedback model(评委模型)按宪法原则判断哪个更无害,产出 AI 偏好数据集,训练 preference model(偏好模型),最后跑 PPO。整个流程和 RLHF 长得一模一样,唯一区别是:训练信号从人类换成 AI。
还有个关键加成:chain-of-thought(思维链)。让模型在给偏好判断时先”想想再答”,RL-CAI w/ CoT 版本在无害性 Elo 上大涨,而帮助性几乎不掉。这让 AI 的决策过程可解释,不再是黑箱打分。
四、实验与数据
红队 prompts 一共 182,831 条:42,496 条人工撰写 + 140,335 条用 few-shot 让预训练模型生成;helpfulness prompts 135,296 条,全部人工。评估靠 crowdworker 的 Elo 对比(10,274 条帮助性 + 8,135 条无害性比较)。
结果读起来很顺:SL-CAI 比预训练模型既更有帮助也更无害;RL-CAI w/ CoT 是全程的冠军,无害性接近甚至超过传统的 HH-RLHF 模型,而人类标注成本砍到近乎为零。更妙的是它不是”逃逸式”安全——面对有害请求,它不装死、不回避,而是解释自己的反对理由,把”拒绝”变成一场说理。
五、影响:Claude 的技术基石
这篇之后,RLAIF 从一个提议变成了一整条研究谱系。Self-Rewarding LMs(自我奖励)、SPIN(自博弈微调)、弱到强泛化(weak-to-strong generalization)全都能追到这条根上。Anthropic 自己也没闲着:2023 年公开了 Claude 3 的完整宪法(一条条列给公众审查),把”对齐坐标公开化”做成了品牌行为。Claude 从名字到训练管线到安全叙事,都是这一篇的延伸。
收尾:我的一点看法
这是我最服的一篇 Anthropic 论文,因为它干的是一件”把游戏规则改掉”的事。RLHF 的隐性成本是人肉打标,而宪法 AI 把人的角色从”每回答打分”退到”只写规则”——规则写得越清楚,模型的自主审查能力就越强。这套思路顺带解决了一个哲学问题:reward model 是黑箱,你永远不知道模型在奖励什么;宪法是白纸黑字,吵也好、审也好,都有个抓得住的把手。就冲着这份透明,它也值得进对齐研究的必读名单。
但别神话它。宪法是人为的,原则清单当年选得相当”ad hoc”——作者自己都承认是为研究方便随手挑的。谁定原则、原则之间的冲突谁裁决,这些问题论文没答,也答不了。而且 RLAIF 并没有完全干掉人类反馈:帮助性数据还是人标的,AI 评委也只能替代”无害”这一维的判断。真要吹”完全无需人类”,那是把它的边界往外扩了三圈。
放在 2026 年回头看,宪法 AI 最被低估的贡献其实是”可迭代性”。别的厂商对齐做完了是黑盒加固,Anthropic 可以随时换宪法、换原则组合,安全策略跟着产品版本走。五年里 Claude 从 9K 上下文长到 1M,安全等级从内部原则进化成 ASL 分级,骨子里都是这一篇留下的”规则即训练坐标”的思路在起作用。
附:核心数据速查
Constitutional AI 基本盘
| 项目 | 数值 |
|---|---|
| arXiv | 2212.08073(2022-12-15) |
| 训练阶段 | SL-CAI → RL-CAI(RLAIF)两阶段 |
| 红队 prompts | 182,831 条(42,496 人工 + 140,335 模型生成) |
| helpfulness prompts | 135,296 条(全部人工) |
| 修订轮数 | 每 prompt 最多 4 轮 critique-revision |
| 评估 | crowdworker Elo(10,274 帮助性 + 8,135 无害性比较) |
关键实验结论
- 修订轮数 ↑ ⇒ 无害性单调 ↑,第一轮修订贡献最大
- 宪法原则数量不影响无害性得分,但提高修订多样性、利于 RL 探索
- RL-CAI w/ CoT 无害性 Elo 大幅提升,帮助性几乎不损
- 面对有害请求不逃逸(non-evasive),解释反对理由
关键概念清单
- Constitutional AI = 宪法 AI(用自然语言原则清单替代人类反馈进行对齐)
- SL-CAI = 监督阶段宪法 AI(模型自我批评-修订后做监督微调)
- RL-CAI = 强化学习阶段宪法 AI(AI 反馈训练偏好模型 + PPO)
- RLAIF = RL from AI Feedback,基于 AI 反馈的强化学习(反馈来自 AI 而非人类)
- constitution = 宪法(一组自然语言原则,可读、可审计、可替换)
- critique / revision = 批评 / 修订(按原则检查并改写回答的两步操作)
- feedback model = 评委模型(按宪法原则对回答对做偏好判断的模型)
- chain-of-thought = 思维链(让模型先推理再给判断,提升可解释性)
- non-evasive = 不逃逸(不回避有害问题,而是解释反对理由)
- ad hoc = 权宜的、临时性的(论文对原则选取得意的自我评价)
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





