mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2209 字
6 分钟
HH-RLHF:17 万对比样本
2026-08-04

HH-RLHF 论文解读:17 万条”有用 vs 无害”对比样本,喂大了整个对齐社区#

论文:Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback 作者:Yuntao Bai、Andy Jones 等(Anthropic) arXiv<2204>.05862,2022 年 4 月 12 日

Anthropic 成立后的第一项标志性成果,也是后来被引用到烂的对齐”种子数据”。它给 RLHF 立了一个坐标系:模型不只要有用,还得无害,两者还要同时兼得。数据集和代码随后开源,成了开源社区做偏好对齐的公共基础设施——没有这篇,后面一大票 DPO、RLAIF 的论文连评测的场子都找不到。


一、引言:InstructGPT 之后,对齐的下一步是什么#

2022 年初,InstructGPT 刚证明 RLHF 能把模型调教得又听话又聪明,但 Anthropic 盯上的是另一个问题:光有用不够,AI 还得无害(harmless)。而且两者往往是打架的——越”有求必应”,越容易被诱导干坏事;越”谨小慎微”,越显得没用。

这篇论文的野心就是训练一个同时 helpful(有帮助)、honest(诚实)、harmless(无害)的助手,凑成著名的 HHH 三件套。为了做到这点,他们先要解决一个前置问题:数据从哪来

二、数据收集:让标注员”钓鱼执法”#

收集方式设计得很聪明。crowdworker(众包标注员)不是被动地看样本,而是通过一个聊天界面亲自和模型对话。每一轮对话,模型给出两个候选回复,标注员选一个更好的,对话继续往下走。

分两条线:

  • Helpfulness 任务:标注员正常求助(问问题、写东西、讨论计划),选”更有帮助且诚实”的回复。
  • Harmlessness / Red-teaming 任务:标注员化身攻击者,故意诱导模型出坏事——策划抢劫、说脏话、给危险建议,然后选”更有害”的回复,把有害行为钓出来再标掉。

数据质量靠一批精兵撑着:约 20 名精选的 MTurk master-qualified 标注员贡献了约 80% 的数据,长期合作、Slack 直连。有意思的是,标注员和研究者之间的偏好一致率只有约 63%——这个数字后来被反复引用,用来论证”人类偏好本身就不稳定”。

三、核心方法:两个偏好模型,一边一个标准#

训练沿用 RLHF 的套路:先训 preference model(PM,偏好模型)再用它跑 RL(PPO)。但这里有个关键设计——分两路训 PM

  • 只用 helpfulness 数据的 PM,在 harmlessness 分布上表现远差于随机
  • 只用 harmlessness 数据的 PM,在 helpfulness 分布上同样崩。

这个”交叉互换就崩”的实验,把 helpful 与 harmless 之间的张力定量地钉死了:它们是两个方向的力,单练一路必然偏科。解法是把两类数据混合起来训一个 HH-PM,让模型既会在该帮时帮,也会在该拒时礼貌地拒。模型扫描从 13M 一路做到 52B,越大越稳。

另一个重要工程是迭代在线训练:以每周一次的节奏,用新收集的人类反馈更新 PM 和 RLHF 策略,再把新模型放回给标注员用,周而复始约 5 周。在线训练的模型显著优于静态数据集训练的——数据本身在跟着模型一起进化。

四、一个耐人寻味的规律:reward 与 √KL 成正比#

论文里夹带了一条很硬的经验规律:在整个 RLHF 训练中,PM reward 与策略对初始化的 KL 散度的平方根近似线性相关。直觉解释是:策略刚起步时没有针对 reward 优化,reward 随策略变化线性增长,而 KL 从二阶项才开始积累,于是 reward ∝ √KL。

这条规律的实际价值在于可预测性:给定小模型的训练曲线,就能估出大模型 RL 能到哪;也能提前算出”达到某个 reward 至少要让策略偏离初始化多远”。它给 RLHF 画了一个粗糙的能力上界。

五、影响:对齐社区的公共粮仓#

论文本身结论中规中矩——对齐训练提升几乎全部 NLP 评估、与专用技能(Python、摘要)兼容。真正出圈的是数据集:HH-RLHF 数据(含约 17 万条对比样本)和训练代码在 GitHub 上开源。后来 DPO 论文用它在 8B 模型上复现了 RLHF 的效果,一堆偏好对齐研究拿它当标准数据集和基线。Anthropic 无意间给整个社区发了一张”对齐入门粮票”。

收尾:我的一点看法#

我现在看这篇,最感慨的反而是那个”两路 PM 交叉互换就崩”的实验。它证明了有用和无害不是一条轴上的两端,而是两根互相拉扯的绳子。后来的模型几乎都在这根绳子上走钢丝——OpenAI 靠”更强大所以更安全”的解释糊弄,Anthropic 则是把这根绳子本身当产品卖点。从这个角度看,HH-RLHF 不只是数据集,它定义了”对齐的核心矛盾是什么”这个问题本身。

数据集的价值也值得单独说。17 万条样本放到今天不算多,但它胜在”干净且成对”——每条都是同一对话场景下的二选一,直接可训偏好模型。开源社区把它用到了极致,连 DeepSeek 这类后起之秀做对齐时也把它当参照系。这份遗产比论文本身活得久得多。

当然,它也有时代局限。数据全是英文、由美国众包标注员产出,“无害”的标准天然带着一国的文化滤镜;63% 的一致性也提醒你,人类偏好这件事本身就谈不上稳定。后来的 Constitutional AI 正是冲着这个痛点去的——既然人标不稳定又贵,那就让 AI 照规则自评。HH-RLHF 是地基,宪法 AI 是盖在地基上的楼,两篇连起来读,才能看懂 Anthropic 的对齐叙事。


附:核心数据速查#

HH-RLHF 基本盘

项目数值
arXiv2204.05862(2022-04-12)
数据集规模约 17 万条对比样本(约 14 万静态 + 2.2 万在线)
数据构成静态约 96k helpfulness + 44k harmlessness comparisons
对话数约 3.5 万条(每条约含 4 次比较)
训练 prompts约 50 万(137k 人工 + 369k 模型生成)
模型扫描13M → 52B 共 7 个 PM
精选标注员约 20 名 MTurk master-qualified 工人(贡献约 80% 数据)

关键实验结论

  • 单独训的 helpfulness PM 在 harmlessness 分布上远差于随机(反之亦然)→ 定量证明张力
  • HH-PM(混合训练)在 HHH 评测上准确率约 86%(人类平均约 75%)
  • reward ∝ √KL(reward 与策略偏离初始化的 KL 平方根近似线性)
  • 每周迭代在线训练 5 周,在线模型显著优于静态模型
  • 标注员与研究者偏好一致率约 63%

关键概念清单

  • RLHF = Reinforcement Learning from Human Feedback,人类反馈强化学习
  • HH-RLHF = Helpful & Harmless RLHF 数据集(helpful 与 harmless 双目标)
  • HHH = Helpful, Honest, Harmless(有帮助、诚实、无害三件套)
  • preference model(PM)= 偏好模型(判断两个回答哪个更好的模型)
  • harmlessness / helpfulness = 无害性 / 帮助性(两个对齐目标,互相拉扯)
  • red-teaming 数据 = 红队数据(标注员故意诱导模型输出有害内容后标掉)
  • iterated online training = 迭代在线训练(每周用新数据更新 PM 和策略)
  • KL divergence = KL 散度(策略偏离初始化的程度度量)
  • Elo = 国际象棋积分制(用于人类对比评测模型强弱)
  • rejection sampling = 拒绝采样(用早期 PM 挑高分回答扩展数据集)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

HH-RLHF:17 万对比样本
https://mizuki-eaf.pages.dev/posts/claude/hh-rlhf17-万对比样本/
作者
无名之子
发布于
2026-08-04
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录