Red Teaming 论文解读:38,961 次人类攻击,把安全评估从玄学变成方法论
论文:Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned 作者:Deep Ganguli、Liane Lovitt 等(Anthropic) arXiv<2209>2209>.07858,2022 年 8 月 23 日(v2 修订于 2022 年 11 月)
“红队”这个词从网络安全借来,在 AI 圈第一次被做成一套完整可复制的方法论,就是这篇。它的目标是一石三鸟:发现危害、测量危害、减少危害。38,961 条人类红队攻击样本连同方法论一起公开,Anthropic 之后每一次发布模型都带着红队报告,行业也跟进学样——这套”让人类攻击 AI 找漏洞”的玩法,从此成了安全评估的标准动作。
一、引言:防毒前先得知道毒长什么样
训练一个安全模型,第一道坎其实很朴素:你连它会被怎么攻击、会输出什么坏事都不清楚,谈何防御。2022 年那会儿,评测都堆在”这个模型答对了多少题”上,没人系统回答”这个模型能坏到什么程度”。
红队(red teaming)就是从攻击者视角出发,主动、成规模地找模型的漏洞。论文把任务说得很直白:同时发现、测量、减少有害输出。它不是一次性的”试试看”,而是要立一套可重复、可统计、可共享的方法。
二、方法:三规模 × 四类型,外加完整的说明书
实验设计相当工整。模型横跨 3 个规模——2.7B、13B、52B,纵切 4 种类型:
- 裸预训练 LM;
- 被 prompt 要求”helpful、honest、harmless”的 LM;
- 带 rejection sampling(拒绝采样)的 LM;
- 用 RLHF 训成 helpful + harmless 的模型。
红队攻击由人类标注员执行:围绕一批预先定好的攻击类别(歧视、非法活动、色情、医疗误导、隐私……),标注员自由发挥,从”直球攻击”到”拐弯抹角的越狱”,跟模型对话并记录成功的攻击。论文还花了大量篇幅交代操作细节:标注工具长什么样、指令怎么给、统计口径怎么定、标注员之间的分歧怎么处理。这种”连说明书都公开”的作风,摆明了是要给全行业立标杆。
三、发现:越大的 RLHF 模型,越难被攻破
数据集是硬通货:38,961 条红队攻击样本,全部开源。对数据做分析后,漏洞图谱浮出水面——不只有脏话、暴力这类显性伤害,还有一大类”细小的非暴力不道德输出”:操控性话术、对敏感问题的越界”协助”、伪装成建议的歧视。它们比显性伤害更阴,是安全防线最容易漏的地方。
最有价值的结论是缩放行为(scaling behaviors)上的差异:
- RLHF 模型:规模越大,越难被红队攻破——防线随能力同步长高;
- 其他三类模型:红队成功率随规模基本持平,甚至更糟——prompt 和 rejection sampling 的防御没有随模型变大而变强。
一句话:靠”事后加固”的防御不随规模涨,把安全训练进目标里的防御才涨。这个观察直接支撑了 Anthropic 后来死磕对齐训练、而不是依赖 prompt 和过滤器的路线选择。
四、意义:从研究动作到安全评估体系
这篇之后,红队从实验室动作变成了 Anthropic 的产品流程。Claude 2 的发布博客公开了红队结果(无害响应翻倍),Claude 3 系列附带了完整 red team 报告,ASL 安全分级(AI Safety Level)里每一级都内置了红队门槛。整个行业也跟着卷了起来:OpenAI 的红队报告、各类红队基准(如 HarmBench、XSTest)纷纷出现,源头都能追到这一篇。
更远的一条线是它与 many-shot jailbreaking(多示例越狱)的传承。2022 年这里红队靠人类手动攻击,2024 年 Anthropic 发现攻击也可以规模化:把越狱样本”摊”进很长的上下文里,模型反而越容易被带偏——攻击从”人肉”变成了”堆上下文”。防御从”找更多人类攻击”演进成”检测长上下文中的许多-shot 攻击”。方法论内核没变:站在攻击者角度找漏洞,只是攻击者换成了自动化工具。
收尾:我的一点看法
这篇最值钱的不是 38,961 条数据,而是那个缩放行为的结论。它把”对齐”和”过滤”从策略层面分开了:prompt 加固、后置过滤都不随模型规模涨能力,只有训练时就把安全写进目标的做法才涨。这个判断贯穿了 Anthropic 五年——他们宁可发布节奏慢半拍,也要把安全做进训练而不是打补丁,追根溯源就是这里埋下的。
局限也很明显。红队是人类标注员手动进行的,注定覆盖不全——38,961 次攻击在可能的攻击空间面前只是沧海一粟;标注员的想象力、文化背景、语言能力,都是这套方法的隐形天花板。这也是为什么后来必须走向自动化攻击:人类红队给的是”下限样例”,机器红队才有希望逼近”攻击全集”。
跟 many-shot jailbreaking 连起来读尤其过瘾。它几乎是红队论文的镜像:人类攻不动的 RLHF 模型,2019 年式的手动攻击确实难,但把攻击搬到长上下文里,“防御随规模增长”的神话就被戳穿了——安全是场攻防拉锯,不是一劳永逸。这篇教会行业”怎么找漏洞”,many-shot 那篇教会”漏洞会自己进化”,两篇拼起来才是 Anthropic 安全叙事完整的一半。
附:核心数据速查
Red Teaming 基本盘
| 项目 | 数值 |
|---|---|
| arXiv | 2209.07858(2022-08-23,v2 于 2022-11-22) |
| 开源攻击样本 | 38,961 条红队攻击 |
| 模型规模 | 2.7B / 13B / 52B |
| 模型类型 | 裸 LM、prompted HHH、rejection sampling、RLHF 四类 |
| 攻击类别 | 歧视、非法活动、性相关、医疗误导、隐私、操控性输出等 |
关键结论
- RLHF 模型规模越大越难被红队攻破;其余三类防御随规模持平
- 漏洞不只有显性伤害,还有大量”细小的非暴力不道德输出”
- 方法论(工具、指令、统计口径、分歧处理)全部公开
- 与 many-shot jailbreaking(2024):攻击从人工走向长上下文规模化
关键概念清单
- red teaming = 红队测试(从攻击者视角主动寻找模型漏洞)
- scaling behaviors = 缩放行为(防御强度随模型规模的变化规律)
- rejection sampling = 拒绝采样(采样回答后过滤低分,作为对齐手段)
- RLHF = 人类反馈强化学习(四类被测模型中最难被攻破的一类)
- subtle harm = 隐性伤害(非暴力但操控性/歧视性的越界输出)
- many-shot jailbreaking = 多示例越狱(把越狱样本摊进长上下文绕过防御)
- ASL = AI Safety Level,AI 安全分级(Anthropic 内部安全承诺体系)
- 攻击类别(harm categories)= 红队攻击的分类清单(歧视、非法、医疗误导等)
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





