mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2444 字
7 分钟
Context Distillation:提示词背进脑
2026-07-17

Context Distillation 论文解读:让模型把提示词”背”进脑子里,推理成本直接打骨折#

论文:A General Language Assistant as a Laboratory for Alignment(提出 context distillation 的一节) 作者:Amanda Askell、Yuntao Bai 等(Anthropic) arXiv<2112>.00861,2021 年 12 月 8 日

勘误提醒:部分资料把这篇记为 arXiv<2210>.14867(2022.10),那是微软一篇多语言论文的编号,张冠李戴了。Context Distillation(上下文蒸馏)的原始出处是上面这篇 Anthropic 的《A General Language Assistant as a Laboratory for Alignment》。它干的事一句话:让模型先在完整上下文(比如一大段思维过程)下回答,再用”短提示 + 这个回答”做监督微调,逼模型在推理时自己”脑补”出那段上下文的效果。推理成本降了,长上下文的能力也被”压缩”进了模型本体——这是 Claude 效率路线最早的伏笔。


一、引言:提示词是有成本的#

2021 年那会儿,让模型听话的主流方式还是 prompt(提示词):把一堆”你要有帮助、诚实、无害”的要求写进上下文。这招直观,但账面上有三个窟窿。

第一,上下文窗口是稀缺资源。prompt 越长,留给真正内容的位子越少,总长度还顶着窗口上限。第二,每次生成都要把 prompt 从头算一遍,重复计算,又慢又费钱。第三,你没法把”超过上下文窗口长度”的复杂指令塞进去用。

论文的逻辑很简单:既然 prompt 能改模型的行为,那能不能让模型把这个行为本身学进参数里?以后不需要 prompt 也能稳定复现——这就是 context distillation 的起点。

二、核心方法:KL 散度,把”条件行为”焊进模型#

形式化很干净。设 p₀ 是原始模型,C 是一段固定上下文,X 是从大规模语料里采的文本。蒸馏的目标是让新模型 p_θ 学会 p₀ 在”看到了 C 之后”的行为:

L(θ) = D_KL(p₀(X|C) ‖ p_θ(X))

训练数据就是大量”短提示 X → 带上下文模型的完整回答”配对,做监督微调。推理时只喂短提示,模型却展现出仿佛看过完整上下文的行为。

和普通微调的本质区别在这:微调改变的是模型对数据分布 P(X) 的期望,等于改了模型的世界观;context distillation 学的是条件分布 P(X|C)——“在给定这个上下文的情况下该怎么答”,学到的是行为模式,不是把上下文的内容背下来。论文给了个直观例子:给模型看序列 C = 1, 2, …, 63,prompting 会让它预测下一个是 64;而直接 finetuning on C,模型并不会期待立刻看到 64。两者改的东西根本不是一层。

作者还预告了一个野心:context distillation 可以迭代应用,像”给模型加载长期记忆或伪身份”一样层层蒸馏。这个设想后来真的长成了大树。

三、实验:对齐收益随规模涨,对齐税在大模型上几乎消失#

实验全部围绕”帮助、诚实、无害”(HHH)展开,结论可以掰成四块:

  • HHH 评测:蒸馏模型表现与完整 prompt 相当,都大幅碾压无干预基线。尤其无害性一项,prompt 里根本没有任何”拒绝有害请求”的例子,蒸馏模型却能泛化出拒绝行为——说明它学到的是行为原则,不是死记硬背。
  • TruthfulQA:这是个专门把大模型往坑里带的对抗数据集。原始模型在这上面表现随规模下降,蒸馏后大模型(13B、52B)表现转正,随规模上升。
  • 毒性:用 RealToxicityPrompts 测,蒸馏和 prompting 都能显著降低毒性,且效果相近;对有毒提示词,干预效果在 12B 以上才显著——又是”规模越大越有效”。
  • 对齐税:Lambada 上略有能力损失且不随规模变化;代码评估(HumanEval、QuixBugs)里,小模型(≤3B)会被 prompt 搞迷糊、性能下降,大模型(13B、52B)反而提升。人类偏好上,完整 prompt 以约 53% 的微弱优势胜过蒸馏——损失小到可以接受。

组合起来一句话:越大越省心。对齐收益随规模涨,对齐税随规模降。

四、与蒸馏的区别:这杯水不是倒进另一个杯子里#

这里得跟”蒸馏”一词较个真。传统知识蒸馏(knowledge distillation)是 teacher-student:大模型当老师,把能力倒给一个小学生模型。Context distillation 里老师和学生是同一个模型,转移的不是”参数规模”,而是”上下文依赖”——从”靠外部提示词驱动”变成”靠内部参数驱动”。前者压缩的是模型,后者压缩的是推理时的输入成本和上下文占用。

顺带一提,HH-RLHF 那篇的数据收集里就用了”context-distilled 52B 模型”——这个技术已经悄悄进了 Anthropic 的训练管线。而它真正的远方亲戚,是后来 Claude 系列把”长思考/扩展思考”蒸馏进标准模式、用短提示复现长上下文效果的效率路线。2021 年埋的种子,2026 年还在结果。

收尾:我的一点看法#

这篇论文值得敬佩的地方,是它把”省”当成一等公民来研究。2021 年大家都在拼模型更大,Anthropic 却在想”怎么让模型不靠提示词也能稳定发挥”——这个方向后来被证明是产品化的命门:prompt 再强也是外挂,背进参数里才不占窗口、不重复算、不超长度。Claude 从 9K 到 1M 上下文的效率路线,往前追,起点就是这一篇。

它的局限性也很清楚。蒸馏损失虽然小但确实存在——人类偏好里完整 prompt 还是略赢一点,说明”外挂”在极端场景仍有存在价值;蒸馏学到的行为也可能被数据分布绑架,泛化范围不如实时 prompt 灵活。另外,论文主体讨论的其实是”用对齐研究来当 AI 实验室”这个大框架,context distillation 只是其中一节,重要但不喧宾夺主。

放到 2026 年看,我最欣赏的是那句”迭代应用、加载长期记忆”。后来的 Agent 系统靠 MCP、memory files 解决长期记忆,靠上下文工程调度行为——而”把行为蒸馏进参数”这条更硬核的路,正在”思考预算”和”隐藏推理”的掩护下悄悄成为主流。当年那个让模型背下提示词的朴素念头,如今是每一家模型厂商省钱省延迟的必修课。


附:核心数据速查#

Context Distillation 基本盘

项目数值
原始出处arXiv<2112>.00861《A General Language Assistant as a Laboratory for Alignment》(2021-12-08)
目标函数L(θ) = D_KL(p₀(X|C) || p_θ(X))
学习对象条件分布 P(X|C)(给定上下文的行为),而非数据分布 P(X)
实验基线无干预 / 完整 prompt / context distillation 三组对比
规模197M → 52B(13B、52B 为主要验证对象)

关键实验结论

  • HHH 评测:蒸馏 ≈ 完整 prompt,均大幅优于无干预基线
  • TruthfulQA:大模型(13B/52B)蒸馏后表现转正、随规模上升
  • 毒性:显著降低,与 prompting 相当,12B 以上效果显著
  • 对齐税:Lambada 略有损失;代码评估大模型反而提升(小模型被 prompt 迷惑)
  • 人类偏好:完整 prompt 以约 53% 微弱优势胜出(蒸馏损失很小)
  • 可迭代应用,论文设想用于”加载长期记忆/伪身份”

关键概念清单

  • context distillation = 上下文蒸馏(把完整上下文的行为通过 KL 散度压进模型参数)
  • KL divergence = KL 散度(衡量两个概率分布差异的度量)
  • P(X|C) = 给定上下文 C 的条件分布(蒸馏要学的行为模式)
  • knowledge distillation = 知识蒸馏(大模型 teacher 教小模型 student,与上下文蒸馏不同源)
  • HHH = Helpful, Honest, Harmless(帮助、诚实、无害三件套)
  • TruthfulQA = 对抗性诚实评测(专门难倒大模型的事实性问答数据集)
  • RealToxicityPrompts = 真实毒性提示词数据集(测模型毒性输出的基准)
  • alignment tax = 对齐税(对齐干预带来的能力损失)
  • prompt = 提示词(写进上下文引导模型行为的外部指令)
  • extended thinking = 扩展思考(Claude 后期把长推理蒸馏进标准模式的效率路线)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Context Distillation:提示词背进脑
https://mizuki-eaf.pages.dev/posts/claude/context-distillation提示词背进脑/
作者
无名之子
发布于
2026-07-17
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录