mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4255 字
12 分钟
DeepSeek-R1:只给奖励不施教
2026-07-08

DeepSeek-R1 论文解读:不教它思考,只给它奖励#

论文:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 作者:DeepSeek-AI(核心贡献者 Daya Guo、Junxiao Song、Peiyi Wang 等) 这篇是 2025 年 1 月引爆圈内圈外的那篇。它的核心主张一句话就能说完:不给人写推理过程,纯强化学习,模型自己长出了反思、验证、自我纠错这些高级推理行为。R1 的”aha moment”——模型自言自语说出”等等,让我重新想”——是 RL 威力的最佳广告。前提是得先读完 DeepSeekMath(GRPO 的出处)和 DeepSeek-V3(底座)。


一、引言:推理能力的天花板,是人写的示例#

开头把问题说得尖锐:LLM 推理能力很强,但强得很贵。要么靠海量算力在预训练里硬撑,要么靠 chain-of-thought(CoT,思维链)提示——而这个路线高度依赖人工标注的推理轨迹

作者指出这种依赖的两个坑:

  1. 规模撑不起来:人工写推理轨迹成本高,还带着标注者的认知偏见。
  2. 性能封顶:让模型模仿人的思考过程,上限就是人提供的那些示例。人想不到的更优推理路径,模型也探索不到。

所以这篇论文的路线很极端:跳过 SFT,直接对 base 模型做纯 RL。用 DeepSeek-V3-Base 当底座,GRPO 当算法,奖励信号只用”最终答案对错”这一条规则,完全不管推理过程长什么样。赌的就是:不设任何内容约束,模型自己会长出更好的推理策略。

这个赌注赢了。模型不但会做题,还自然涌现出验证、反思、尝试替代方案这些行为。论文给这个”自进化”起名 DeepSeek-R1-Zero——Zero 就是”零 SFT”的意思。

二、DeepSeek-R1-Zero:纯 RL,无 SFT#

GRPO 简版回顾#

算法是从 DeepSeekMath 继承的 GRPO。核心思想:同一道题采 G 个输出,用组内平均奖励当基线,每个输出的 advantage 是”自己减去组内平均,再除以组内标准差”。不要 PPO 那种又大又难训的 critic 值函数。

R1-Zero 的训练配置:学习率 3e-6、KL 系数 0.001、采样温度 1.0、每题采 16 个输出、最大输出长度前 8200 步是 32768 token、之后放宽到 65536。每 400 步用最新策略替换 reference 模型。训练一共 10400 步,相当于 1.6 个 epoch,每步 32 道题、batch 512。

奖励设计:只用规则,不用神经网络#

奖励就两样,加起来:

  • Accuracy reward(正确性奖励):数学题要求最终答案写进规定格式(比如方框里),规则直接判对错;代码题用编译器跑预定义测试用例判。
  • Format reward(格式奖励):要求推理过程放在 <think>...</think> 标签里、答案放 <answer>...</answer> 里。

论文特别强调:刻意不用神经网络奖励模型,不管是结果监督还是过程监督。理由很实际:神经奖励模型在大规模 RL 里容易被 reward hacking(奖励作弊),而且重训要花巨额算力和额外复杂度。这个选择后来被证明极其关键——R1 的成功有很大一部分是”奖励够干净”的成功。

结果:AIME 从 15.6% 涨到 77.9%#

训练曲线非常震撼。AIME 2024(美国数学邀请赛)的 pass@1 从初始 15.6% 一路涨到 77.9%;用自一致性采 16 个再投票,能到 86.7%,超过人类选手平均水平。而且这不是死记硬背——代码竞赛、研究生水平的生物/物理/化学题都在涨。

图 1(b) 是另一个关键观察:训练过程中响应长度持续增长,模型自发地”想得更久”。几百到几千 token 的推理过程里,它自己学会了反思、探索替代解法。这就是 RL 里说的”thinking time”(思考时间)——不是谁逼的,是奖励信号教的。

论文还记录了一个著名的瞬间——“aha moment”(顿悟时刻)。一个中间版本的模型在解方程时突然冒出:“等等,等等。这有个顿悟时刻我可以标记一下。让我们一步步重新评估……”(Wait, wait. Wait. That’s an aha moment I can flag here. Let’s reevaluate this step-by-step)。模型学会了自我怀疑和自我纠正,用拟人的口吻说出来。对作者来说,这是”亲眼见证强化学习的威力与美”。

三、DeepSeek-R1:把 Zero 的毛病修掉#

R1-Zero 很猛,但有明显毛病:

  • 可读性差:推理过程乱、长、不可读。
  • 语言混杂:V3-Base 是中英双语预训练,没约束时思维链里中英混着来。
  • 只会推理:写作、开放域问答这些不靠推理的任务完全没练。

于是有了完整版的 R1,一套多阶段流水线:

阶段一:冷启动(Cold Start)。 先收集几千条”符合人类对话习惯”的长 CoT 数据做一小段 SFT,把模型从”野路子思考”掰回”第一人称、有反思有验证、语言一致”的风格。注意这里的冷启动数据是产品驱动的——论文强调动机主要是提升用户体验,并澄清那些生动的推理模式是 DeepSeek 设计的启发式,而不是模型自发获得了人类式智能。

阶段二:第一个 RL 阶段。 规则奖励 + 语言一致性奖励。语言一致性奖励是新加的,计算思维链里目标语言词的比例,治中英混杂。消融实验承认它会轻微掉性能,但换来了人类可读性,值。

阶段三:拒绝采样 + SFT。 用第一阶段 RL 的 checkpoint 做拒绝采样,生成约 60 万条推理数据;再补约 20 万条非推理数据(写作、事实问答、翻译、软件工程等,部分复用 V3 的 SFT 数据)。推理数据里有些是用生成式奖励模型判断的——把标准答案和模型预测喂给 DeepSeek-V3 打分。这阶段让 R1 既能推理又能写好文。

阶段四:第二个 RL 阶段。 面向所有任务,混合信号:推理数据用规则奖励,通用数据用两个奖励模型(有用性 + 安全性),再加语言一致性奖励。温度降到 0.7(太高会生成不连贯),一共 1700 步,通用偏好奖励只在最后 400 步引入——因为发现跑太久会 reward hacking。

四、实验:R1 各阶段和蒸馏模型的成绩#

逐阶段效果(表 3 关键数字)。 每个开发阶段的分工很清楚:

  • R1-Zero → Dev1:加了冷启动,IF-Eval 46.6 → 71.7(指令遵循大涨),但 AIME 从 77.9 掉到 59.0(冷启动数据太少,拖累推理)。
  • Dev1 → Dev2:第一个 RL 阶段,推理能力大幅反弹(相对 Dev1),AIME 74.0、Codeforces rating 1687——不过 AIME 仍低于 R1-Zero 的 77.9。
  • Dev2 → Dev3:加入大规模非推理数据的 SFT,AlpacaEval 2.0 从 55.8 → 62.1、Aider-Polyglot 从 25.6 → 44.8(代码工程能力大涨)。
  • Dev3 → 最终 R1:混合数据全面 RL,主要涨在通用指令遵循和用户偏好——AlpacaEval 2.0 暴涨 25 个点到 87.6,ArenaHard 涨 17 个点到 92.3。代码数学只是边际提升,因为前面阶段已经练到位了。

最终 R1 的成绩。 AIME 2024 pass@1 79.8、MATH-500 97.3、Codeforces rating 2029(前 96.3 百分位)、SWE-Verified 49.2、GPQA Diamond 71.5、MMLU 90.8、AlpacaEval 2.0 87.6。

蒸馏:小模型的逆袭。 论文把 R1 的输出蒸馏成一组小模型,1.5B 到 70B 不等。蒸馏做法很朴素:用 80 万条数据(60 万推理 + 20 万非推理,正是阶段三那批)微调开源底座(Qwen2.5 系列和 Llama 系列)。

结果惊人。DeepSeek-R1-Distill-Qwen-1.5B——一个 15 亿参数的小模型——AIME 2024 拿 28.9、MATH-500 拿 83.9,比 GPT-4o 和 Claude-3.5-Sonnet 还高。蒸馏的 Qwen-32B 更猛:AIME 72.6、GPQA Diamond 62.1、Codeforces rating 1691。

论文还做了个对照实验(表 16):对 Qwen2.5-32B-Base 直接跑 1 万步大 RL(叫 Qwen2.5-32B-Zero),效果跟 QwQ-32B-Preview 差不多,但被蒸馏出来的 Distill-Qwen-32B 全面碾压。结论两条:一是蒸馏比自己跑 RL 又省又快还好;二是要突破人类智能边界,还得靠更大底座加更大规模 RL。

五、安全声明#

R1 的推理能力带来了新的安全风险:更强的模型更容易被 jailbreak 攻击攻破,能给出操作性和可执行性更强的危险方案(比如爆炸物制造);开放权重模型还容易被二次微调洗掉安全护栏。评估显示 R1 的固有安全水平处于中等(跟 GPT-4o 2024-05-13 差不多),配合风控系统后能到优秀。

六、结论、局限与展望#

结论掷地有声:预训练 checkpoint 本身就藏着巨大的推理潜力,解锁它靠的不是海量人工标注,而是三样东西——难的推理题、可靠的验证器、足够的算力跑 RL。 反思、自验证这些行为是 RL 过程中自然涌现的。

局限列了一堆,每条都实诚:

  • 结构化输出和工具调用弱:不会用搜索引擎、计算器。作者说下个版本会修(这是 R1.5 和后续工作的伏笔)。
  • token 效率:推理动态分配算力,简单题想得少、难题想得多,但”过度思考”(overthinking)还是存在,简单题也啰嗦。
  • 语言混杂:中英之外的语言推理时容易串回英语。
  • 提示词敏感:few-shot 反而掉性能,推荐 zero-shot 直接描述问题。
  • 软件工程弱:评测时间太长拖累 RL 效率,SWE 上没比 V3 大多少。

还有纯 RL 方法本身的硬伤:

  • Reward hacking:纯 RL 的成功依赖可靠奖励。数学代码有规则可依,但写作这种任务造不出可靠验证器,用模型打分就容易被钻空子。对于造不出可靠信号的任务,纯 RL 规模化仍是开放问题——R1 的做法是退回去用人工标注做 SFT,RL 只跑几百步。

收尾:我的一点看法#

这篇论文我反复想怎么评价。它最了不起的地方,不是某个单一技术的突破,而是把”AI 的推理能力到底怎么来”这个问题推到了一个新答案上

过去的主流共识是:推理靠人教。SFT 提供示例,RLHF 做偏好对齐,模型的推理上限被人写的示例焊死。R1 用一场干净的实验证明:只要奖励信号够可靠(规则可验证),人根本不需要教推理——模型自己会发展出比人教的更好的策略。那个 aha moment 不是营销噱头,它是”自进化”这个事实的具象化证据。

第二个让我佩服的点是克制。论文在奖励设计上极度克制——不要神经奖励模型,只要规则;在思考过程上极度克制——只约束格式,不约束内容。这种”少干预”的哲学,跟 V2 砍 KV cache、DeepSeekMath 砍 critic 是一脉相承的:DeepSeek 的每次突破几乎都是”去掉一个多余的东西”。

第三个点值得单独说:蒸馏的价值判断。论文明确讲,1.5B 的小模型蒸馏出来就能吊打 GPT-4o 的数学,而让 32B 底座自己跑大 RL 反而打不过蒸馏。这是对”越大越好”叙事的一次有力修正——至少在推理这个维度上,好老师比大参数更重要。这也是为什么 R1 系列后来成了开源社区蒸馏的标准教材。

当然也要泼盆冷水。R1 的成功高度依赖”答案可验证”这个前提,数学、代码恰好完美满足。换个角度想,这个前提也划出了纯 RL 的边界:凡是造不出可靠验证器的任务,R1 那套就失灵,还得退回人肉标注。所以 R1 不是推理的终点,它是”可验证推理”的起点——后面 V3.1、R2 走工具调用、接搜索引擎,都是在把这个边界往外推。

从 DeepSeekMath 到 R1,一篇埋一篇的线索在这里收束了:GRPO 是数学论文里省显存的小技巧,一年后成了 671B 模型撬动推理能力的大杠杆。读 DeepSeek 系论文的最大乐趣就在这——你不单是在读一篇技术报告,是在看一个团队怎么把每个朴素想法推到极限。


附:核心数据速查#

DeepSeek-R1-Zero 关键数字

指标数值
训练算法GRPO(纯 RL,无 SFT)
底座DeepSeek-V3-Base
奖励规则奖励(正确性 + 格式),不用神经奖励模型
AIME 2024 pass@115.6% → 77.9%(cons@16 到 86.7%,超人类平均)
训练配置64×8 H800,约 198 小时
行为涌现反思、验证、替代方案探索、thinking time 自发增长、“aha moment”

DeepSeek-R1 多阶段流水线

阶段内容效果
冷启动几千条人写风格长 CoT 做 SFT可读性、语言一致,但短时拖累推理
RL 阶段一规则奖励 + 语言一致性奖励推理大幅反弹(AIME 74.0,未回 R1-Zero 峰值)
拒绝采样 + SFT60 万推理 + 20 万非推理数据推理 + 写作 + 代码工程
RL 阶段二混合奖励(规则 + 偏好 RM),温度 0.7通用能力大涨

最终 R1 成绩

  • AIME 2024 79.8(pass@64 90.0、cons@64 86.7——cons 采样数为 64,不同于 R1-Zero 的 cons@16);MATH-500 97.3;Codeforces rating 2029(96.3 百分位)
  • GPQA Diamond 71.5;MMLU 90.8;SWE-Verified 49.2
  • AlpacaEval 2.0 87.6;ArenaHard 92.3;IF-Eval 83.3

蒸馏模型成绩(vs GPT-4o / Claude-3.5-Sonnet)

模型AIME 2024MATH-500GPQA DiamondLiveCodeBenchCodeforces rating
GPT-4o-05139.374.649.932.9759
Claude-3.5-Sonnet-102216.078.365.038.9717
R1-Distill-Qwen-1.5B28.983.933.816.9954
R1-Distill-Qwen-7B55.592.849.137.61189
R1-Distill-Qwen-14B69.793.959.153.11481
R1-Distill-Qwen-32B72.694.362.157.21691
R1-Distill-Llama-70B70.094.565.257.51633

蒸馏 vs 大 RL 对照(表 16)

  • Qwen2.5-32B-Zero(直接大 RL,1 万步):AIME 47.0、GPQA 55.0
  • R1-Distill-Qwen-32B(蒸馏):AIME 72.6、GPQA 62.1 —— 蒸馏全面碾压

训练成本

  • R1-Zero:64×8 H800,约 198 小时
  • R1:同配置约 80 小时;SFT 数据构建 5K GPU 小时

关键概念清单

  • RL = Reinforcement Learning,强化学习
  • GRPO = Group Relative Policy Optimization,组相对策略优化(无 critic,组内相对 baseline)
  • SFT = supervised fine-tuning,监督微调
  • CoT = chain-of-thought,思维链
  • DeepSeek-V3-Base = 底座(671B MoE,37B 激活)
  • rule-based reward = 规则奖励(正确性 + 格式)
  • reward hacking = 奖励作弊(钻奖励函数的空子)
  • cold start = 冷启动(少量人写风格长 CoT 做 SFT)
  • rejection sampling = 拒绝采样(从 RL checkpoint 采数据、留正确的)
  • language consistency reward = 语言一致性奖励
  • thinking time = 思考时间(响应长度随 RL 自发增长)
  • aha moment = 顿悟时刻(模型自学自我纠错的标志性瞬间)
  • distillation = 蒸馏(用大模型输出微调小模型)
  • AIME = 美国数学邀请赛;MATH-500 = 数学基准;GPQA = 研究生科学问答
  • Codeforces = 编程竞赛平台;SWE-Bench = 软件工程基准
  • AlpacaEval 2.0 / ArenaHard = 开放域对话评测
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

DeepSeek-R1:只给奖励不施教
https://mizuki-eaf.pages.dev/posts/deepseek/deepseek-r1只给奖励不施教/
作者
无名之子
发布于
2026-07-08
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录