DeepSeekMath-V2 论文解读:正确答案不再可靠,教模型自己验证明白
论文:DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning 作者:Zhihong Shao、Yuxiang Luo、Chengda Lu、Z.Z. Ren 等,DeepSeek-AI 2025 年 11 月。这篇回答一个尖锐的问题,靠”最终答案对不对”当奖励的 RL,把 AIME、HMMT 这种定量竞赛刷到饱和之后,接下来怎么办?正确答案不代表推理正确,定理证明又根本没有数值答案可判。DeepSeekMath-V2 的答案是自验证,先训一个能挑出证明毛病的验证器,再用它当奖励训生成器,逼生成器在交卷前自己把问题找出来、修掉。成果是 IMO 2025 解出 5/6、CMO 2024 金牌水平、普特南 2024 拿了 118/120,超过人类最高分 90。
一、背景:最终答案奖励的两条死路
一年时间,靠”答案对了就给奖励”的 RL,前沿模型把 AIME、HMMT 刷到了饱和。但这个奖励机制有两个根本缺陷。
第一,它是推理正确性的不可靠代理,模型可以用错误逻辑碰巧答对,或者犯幸运的错误。第二,它对定理证明完全失效,证明题没有数值答案,严谨的逐步推导才是目标。结果就是,这种训练出来的模型,验证能力很差,错误证明的假阳性率很高,明明有显而易见的逻辑漏洞还声称证明有效。
二、方法:验证器和生成器的协同循环
1. 训练验证器
给验证器制定高层评分准则(rubrics),对每个证明做分析,先总结发现的问题,再打三档分,1 分证明完整严谨,0.5 分整体逻辑成立但有小错或细节缺失,0 分有致命逻辑错误。
冷启动数据从 AoPS(Art of Problem Solving,在线数学竞赛社区)爬了 17503 道证明题(奥赛、选拔赛、2010 年后的题),用 DeepSeek-V3.2-Exp-Thinking 的变体生成候选证明(这个模型没专门优化证明,输出简洁但容易错,所以让它多轮迭代细化),数学专家按准则打分。RL 训练用格式奖励加分数奖励。
2. 元验证:治幻觉问题
训练中发现一个大漏洞,验证器面对错误证明时,只要分数猜对了就能拿满分,哪怕它幻觉出根本不存在的问题。这会让验证器失去可信度。
解法是元验证(meta-verification),再训一个元验证器,专门审查验证器的分析,判断它指出的问题是否真实存在、能否逻辑上支撑所给分数。把元验证器的反馈乘进奖励(R_V = R_format · R_score · R_meta),验证器分析的平均质量从 0.85 涨到 0.96,分数预测精度不掉。
3. 训练生成器:学会自己挑毛病
用验证器当生成式奖励模型训证明生成器。关键设计是让生成器”证明 + 自我分析”一体输出,自我分析用跟验证器一样的格式和准则。奖励公式 R = R_format · (0.76·R_Y + 0.24·R_Z),其中 R_Z 惩罚自我评估不准。
这套奖励结构制造了三个激励:诚实承认错误比虚假声称正确更划算;最高奖励来自”证明写对 + 自我评估也准”;所以最优策略是在交卷前把能发现的问题尽量都解决掉。这等于把奖励函数显式告诉模型,让它靠思考而不是盲试去最大化奖励。
4. 协同循环:自动标注
验证器改进生成器,生成器变强后产出的新证明会挑战验证器的能力边界,这些难验证的新证明又成为训练验证器的新数据。关键观察两条,扩大验证采样数能提高抓到真问题的概率;审查验证器找的问题(元验证)比从零找问题容易得多。
于是搞了全自动标注管线,每个证明生成 n 份独立验证分析,对报问题的分析生成 m 份元验证评估做多数表决,有效才采纳。最后两轮训练完全抛弃人工标注,自动标签跟专家判断对齐良好。
训练用 GRPO,交替优化验证和生成,从第二轮起,验证器用上一轮合并了验证与生成能力的 checkpoint 初始化。
三、成绩
一次性生成。自家 CNML 级别(中国高中数学联赛难度)91 道题,代数、几何、数论、组合、不等式五个类别全面超过 GPT-5-Thinking-High 和 Gemini 2.5-Pro。
顺序细化。IMO Shortlist 2024 上,每轮用验证反馈重新提示生成器修改,最多 8 轮。Pass@1 随迭代轮数稳步上升,Best@32(按自评分挑最好的)显著高于线程平均,证明生成器真的能区分好证明和烂证明。
高算力搜索。每道题维护候选池,64 个证明样本配 64 份验证分析起步,每轮选最高分的 64 个证明各配 8 份分析(优先挑报问题的),生成精化证明更新候选池,最多 16 轮,直到某证明通过全部 64 次验证。结果:
- IMO 2025:5/6(83.3%),金牌水平
- CMO 2024:4 题全解 + 1 题部分得分(73.8%),金牌水平
- Putnam 2024:11/12 完整解出,剩 1 题小错,118/120,超过人类最高分 90
- IMO-ProofBench:基础集超过 DeepMind 的 DeepThink(IMO Gold),进阶集保持竞争力;基础 99.0%、进阶 61.9%(对比 DeepThink 89.0%/65.7%)
还有个很说明问题的细节,没完全解出的题,生成器通常能准确指出自己证明里的真问题;完全解出的题能通过全部 64 次验证。验证器是真能干活,不是摆设。
收尾:我的一点看法
DeepSeekMath-V2 是 DeepSeek 推理路线的一次范式转向。从 DeepSeekMath 的 GRPO、R1 的规则奖励,一路都是”答案可验证”的哲学,这篇终于正面撞上”答案不可验证怎么办”的墙。答案是造一个能验证的模型,验证器加生成器的协同循环,让模型自己给自己当裁判。
元验证这个设计是全文最聪明的部分。直接训验证器,模型会学会”猜对分数 + 幻觉问题”的作弊路径,这是 RL 奖励设计的经典漏洞。加一层元验证器专门审查”问题是否真实存在”,把幻觉问题按下去,验证器分析质量从 0.85 到 0.96。这种”验证器的验证器”的递归结构,跟 R1 里奖励必须干净是一脉相承的执念。
“让生成器意识到自己的奖励函数”这个提法很值得琢磨。传统 RL 是让模型盲试,DeepSeekMath-V2 把验证准则直接教给生成器,让它先自查再交卷,奖励公式里 0.76/0.24 的权重就是”证明本身更重要,但诚实自查也有价值”。这跟人类数学家的习惯一模一样,写完先自己检查一遍。
自动标注管线是工程上的亮点。元验证比原始验证更容易学、更省样本,这个观察直接支撑了”验证计算可以替代人工标注”的可行性,最后两轮训练零人工。如果这个循环真的可持续,验证器的天花板就不再是标注成本。
当然,边界要讲清楚。这是自然语言证明的验证,不是形式化验证,验证器本身也是模型,理论上还是有幻觉和误判的可能;Putnam 118/120 是”超过了人类最高分”,但那是单届比赛,跟”所有数学问题都能验”差得远;最难的一档 IMO 题(据表推断是 IMO 2025 的第 6 题)依然解不出来,论文自己承认最难级别还是挑战。另外高算力搜索的计算成本不低,64 验证 × 16 轮,不是谁都烧得起。但作为”自验证数学推理”的开路者,DeepSeekMath-V2 把”不可能自动验证”变成了”可以自动验证”,这一步的分量很重。
附:核心数据速查
方法组件
| 组件 | 作用 |
|---|---|
| 验证器 | 按准则分析证明,打 1/0.5/0 三档分 |
| 元验证器 | 审查验证器找的问题是否真实,治幻觉 |
| 生成器 | 证明 + 自我分析一体输出,交卷前自查 |
| 自动标注 | 验证采样 + 元验证多数表决,替代人工 |
奖励设计
- 验证器:R_format · R_score · R_meta
- 生成器:R_format · (0.76·R_Y + 0.24·R_Z),R_Z 惩罚自我评估不准
- 验证器分析质量:0.85 → 0.96(元验证器评估)
数据
- AoPS 17503 道证明题(奥赛、选拔赛、2010 后)
- 候选证明由 V3.2-Exp-Thinking 变体多轮细化生成,专家打分
高算力搜索成绩
| 竞赛 | 成绩 | 对比 |
|---|---|---|
| IMO 2025 | 5/6(83.3%) | 金牌水平 |
| CMO 2024 | 73.8%(4 全解 + 1 部分) | 金牌水平 |
| Putnam 2024 | 118/120(11/12 全解) | 人类最高分 90 |
| IMO-ProofBench 基础集 | 99.0% | DeepThink(IMO Gold) 89.0% |
| IMO-ProofBench 进阶集 | 61.9% | DeepThink 65.7% |
搜索配置:候选池 64 证明 × 64 验证起步,每轮 64×8 精化,最多 16 轮,通过全部 64 次验证即成功
关键概念清单
- self-verifiable reasoning = 自验证推理
- verifier = 验证器(按准则给证明打分)
- meta-verification = 元验证(验证验证器的分析)
- rubrics = 评分准则(专家式评估框架)
- generative reward model = 生成式奖励模型(验证器兼任)
- self-analysis = 自我分析(生成器自查)
- false positive = 假阳性(把错证明当对的)
- generation-verification gap = 生成-验证差距
- AoPS = Art of Problem Solving,在线数学竞赛社区
- CNML = 中国高中数学联赛
- IMO / CMO / Putnam / ISL = 国际数学奥林匹克 / 中国数学奥林匹克 / 普特南竞赛 / IMO 候选题
- IMO-ProofBench = DeepMind 出的自然语言证明评测基准
- GRPO = Group Relative Policy Optimization,组相对策略优化
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





