mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2825 字
8 分钟
DeepSeekMath-V2:让模型自证答案
2026-07-26

DeepSeekMath-V2 论文解读:正确答案不再可靠,教模型自己验证明白#

论文:DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning 作者:Zhihong Shao、Yuxiang Luo、Chengda Lu、Z.Z. Ren 等,DeepSeek-AI 2025 年 11 月。这篇回答一个尖锐的问题,靠”最终答案对不对”当奖励的 RL,把 AIME、HMMT 这种定量竞赛刷到饱和之后,接下来怎么办?正确答案不代表推理正确,定理证明又根本没有数值答案可判。DeepSeekMath-V2 的答案是自验证,先训一个能挑出证明毛病的验证器,再用它当奖励训生成器,逼生成器在交卷前自己把问题找出来、修掉。成果是 IMO 2025 解出 5/6、CMO 2024 金牌水平、普特南 2024 拿了 118/120,超过人类最高分 90。


一、背景:最终答案奖励的两条死路#

一年时间,靠”答案对了就给奖励”的 RL,前沿模型把 AIME、HMMT 刷到了饱和。但这个奖励机制有两个根本缺陷。

第一,它是推理正确性的不可靠代理,模型可以用错误逻辑碰巧答对,或者犯幸运的错误。第二,它对定理证明完全失效,证明题没有数值答案,严谨的逐步推导才是目标。结果就是,这种训练出来的模型,验证能力很差,错误证明的假阳性率很高,明明有显而易见的逻辑漏洞还声称证明有效。

二、方法:验证器和生成器的协同循环#

1. 训练验证器#

给验证器制定高层评分准则(rubrics),对每个证明做分析,先总结发现的问题,再打三档分,1 分证明完整严谨,0.5 分整体逻辑成立但有小错或细节缺失,0 分有致命逻辑错误。

冷启动数据从 AoPS(Art of Problem Solving,在线数学竞赛社区)爬了 17503 道证明题(奥赛、选拔赛、2010 年后的题),用 DeepSeek-V3.2-Exp-Thinking 的变体生成候选证明(这个模型没专门优化证明,输出简洁但容易错,所以让它多轮迭代细化),数学专家按准则打分。RL 训练用格式奖励加分数奖励。

2. 元验证:治幻觉问题#

训练中发现一个大漏洞,验证器面对错误证明时,只要分数猜对了就能拿满分,哪怕它幻觉出根本不存在的问题。这会让验证器失去可信度。

解法是元验证(meta-verification),再训一个元验证器,专门审查验证器的分析,判断它指出的问题是否真实存在、能否逻辑上支撑所给分数。把元验证器的反馈乘进奖励(R_V = R_format · R_score · R_meta),验证器分析的平均质量从 0.85 涨到 0.96,分数预测精度不掉。

3. 训练生成器:学会自己挑毛病#

用验证器当生成式奖励模型训证明生成器。关键设计是让生成器”证明 + 自我分析”一体输出,自我分析用跟验证器一样的格式和准则。奖励公式 R = R_format · (0.76·R_Y + 0.24·R_Z),其中 R_Z 惩罚自我评估不准。

这套奖励结构制造了三个激励:诚实承认错误比虚假声称正确更划算;最高奖励来自”证明写对 + 自我评估也准”;所以最优策略是在交卷前把能发现的问题尽量都解决掉。这等于把奖励函数显式告诉模型,让它靠思考而不是盲试去最大化奖励。

4. 协同循环:自动标注#

验证器改进生成器,生成器变强后产出的新证明会挑战验证器的能力边界,这些难验证的新证明又成为训练验证器的新数据。关键观察两条,扩大验证采样数能提高抓到真问题的概率;审查验证器找的问题(元验证)比从零找问题容易得多。

于是搞了全自动标注管线,每个证明生成 n 份独立验证分析,对报问题的分析生成 m 份元验证评估做多数表决,有效才采纳。最后两轮训练完全抛弃人工标注,自动标签跟专家判断对齐良好。

训练用 GRPO,交替优化验证和生成,从第二轮起,验证器用上一轮合并了验证与生成能力的 checkpoint 初始化。

三、成绩#

一次性生成。自家 CNML 级别(中国高中数学联赛难度)91 道题,代数、几何、数论、组合、不等式五个类别全面超过 GPT-5-Thinking-High 和 Gemini 2.5-Pro。

顺序细化。IMO Shortlist 2024 上,每轮用验证反馈重新提示生成器修改,最多 8 轮。Pass@1 随迭代轮数稳步上升,Best@32(按自评分挑最好的)显著高于线程平均,证明生成器真的能区分好证明和烂证明。

高算力搜索。每道题维护候选池,64 个证明样本配 64 份验证分析起步,每轮选最高分的 64 个证明各配 8 份分析(优先挑报问题的),生成精化证明更新候选池,最多 16 轮,直到某证明通过全部 64 次验证。结果:

  • IMO 2025:5/6(83.3%),金牌水平
  • CMO 2024:4 题全解 + 1 题部分得分(73.8%),金牌水平
  • Putnam 2024:11/12 完整解出,剩 1 题小错,118/120,超过人类最高分 90
  • IMO-ProofBench:基础集超过 DeepMind 的 DeepThink(IMO Gold),进阶集保持竞争力;基础 99.0%、进阶 61.9%(对比 DeepThink 89.0%/65.7%)

还有个很说明问题的细节,没完全解出的题,生成器通常能准确指出自己证明里的真问题;完全解出的题能通过全部 64 次验证。验证器是真能干活,不是摆设。

收尾:我的一点看法#

DeepSeekMath-V2 是 DeepSeek 推理路线的一次范式转向。从 DeepSeekMath 的 GRPO、R1 的规则奖励,一路都是”答案可验证”的哲学,这篇终于正面撞上”答案不可验证怎么办”的墙。答案是造一个能验证的模型,验证器加生成器的协同循环,让模型自己给自己当裁判。

元验证这个设计是全文最聪明的部分。直接训验证器,模型会学会”猜对分数 + 幻觉问题”的作弊路径,这是 RL 奖励设计的经典漏洞。加一层元验证器专门审查”问题是否真实存在”,把幻觉问题按下去,验证器分析质量从 0.85 到 0.96。这种”验证器的验证器”的递归结构,跟 R1 里奖励必须干净是一脉相承的执念。

“让生成器意识到自己的奖励函数”这个提法很值得琢磨。传统 RL 是让模型盲试,DeepSeekMath-V2 把验证准则直接教给生成器,让它先自查再交卷,奖励公式里 0.76/0.24 的权重就是”证明本身更重要,但诚实自查也有价值”。这跟人类数学家的习惯一模一样,写完先自己检查一遍。

自动标注管线是工程上的亮点。元验证比原始验证更容易学、更省样本,这个观察直接支撑了”验证计算可以替代人工标注”的可行性,最后两轮训练零人工。如果这个循环真的可持续,验证器的天花板就不再是标注成本。

当然,边界要讲清楚。这是自然语言证明的验证,不是形式化验证,验证器本身也是模型,理论上还是有幻觉和误判的可能;Putnam 118/120 是”超过了人类最高分”,但那是单届比赛,跟”所有数学问题都能验”差得远;最难的一档 IMO 题(据表推断是 IMO 2025 的第 6 题)依然解不出来,论文自己承认最难级别还是挑战。另外高算力搜索的计算成本不低,64 验证 × 16 轮,不是谁都烧得起。但作为”自验证数学推理”的开路者,DeepSeekMath-V2 把”不可能自动验证”变成了”可以自动验证”,这一步的分量很重。


附:核心数据速查#

方法组件

组件作用
验证器按准则分析证明,打 1/0.5/0 三档分
元验证器审查验证器找的问题是否真实,治幻觉
生成器证明 + 自我分析一体输出,交卷前自查
自动标注验证采样 + 元验证多数表决,替代人工

奖励设计

  • 验证器:R_format · R_score · R_meta
  • 生成器:R_format · (0.76·R_Y + 0.24·R_Z),R_Z 惩罚自我评估不准
  • 验证器分析质量:0.85 → 0.96(元验证器评估)

数据

  • AoPS 17503 道证明题(奥赛、选拔赛、2010 后)
  • 候选证明由 V3.2-Exp-Thinking 变体多轮细化生成,专家打分

高算力搜索成绩

竞赛成绩对比
IMO 20255/6(83.3%)金牌水平
CMO 202473.8%(4 全解 + 1 部分)金牌水平
Putnam 2024118/120(11/12 全解)人类最高分 90
IMO-ProofBench 基础集99.0%DeepThink(IMO Gold) 89.0%
IMO-ProofBench 进阶集61.9%DeepThink 65.7%

搜索配置:候选池 64 证明 × 64 验证起步,每轮 64×8 精化,最多 16 轮,通过全部 64 次验证即成功

关键概念清单

  • self-verifiable reasoning = 自验证推理
  • verifier = 验证器(按准则给证明打分)
  • meta-verification = 元验证(验证验证器的分析)
  • rubrics = 评分准则(专家式评估框架)
  • generative reward model = 生成式奖励模型(验证器兼任)
  • self-analysis = 自我分析(生成器自查)
  • false positive = 假阳性(把错证明当对的)
  • generation-verification gap = 生成-验证差距
  • AoPS = Art of Problem Solving,在线数学竞赛社区
  • CNML = 中国高中数学联赛
  • IMO / CMO / Putnam / ISL = 国际数学奥林匹克 / 中国数学奥林匹克 / 普特南竞赛 / IMO 候选题
  • IMO-ProofBench = DeepMind 出的自然语言证明评测基准
  • GRPO = Group Relative Policy Optimization,组相对策略优化
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

DeepSeekMath-V2:让模型自证答案
https://mizuki-eaf.pages.dev/posts/deepseek/deepseekmath-v2让模型自证答案/
作者
无名之子
发布于
2026-07-26
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录