《OpenAI o1》解读:它不急着回答,先在心里打一遍草稿——推理模型纪元从这一天开始
论文:Learning to Reason with LLMs(官方博客)+ OpenAI o1 System Card(系统卡) 作者:OpenAI(未列个人署名) 发布背景一句话:2024-09-12 发布,内部代号 Strawberry(草莓),核心主张是”用强化学习教会模型在回答前生成一长串内部思维链”;前置知识提示:GPT-4o 刚把多模态拉到全模态,但”反应快”和”会思考”是两码事,o1 让 2024 年的”智能”定义从聊天转向思考,也为 o2、o3,以及隔壁的 DeepSeek-R1 整条推理模型赛道埋下了伏笔。
一、引言:ChatGPT 会说人话,但不会想问题
到 2024 年 9 月,GPT 系列已经能聊天、能看图、能听声、能写代码,可大家心里都清楚一件事:你问它一道奥数题或者逻辑谜题,它更像一个”说话流利但一知半解的复读机”——答案是编出来的,推理是表演出来的。幻觉不是 bug,是预训练模型靠”续写下一个 token”过活的宿命。
o1 的出现第一次正面回应了这个批评。它不承诺更会聊,它承诺”会想”。发布当天 OpenAI 放了两样东西:一篇博客《Learning to Reason with LLMs》,一份 o1 System Card。前者讲训练思路,后者讲安全评估。两者都绕不开那个传说已久的内部代号——Strawberry(草莓),这个传言里”藏在 GPT 后面的神秘项目”终于揭了面纱。
核心主张其实一句话:让模型在回答之前先憋出一段内部思维链(chain of thought,CoT),再用强化学习(reinforcement learning,RL)把”思考过程”本身训练好。听起来简单,但它是整个 2024 年下半年最重的一步棋——它把”智能”的定义从”接话快不快”改写成了”想得深不深”。
顺带一提,o1 不叫 GPT-5。官方解释很任性:计数重置为 1。从此这条产品线叫 o1、o2、o3……,和 GPT 线彻底分家。这个命名动作本身就是在宣布:我们开了一条新生产线,也开了一个新纪元。
二、方法:训练时算力与测试时算力,两条腿一起走路
先说清楚,o1 没有传统意义上的技术论文。博客加系统卡给出的信息量,集中在范式层面,而不是架构层面——参数量、训练数据、网络细节依然一个字没有,这和 GPT-4 技术报告一脉相承的保密。
第一,训练范式变了。之前的 RLHF(基于人类反馈的强化学习)教的是”说什么话人类爱听”,o1 的 RL 教的是”怎么思考能解出题”。通过大规模强化学习,模型学会了在思维链里自我纠错、把难题拆成小步、一个思路走不通就换一条。OpenAI 用了个值得划线的词:数据利用率极高(highly data-efficient)——意思是这套 RL 不需要海量人类标注。
第二,也是我认为最有价值的一句:o1 的性能随两路算力同时提升——训练时计算(train-time compute)和测试时计算(test-time compute)。训练时算力就是你烧钱训多久;测试时算力就是模型回答前愿意多想多少个 token、想多久。过去两年行业只认前一条 scaling law,o1 把后一条也扶正了。这条的工程后果很实在:测试时算力可以按次计费,“让模型多想想”第一次成了能明码标价的商品——o1-preview 的输出价格是 GPT-4o 的 6 倍,贵的部分,就是它替你多想的那些 token。
评测口径上也藏着信息量:除非特别说明,o1 的所有分数都是在”最大测试时计算设置”(maximal test-time compute setting)下拿的——也就是让模型想最久。这既诚实(它如实标注了口径),也是一种提醒:你买到的 o1 默认不会想这么久,除非你愿意为额外的思考时间付费。后续所有推理模型的评测,都继承了这套”注明思考预算”的纪律。
交互方式也跟着变了。过去你为了让 GPT 答得准,得在提示词里写”let’s think step by step”(一步一步想)——也就是人工诱导思维链。o1 不再需要这句咒语,因为它已经把思维链内置进了训练。这听起来是省事,其实是个范式转移:推理的责任,从”用户提示”搬到了”模型训练”。
第三,思维链保密策略。o1 展示给你的不是原始思维链,而是一段摘要。OpenAI 给的理由有两个:原始 CoT 里可能包含不安全内容;更关键的是,完整思维链等于把辛辛苦苦用 RL 训出来的推理技巧拱手送给别人做蒸馏(distillation)——竞争对手拿它当训练数据,分分钟复刻一个。这个决定在学术圈吵到今天,也成了所有推理模型”不公开思考过程”的标准辩护词。
第四,同一天发两个模型:o1-preview 和 o1-mini。o1-mini 是更小、更快、更便宜的推理模型,数学和代码几乎追平 o1,但世界知识薄弱,MMLU 这类常识基准打不过 GPT-4o。定价 o1-preview 每百万输入 token $15、输出 $60;o1-mini 每百万输入 $3、输出 $12,比 preview 便宜 80%。这等于官方承认:推理能力可以分大杯和小杯卖,而杯型由你的钱包决定。
为什么非要专门做一个 o1-mini?因为它承认了一个现实:把推理能力做大,开销和延迟都不可接受。o1-mini 只保留推理的”窄路”——数学和代码——把世界知识这条”宽路”砍掉,换来更快、更便宜。这是第一次有公司把”推理”和”知识”拆开定价。产品设计的想象力,比论文本身更激进。
o1 的产品形态里还有一个全新零件:API 多了个 reasoning_effort(思考力度)参数,开发者可以设 low / medium / high,直接花钱买思考量。“测试时计算”第一次变成可编程的接口——以前调模型是调”说什么”,现在还能调”想多久”。这条接口后来被所有推理模型抄走,成了行业默认设置。
还有一个没写进报告的猜测值得记下来:o1 的发布没有披露底层基座,外界普遍认为它是在既有大模型之上叠加了大规模 RL——也就是”知识靠预训练攒,推理靠 RL 练”。这个猜测如果成立,就解释了为什么 o1-mini 世界知识弱:小模型底子撑不起大记忆容量,但”窄路推理”照样练得出来。
系统卡那边,o1 按 Preparedness Framework(准备度框架)的四件套评估:网络安全、生物威胁、说服力、模型自主性,四类风险都是”低”到”中”。OpenAI 承认一个尴尬事实:更强的推理能力意味着模型在 CBRN(化学/生物/辐射/核)和网络攻击这类任务上的”知识门槛”更高了,只是实测仍落在低风险区间。安全评估能给的,永远只是置信度,不是保证。
系统卡里还有个容易被忽略的细节:在去掉护栏的对抗性测试里,o1 展示出的”危险任务知识能力”高于此前任何模型,尤其在 CBRN 领域。OpenAI 的说法是,越强的推理能力越接近”危险知识”的搬运工——缓解措施把它压回了”低”风险,但这个发现本身,就是后来整个行业争论”推理能力到底该不该加速”的引子。
三、成绩:一堆把人类博士都比下去的数字
数学是 o1 最硬的拳头。在 2024 年美国数学邀请赛(AIME,专为全美顶尖高中生设计的考试)上,单次采样 o1 平均解出 74%(11.1/15),而 GPT-4o 只有 12%(1.8/15)。64 个样本做多数表决(consensus)能到 83%;再用学到的评分函数在 1000 个样本里重排,能到 93%——即 13.9/15,超过美国数学奥林匹克(USAMO)的入选线,约等于全美前 500 名的水平。
科学知识这一项尤其震撼。GPQA-diamond 是物理、化学、生物的博士级难题。OpenAI 请来有博士学位的专家做人类对照组,专家平均 69.7%,o1 拿到 78%,成为第一个在这项基准上超过人类博士的模型。官方自己补了一句降温的话:“这不代表 o1 在所有方面强过博士,只是说在博士该能解的题上,它解得更准。”
编程和通用推理同样能打。Codeforces(全球最火的竞技编程平台)排名 第 89 百分位;MMMU(多模态大学水平推理)78.2%,成为第一个能跟人类专家掰手腕的多模态模型;MMLU 的 57 个子类别里,o1 在 54 个上超过 GPT-4o;MATH 从 GPT-4o 的 60.3 一路飙到 94.8。上下文窗口也拉到 128K。
再看一眼 o1-preview 和正式 o1 的差距,能直观感受这套范式的成长速度:AIME 单样本,o1-preview 是 56.7%,正式 o1 是 74%——同一个范式,靠更好的 RL 训练,几个月内涨了 17 个百分点。这就是”训练时算力”这条曲线的威力:模型没换架构,成绩靠训练方法硬生生顶上去。
o1 在 AIME 上的选择还有一层工程含义:它打破了”基准饱和”的尴尬。2024 年时 GSM8K、MATH 这些经典基准已被刷到 90 分以上,区分度归零。o1 用 AIME、GPQA 这些”人类高手才配测”的题当尺子,等于把评测坐标系从”模型能过小测验”,抬到了”模型能进国家队”。
还有个技术细节值得强调:o1 的 MMMU 分数是开了视觉感知(vision perception)能力之后拿的——它不是单纯的语言模型,而是”语言 + 视觉 + 推理”的合体。这给后面所有推理模型定了个规矩:推理不止发生在文字里。
它的短板也在数字里。GPQA 的细分类目很有看头:物理 92.8%、化学 64.7%、生物 69.2%——物理猛如虎,化学生物只是刚过线。它强在”规则可推演”的领域,弱在”依赖经验与记忆”的领域。这个偏科结构,后来被证明是所有纯 RL 推理模型的共性,也是 o1 这条路线最真实的边界。
还要泼一盆冷水:思维链虽然内置了,o1 依然会出错,而且错得很”人类”——过度自信地把一个错误思路一路推到黑。OpenAI 自己也承认,o1 的思维链不是可核验的逻辑证明,只是”看起来像思考”的统计过程。它会想,不等于想得都对。
但别被这些数字冲昏头。o1 的强项集中在数学、代码、科学推理这类”有标准答案”的任务上;在需要世界知识和常识对话的场景里,匿名人类偏好测试显示 GPT-4o 反而更受欢迎。它是个偏科的学霸,不是全能冠军。
产品层面还有个容易被忽略的事实:o1 发布时 GPT-4o 还在正常售卖。OpenAI 的棋盘从这天起明确分成两路——“快模型”(GPT-4o)负责日常,走量;“聪明模型”(o1)负责难题,走质。一道难题 o1 可能要想几十秒,但答案值得等。
收尾:我的一点看法
我对 o1 的态度是”respect 但保留”。respect 的部分:它证明了一条新的 scaling law。过去大家只信”数据 + 参数”一条路,o1 用实验告诉你,让模型在测试时多想一会儿,分数也能稳定上涨。这等于给全行业开了一扇新门——DeepSeek-R1、Qwen 的推理版、Google 的 thinking 模式,全是踩着这条门框进来的。2024 年”推理模型”能成为一条独立赛道,根子就在这篇博客。
保留的第一点:思维链不公开。我理解防蒸馏的苦衷,但”推理过程”恰恰是 AI 对齐(alignment)领域最需要审查的东西。模型到底在”真推理”,还是在”表演推理”?没有原始 CoT,外面的人永远无从分辨。OpenAI 说展示摘要更安全,可”安全”和”可审查”需要权衡,而它把秤砣全压在了自己那边。
保留的第二点:贵和慢。o1-preview 输出价格是 GPT-4o 的 6 倍,一道题烧几十秒算力。推理模型确实更聪明,但”聪明”要按 token 计费时,普通用户和开发者会先算一笔经济账。o1-mini 必须存在,不是能力问题,是价格锚定问题——它证明了”聪明”是可以被切开来卖的。
最后说历史位置。o1 是 2024 年”智能定义”的转折点:上半年 GPT-4o 在比谁快、谁全模态,下半年 o1 在比谁想得深。它把 AI 竞争的坐标轴从”流畅度”换成了”思考深度”,还给了后来者一套标准动作——RL + CoT + 测试时计算 + 不公开推理过程。这套动作后来被 DeepSeek-R1 发扬光大,甚至反向哺育了开源社区。一个闭源的转折点,长出了半条开源的反叛线——这是 2024 年最有意思的技术因果之一。
附:核心数据速查
关键数字表格
| 指标 | 数值 | 对比/备注 |
|---|---|---|
| AIME 2024 单样本 | 74%(11.1/15) | GPT-4o 仅 12%(1.8/15) |
| o1-preview AIME 单样本 | 56.7% | 正式 o1 为 74% |
| AIME 64 样本共识 | 83%(12.5/15) | 多数表决 |
| AIME 1000 样本重排 | 93%(13.9/15) | 用学到的评分函数重排 |
| GPQA-diamond | 78% | 人类博士专家 69.7%,首次超过 |
| GPQA 细分(物理/化学/生物) | 92.8% / 64.7% / 69.2% | 物理强,化学生物偏弱 |
| Codeforces | 第 89 百分位 | 竞技编程 |
| MMMU | 78.2% | 首个匹敌人类专家的多模态模型 |
| MMLU 子类别 | 54/57 超 GPT-4o | — |
| MATH | 94.8 | GPT-4o 为 60.3 |
| o1-preview 定价 | $15 / $60(百万 token 入/出) | 输出为 GPT-4o 的 6 倍 |
| o1-mini 定价 | $3 / $12 | 比 preview 便宜 80% |
| o1-mini AIME / Codeforces | 接近正式 o1 | 数学代码强、世界知识弱 |
| 上下文窗口 | 128K | — |
| reasoning_effort 参数 | low / medium / high | 测试时计算可编程 |
关键概念清单
- chain of thought(思维链)= 模型在作答前生成的一长串内部推理步骤
- RL(reinforcement learning,强化学习)= 用奖励信号训练模型试错学习的范式
- RLHF = 基于人类反馈的强化学习,教模型对齐人类偏好
- train-time compute(训练时计算)= 训练阶段投入的算力
- test-time compute(测试时计算)= 推理阶段让模型”多想”所花费的算力
- consensus(多数表决)= 采样多个答案投票取多数
- pass@1 = 单次采样即答对
- maximal test-time compute setting(最大测试时计算设置)= o1 评估默认让模型思考最久的配置
- o1-preview = 正式 o1 之前的预览版,AIME 单样本 56.7%
- reasoning_effort(思考力度)= o1 API 中控制思考预算的参数
- “let’s think step by step” = 提示词时代的”人工思维链”诱导语,o1 时代不再需要
- vision perception(视觉感知)= o1 开启视觉输入后的推理能力,MMMU 78.2% 的前提
- CBRN(化学/生物/辐射/核威胁)= 系统卡评估的高危知识类别
- GPQA-diamond = 博士级物理/化学/生物难题基准
- Preparedness Framework(准备度框架)= OpenAI 评估前沿风险的框架
- distillation(蒸馏)= 用大模型输出训练小模型/复刻模型的行为
- AIME = 美国数学邀请赛,全美顶尖高中生数学竞赛
- USAMO = 美国数学奥林匹克竞赛,入选线约 13 分/15 题
- alignment(对齐)= 让模型行为符合人类意图与规范的技术方向
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





