mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
3461 字
10 分钟
o3 与 o4-mini:会想也会干活
2026-07-07

《o3 与 o4-mini 系列》解读:推理模型第一次长出”手”和”眼睛”——从”会想”进化到”会干活”#

论文:Advancing the frontier of AI reasoning(o3 预告博客)+ Introducing OpenAI o3 and o4-mini(正式发布博客)+ Introducing OpenAI o3-mini(发布博客)+ ARC-AGI 半私密评测报告(ARC Prize 基金会) 作者:OpenAI 发布背景一句话:o3 于 2024-12-20(“12 天活动”收官日)预告,o3-mini 于 2025-01-31 落地,o3 与 o4-mini 于 2025-04-16 正式发布;核心主张是”推理模型终于能在思考链里调用全部工具、并看懂图片了”;前置知识提示:o1 在 2024 年 9 月定义了”测试时计算 + 思维链”范式,而 o3 家族把这套范式做成了一条按计算量分档的商用产品线,也为几个月后 GPT-5 把”推理”并进统一模型埋下了伏笔。


一、引言:o1 证明了”会想”,o3 家族负责把”想”规模化#

o1 发布三个月后,全世界刚学会”推理模型要先憋一段思维链”这个新概念,OpenAI 就把它按死了——2024 年 12 月 20 日,12 天活动的最后一天,奥特曼在直播里抛出了 o3 和 o3-mini。这一天的分量不在于数字有多吓人,而在于它宣告了一件事:推理范式不是孤品展,是一条可以快速迭代、按档售卖的产品线。o1 到 o3 只隔了 3 个月,这个速度本身就在回答”Scaling Law 有没有死”——至少推理这条曲线还在陡坡上。

命名先讲清楚。跳过 o2 不是因为技术,是因为英国电信运营商 O2 的商标。奥特曼直播里自嘲:OpenAI 起名字的水平一如既往地烂。这跟 o1 那次”计数重置为 1”的任性一脉相承——o 系列的命名从来不讲道理,但每次命名都在划新纪元。

但预告归预告,o3 全家真正的价值是”落地”那一下。2025 年 1 月 31 日 o3-mini 正式上线,4 月 16 日 o3 与 o4-mini 联袂发布。从 12 月的PPT到 4 月的生产线,中间横着两个大背景:一是 DeepSeek-R1 在 1 月用开源把推理模型的价格打成白菜价,逼得 OpenAI 必须在”便宜”上正面接招;二是整个行业开始明白,光会”想”不够,模型得会”用工具”,否则再聪明的脑子也只能隔着聊天框干瞪眼。

二、方法:同一套范式,三种卖法,外加一双新眼睛#

先说 o3 的训练方法论。官方没有放技术论文,博客加系统卡给的信息集中在范式层面:o3 继续沿用 o1 的”思维链 + 强化学习”配方,但把规模往上推了一大截。值得划线的是两个新增概念。一个是 adaptive thinking(自适应思考)——模型根据任务难度动态决定思考多久,简单题少想、难题多想,这是后来 GPT-5.1 那套自适应推理的直系祖先。另一个是 deliberative alignment(审慎对齐):让模型在推理时主动把安全策略逐条读进思维链,而不是训练死板的是/否规则——安全这事,从”背答案”变成了”审题”。

o3 的商用形态有个关键的工程决策:按计算量分档(efficiency modes,低 / 中 / 高)。同一颗脑子,你可以买”快而省”的档位,也可以买”慢而准”的档位。这是把”测试时计算”第一次明码标价成商品目录——你在 o1 时代为多想几个 token 付费,在 o3 时代直接买档位。

然后说 o3-mini。它的定位很明确:把 o1-mini 的”窄路推理”路线继续做下去——数学、代码、科学强,世界知识弱,无视觉。三个思考力度(low / medium / high)对应不同的价格和延迟。发布时定价每百万输入 token $1.1、输出 $4.4,比 o1-mini 便宜 63%,比完全体 o1 便宜 93%。这个价格是 1 月 31 日发的,就踩在 DeepSeek-R1 引发的行业恐慌正中心,OpenAI 嘴上不说,但定价的每一分钱都在回应开源对手。

重头戏在 4 月 16 日的 o3 与 o4-mini。这是 o 系列第一次真正”装备了手和眼”。官方说法是:o3 和 o4-mini 是首批能够在思考链(chain of thought)中调用全部工具的模型——网页浏览、Python 执行、图像分析、图像生成,一次思考里可以反复穿插调用。模型在训练中学会了判断”什么时候该搜网页、什么时候该跑代码、该以什么格式输出”。更要命的细节是 o4-mini 的 thinking with images(用图像思考):它能直接把图片卷进思维链里,旋转、裁剪、放大、反复观察,而不是像以前那样只把图片当描述输入。这个能力让视觉推理从”看图说话”升级成”看着图算题”。

o4-mini 的另一个身份是价格武器。它定价每百万输入 $1.1、输出 $4.4,跟 o3-mini 一个价,但能力全面压过 o3-mini,数学和代码甚至能追平 o3——而 o3 定价每百万输入 $2、输出 $8,o4-mini 约为其十分之一。OpenAI 明着给开发者划了个选择题:追求极致精度上 o3,追求性价比上 o4-mini。4 月 24 日起,o4-mini 正式取代 o1 和 o3-mini 成为默认模型,免费用户通过”思考”(Think)按钮也能用——推理能力从”付费特权”降级成”标配”,这条价格曲线本身就是 2025 年上半年竞争烈度的温度计。

三、成绩:ARC-AGI 破人类线,FrontierMath 从”全军覆没”到”解出四分之一”#

12 月预告的这批数字,至今还是推理模型评测史上最华丽的一页。

数学上,AIME 2024 拿了 96.7%——15 道题只错 1 道;GPQA Diamond(博士级物理化学生物)87.7%,比 o1 的 78% 又高一截。编程上,Codeforces Elo 冲到 2727,相当于人类排行榜第 175 名,而 o1 只有 1891;SWE-bench Verified 71.7%,比 o1 的 48.9% 高出 20 多个百分点

最震撼的是两项新尺子。ARC-AGI(抽象推理语料库)上,低计算模式 75.7%,高计算模式 87.5%——第一次有 AI 跨过人类阈值 85% 这条线。但注意代价:ARC Prize 官方报告说,o3 在低档模式每个任务烧 约 $20,高档模式烧到 数千美元,而且是在超出官方算力限制 172 倍的高算力下才拿下 87.5%。换句话说,它破线靠的是”用蛮力换思考”,ARC 奖主办方因此没把 60 万美元奖金发给它——技术突破和工程实用之间,隔着一条钱的鸿沟。FrontierMath 上 o3 解出 25.2%,此前的所有模型全部卡在 2% 以下——陶哲轩说过这套题”可能难住 AI 好几年”,o3 只用了几个月的思考。

4 月正式发布的数字做了些修正。媒体对比发现,o3 的个别基准分比 12 月预告略低,比如 SWE-bench 从 71.7 降到 69 上下,原因官方没细说,我推断多半是评测口径从”最优配置”改成了”标准配置”。o4-mini 这边则是另一套亮眼成绩:AIME 2024 93.4%、AIME 2025 92.7%(启用 Python 工具后最高冲到 99.5%)、Codeforces Elo 2719、SWE-bench Verified 68.1%、MMMU 81.6%、MathVista 84.3%。SWE-bench 上 o4-mini 只落后 o3 一个点,价格却差近十倍——这个”一分钱一分货”的性价比曲线,比任何营销话术都直白。

收尾:我的一点看法#

我对 o3 家族最深的印象不是分数,是”工具”这两个字。o1 时代的推理模型再聪明,也是个隔着聊天框做题的书呆子;o3 和 o4-mini 把网页、代码、图像全接进思维链之后,模型第一次可以对着一个多步任务自己设计方案、自己查资料、自己验证、自己交付——这就是 OpenAI 官方说的”agentic(智能体化)“方向。从 12 月预告到 4 月落地,这家公司真正在卖的不是”更聪明的脑子”,而是”会干活的人”。

批评也是现成的。ARC-AGI 那 87.5% 是拿”几千美元一个任务”堆出来的,这暴露了”测试时计算”这条路的暗面:分数可以靠钱买到,成本也可以无限上涨。如果你按 ARC-AGI 的算力限制来算,o3 甚至没赢。这个真相给所有”破纪录”的新闻标题都浇了盆冷水——推理模型的评测,永远要先问一句”用了多少算力”。还有那个我没想通的点:12 月宣布、4 月才落地,中间 3 个月里 o3 的分数居然还会下调,说明官方对”评测口径”的掌控力也不像看起来那么稳。当一家公司能决定数字怎么报的时候,“SOTA”这个字就越来越像营销词。

但我仍然认为 o3 家族是 2025 年上半年最重要的发布,原因不是任何单项分数,而是它完成了三件承上启下的事:把 o1 的推理范式做成了可分档售卖的商品;把”工具使用”塞进了思维链内部,提前为智能体(agent)时代铺路;以及把价格打了下来,让免费用户也能用上推理模型。这三件事合起来,等于把 2026 年 GPT-5 那套”统一模型 + 路由器”的思路预先演练了一遍——o 系列终于证明,推理不是高端用户的特权,是所有人都应该默认拥有的能力。从 o1 的”会想”,到 o3 家族的”会想也会干活”,这条路走了不到一年。


附:核心数据速查#

关键数字表格

指标数值对比/备注
o3 ARC-AGI(低/高计算)75.7% / 87.5%人类阈值 85%;高计算超算力限制 172 倍
o3 ARC-AGI 单任务成本约 $20(低档)/ 数千美元(高档)ARC 奖未授予 o3
o3 AIME 202496.7%15 题错 1 题;o1 为 83.3%
o3 GPQA Diamond87.7%o1 为 78%
o3 Codeforces Elo2727人类第 175 名水平;o1 为 1891
o3 SWE-bench Verified71.7%(12 月预告)4 月发布时约 69(媒体口径)
o3 FrontierMath25.2%此前所有模型 <2%
o3-mini 定价$1.1 / $4.4(百万 token 入/出)比 o1-mini 便宜 63%,比 o1 便宜 93%
o3 定价$2 / $84 月正式发布
o4-mini 定价$1.1 / $4.4与 o3-mini 同价,约为 o3 的十分之一
o4-mini AIME 2024 / 202593.4% / 92.7%开 Python 工具最高 99.5%
o4-mini Codeforces Elo2719略低于 o3
o4-mini SWE-bench Verified68.1%o3 为 69.1%,o3-mini 仅 49.3%
o4-mini MMMU / MathVista81.6% / 84.3%视觉推理
关键日期2024-12-20 预告;2025-01-31 o3-mini;2025-04-16 o3/o4-mini4 月 24 日 o4-mini 取代 o1 与 o3-mini

关键概念清单

  • adaptive thinking(自适应思考)= 模型按任务难度动态调整思考时长
  • deliberative alignment(审慎对齐)= 让模型在推理中逐步审读安全策略的对齐方法
  • efficiency modes(效率档位)= o3 的低/中/高三档计算配置
  • thinking effort(思考力度)= o3-mini 的 low/medium/high 推理强度选项
  • chain of thought(思维链)= 模型作答前生成的内部推理步骤
  • tool use in CoT(思考链内工具调用)= o 系列首次在推理过程中使用网页/Python/图像等工具
  • thinking with images(用图像思考)= o4-mini 把图片直接纳入思维链进行旋转裁剪等操作
  • ARC-AGI = 抽象推理语料库,测试模型对新任务的泛化适应能力
  • FrontierMath = Epoch AI 推出的前沿数学基准,此前无模型超过 2%
  • SWE-bench Verified = 真实软件工程问题基准
  • Codeforces Elo = 竞技编程平台积分,2727 约等于人类第 175 名
  • AIME = 美国数学邀请赛
  • GPQA Diamond = 博士级物理/化学/生物难题基准
  • agentic(智能体化)= 模型自动执行多步任务的方向
  • “12 天活动” = OpenAI 2024 年 12 月的连续发布活动,o3 为其收官之作
  • distillation(蒸馏)= 用大模型输出训练小模型的行为,o 系列不公开思维链的原因之一
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

o3 与 o4-mini:会想也会干活
https://mizuki-eaf.pages.dev/posts/chatgpt/o3-与-o4-mini会想也会干活/
作者
无名之子
发布于
2026-07-07
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录