《GPT-5 系列》解读:一个模型吃掉所有场景——对话、推理、智能体终于不分家了
论文:Introducing GPT-5(发布博客)+ GPT-5 System Card(系统卡)+ Introducing gpt-oss(开源模型博客)+ GPT-5.1(发布博客)+ Introducing GPT-5.2(发布博客) 作者:OpenAI 发布背景一句话:gpt-oss 于 2025-08-05 开源,GPT-5 于 2025-08-07 发布,随后 GPT-5.1(2025-11-12)与 GPT-5.2(2025-12-11)连续迭代;核心主张是”用一个带实时路由器的统一系统,终结聊天模型 vs 推理模型的选择题”;前置知识提示:o3/o4-mini 刚把”会想也会干活”的推理模型做成产品,GPT-5 则把推理直接焊进默认模型,回答一个悬而未决的问题——2025 年还有没有人愿意手动选模型。
一、引言:模型选择器是 2025 年最反人类的东西
2025 年上半年的 ChatGPT 用户都很熟悉这个动作:打开模型下拉菜单,在 GPT-4o、o1、o3、o4-mini、o3-mini 之间纠结半天。OpenAI 自己创造了一堆名字,然后把这堆名字的选择难题丢给了用户。GPT-5 的发布,本质上就是一刀切掉这个菜单——官方原话是:与其让用户在 10 个模型之间选,不如用一个统一系统把所有场景吃掉。
这个决策不是拍脑袋。2025 年 8 月 7 日发布的 GPT-5 带来了一个”统一系统”(unified system)的架构:Instant(即时) 模式负责日常对话,Thinking(思考) 模式负责难题推理,中间架一个实时的 router(路由器) 自动判断这道题该用哪种模式。用户不用再手动切模型,路由器替你切。这条路子跟 DeepSeek-V3.1 那种”混合推理”架构是同一个思路——行业共识已经形成:把”快”和”想”缝进一个模型,才是大模型的终局形态。
还有个绕不开的同行衬托:发布前两天(8 月 5 日),OpenAI 刚放出了六年来首个开源权重模型 gpt-oss。GPT-5 与 gpt-oss 一前一后,一个拥抱闭源的最大性能,一个回归开源的传统,这安排怎么看都不像巧合——更像是在”性能路线”和”生态路线”之间同时下注。
二、方法:统一系统、路由器、还有一张回归开源的老面孔
先拆 GPT-5 的架构。OpenAI 没公布参数量、训练数据、网络细节——延续了 GPT-4 以来的保密传统。能确认的信息集中在系统设计层面。第一,双模式 + 路由器:Instant 快、Thinking 深,路由器根据问题难度自动分配。第二,上下文拉到 400K,最大输出 128K,写长文档、长代码、长对话不再捉襟见肘。第三,API 按三个尺寸卖:gpt-5 定价每百万输入 token $1.25、输出 $10;mini 版 $0.25 / $2;nano 版 $0.05 / $0.4。这个价格把 o3($2/$8)甩在身后——更强的模型,更便宜的价格,这是规模化和推理效率共同作用的结果。
发布时的产品面也是”统一”的。GPT-5 免费开放给所有用户,Plus 更高限额,Pro 含 GPT-5 Pro;同时它取代 GPT-4o、o3、o4-mini、GPT-4.1、GPT-4.5 成为默认模型。媒体当时普遍报道 ChatGPT 周活用户已逼近 7 亿(官方未给出精确口径),在这个体量上默认模型直接换代,等于把”推理默认开启”推送给了几乎整个地球的 ChatGPT 用户。
再看 gpt-oss。8 月 5 日发布的两个开源模型,规格相当清晰:gpt-oss-120b 总参数 117B、每个 token 激活 5.1B,gpt-oss-20b 总参数 21B、激活 3.6B,都是 MoE(混合专家)架构;120b 有 128 个专家、每 token 激活 4 个;上下文 128K;权重在 Hugging Face 免费下载,原生量化成 MXFP4,120b 单卡 80GB 显存就能跑,20b 只需 16GB 内存——笔记本级别的部署。许可证用的是 Apache 2.0,宽松到可以商用、改改再卖,这在此前以闭源为荣的 OpenAI 身上,几乎是六年来最大的态度转弯。
几个”官方没说清、我按公开信息推断”的点值得标注:gpt-oss 的推理日志(CoT)其实是完整公开的——这跟闭源的 o 系列恰好相反,官方博客明确说给了完整思维链(full CoT),理由是想让研究者能监控思维链中的异常行为;但训练数据不公开,预训练细节也保密。所以”推理公开、数据保密”才是它准确的开源姿态,别被”开源=全透明”的刻板印象骗了。它用自研的 o200k_harmony 分词器(同样开源),训练时借鉴了 o3 的强化学习技术,后训练流程与 o4-mini 类似。代价是它纯文本、无多模态,也没有内置的图像生成。
GPT-5.1 和 GPT-5.2 是后续两次打磨。11 月 12 日的 GPT-5.1 给 Instant 加了 adaptive reasoning(自适应推理)——模型自己决定要不要多想,简单题 2 秒答完,难题死磕到底;Thinking 则更聪明地按题目难度调配思考时间,最快任务的响应速度约为旧版的 2 倍,最难的任务则慢约一倍。语气也改得更温暖、指令遵循更强,11 月 19 日又把 GPT-5.1 Pro 推给了 Pro 用户。12 月 11 日的 GPT-5.2 则是一次全面升级:知识截止推到 2025-08-31,Instant / Thinking / Pro 三档全部更新,API 定价涨到每百万输入 $1.75、输出 $14(Pro 为 $21 / $168),新增第五档推理强度 xhigh,并允许对输出做蒸馏。这轮快速迭代背后有个众所周知的压力源:谷歌 Gemini 3 在榜单上冲击太猛,OpenAI 内部一度进入”红色代码”(code red)状态。
三、成绩:从”博士能解”到”人解不出的也敢碰”
GPT-5 发布时的基准数字,最大的看点是它把”推理模型”和”聊天模型”两套评价体系合并成了一张表。在 Humanity’s Last Exam(HLE,人类最后的考试,2025 年最难的跨学科题库)上,GPT-5(high)无工具得分 24.8%,o3 同期为 20.2%(网上流传的”约 37%“我未能核实到官方出处,可能是带工具或不同配置的分数,标注信息有限)。AIME 2025 无工具 94.6%,GPQA Diamond 85.7%,FrontierMath(仅 Python 工具)26.3%。幻觉方面,官方口径是 GPT-5 的事实错误率比 GPT-4o 低 45%,思考模式下比 o3 低 80%,长文本编造(confabulation)次数约为 o3 的 六分之一;连”谄媚”这个老大难也被压了下去,谄媚式回复比例从 14.5% 降到 6% 以下。这套”少犯错 + 不拍马屁”的组合,是 GPT-5 相比所有前代最不一样的地方。
gpt-oss 的成绩单走的是”性价比”路线:gpt-oss-120b 在核心推理基准上与 o4-mini 几乎打平——SWE-bench Verified 62.4%、MMLU-Pro 90.0%、AIME 2025(带工具)97.9%,在竞赛数学和医疗问答(HealthBench)上甚至反超 o4-mini;gpt-oss-20b 则对标 o3-mini。对一个能跑在单张 80GB 显卡上的开源模型来说,这个水平是 2025 年开源阵营的天花板级表现。但也要清醒:它没有多模态,也注定追不上同期的闭源旗舰,OpenAI 这个动作与其说是”分享”,不如说是在开源生态里抢回话语权。
GPT-5.1 和 5.2 的成绩主要在效率与精度上。GPT-5.1 靠自适应推理在典型任务上显著省 token,开发者反馈”跑得快一半、质量持平”;GPT-5.2 Thinking 则在 AIME 2025 上冲到 99%、SWE-bench Verified 80%、GPQA Diamond 92.4%、FrontierMath(Tier 1-3,Python 工具)40.3%,ARC-AGI-1 上 Pro 版以 90.5%(pass@2)成为首个破 90% 的模型,ARC-AGI-2 上 Thinking 版 52.9%。深色推理(xhigh)让它在多项基准上追平或反超 Gemini 3 Pro Preview——“红色代码”看起来没白拉。
收尾:我的一点看法
GPT-5 最打动我的不是任何单项分数,而是那个”路由器”。从产品史的角度看,这是 OpenAI 第一次承认:让用户选模型是一种懒惰的设计,真正好的产品应该让用户忘掉模型的存在。统一系统把 2023 年以来”快模型 vs 推理模型”的分裂缝合了起来,也顺带把 o 系列苦心经营的”推理是高端功能”这个定位整个推翻了——推理变成了默认值,就像摄像头变成手机的标配一样,没人再为它单独付费。这条产品哲学是激进的,激进到它同时宣判了”手动选模型”这个交互方式的死刑。
但我对 gpt-oss 的观感是复杂的。六年来第一次开源,规格、许可证、部署门槛都诚意十足,Apache 2.0 让它可以被自由商用——这确实是 DeepSeek 和 Qwen 逼出来的让步。可它偏偏在 GPT-5 发布前 48 小时放出,让”开源”和”旗舰”永远隔着一层安排好的时差。我更愿意把 gpt-oss 理解为 OpenAI 的一次”生态防御战”:打不过开源社区的号召力,就加入它,把话语权夺回来一点。它证明了 OpenAI 也能做开源,但也暴露了它的开源是战略性的、计算过的,而不是信仰性的。
批评也得说。GPT-5 的价格战打得漂亮,但”统一模型”这个词也藏着逃避——当路由器替你决定要不要思考的时候,用户实际上失去了对推理预算的控制权,等于把”想多深”这个决策从用户手里收走了。而 HLE 24.8% 这个数字本身也说明:即使是最强的统一模型,人类留下的”最后考试”它也只答对四分之一,这条路离尽头还远得很。至于 7 亿周活、红色代码这些宏大叙事,我更想提醒自己记住一个朴素事实:这家公司过去一年的每一次发布,标题里都写着”最强”,而真正的进步,往往藏在那些没人注意的效率数字里。GPT-5 系列的意义,也许不是”最强”,而是第一次把”强”做成了所有人都默认享有的东西——这本身就是 AGI 路上最务实的一步。
附:核心数据速查
关键数字表格
| 指标 | 数值 | 对比/备注 |
|---|---|---|
| GPT-5 HLE(无工具,high) | 24.8% | o3 为 20.2%;网传 37% 未核实 |
| GPT-5 AIME 2025(无工具) | 94.6% | o3 为 88.9% |
| GPT-5 GPQA Diamond | 85.7% | o3 为 83.3% |
| GPT-5 FrontierMath(仅 Python) | 26.3% | o3 为 15.8% |
| GPT-5 事实错误率 vs GPT-4o / o3 | 低 45% / 低 80% | 长文本编造约为 o3 的 1/6 |
| GPT-5 谄媚回复比例 | 14.5% → <6% | 定向评测 |
| GPT-5 定价(gpt-5 / mini / nano) | $1.25/$10 / $0.25/$2 / $0.05/$0.4(百万 token) | 比 o3 更便宜 |
| GPT-5 上下文 / 最大输出 | 400K / 128K | — |
| GPT-5 默认替换 | GPT-4o、o3、o4-mini、GPT-4.1、GPT-4.5 | 面向全部用户 |
| 发布时周活用户 | 约 7 亿(媒体口径) | 官方未给出精确数字 |
| gpt-oss-120b 参数 | 总 117B / 激活 5.1B | MoE,128 专家,80GB 单卡可跑 |
| gpt-oss-20b 参数 | 总 21B / 激活 3.6B | 16GB 内存可跑,笔记本级 |
| gpt-oss-120b SWE-bench / MMLU-Pro / AIME 2025 | 62.4% / 90.0% / 97.9%(带工具) | 对标 o4-mini,HealthBench 反超 |
| gpt-oss 许可证 | Apache 2.0 | 可商用、可修改,训练数据不公开 |
| GPT-5.1 定价 | $1.25 / $10 | 新增 adaptive reasoning 与 no-reasoning 模式 |
| GPT-5.2 定价 | $1.75 / $14(Pro $21/$168) | 知识截止 2025-08-31,新增 xhigh 档 |
| GPT-5.2 AIME 2025 / SWE-bench / GPQA | 99% / 80% / 92.4% | Thinking 版 |
| GPT-5.2 ARC-AGI-1 / ARC-AGI-2 | 90.5%(Pro,pass@2)/ 52.9%(Thinking) | ARC-AGI-1 首个破 90% 的模型 |
关键概念清单
- unified system(统一系统)= 一个模型内含 Instant 与 Thinking 双模式的架构
- router(路由器)= 自动判断问题难度、分配思考模式的实时组件
- Instant(即时模式)= 快速对话响应的模式
- Thinking(思考模式)= 深度推理模式
- adaptive reasoning(自适应推理)= 模型自行决定思考时长的能力(GPT-5.1 起)
- reasoning effort(推理强度)= API 中控制思考预算的参数,GPT-5.2 新增 xhigh 第五档
- HLE(Humanity’s Last Exam,人类最后的考试)= 2025 年最难跨学科基准
- confabulation(编造/幻觉)= 模型生成看似合理实则错误的内容
- MoE(mixture-of-experts,混合专家)= 每 token 只激活部分参数的稀疏架构
- Apache 2.0 = 宽松开源许可证,允许商用与修改
- MXFP4 = 4-bit 浮点量化格式,用于低显存部署
- o200k_harmony = gpt-oss 开源的 20 万词表分词器
- full CoT(完整思维链)= gpt-oss 公开推理过程,与闭源 o 系列相反
- code red(红色代码)= OpenAI 因 Gemini 3 冲击而进入的紧急应对状态
- xhigh = GPT-5.2 新增的最高推理强度档位
- 知识截止(knowledge cutoff)= 模型预训练数据的时间边界,GPT-5.2 为 2025-08-31
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





