ChatGPT 发展史:从 GPT-1 到 GPT-5.6 的八年跃迁
口径说明:本文以 OpenAI 官方博客、技术报告及主流媒体为信息来源,覆盖 2015 年 12 月公司成立至 2026 年 7 月。2023 年及以前的事件已经历史充分验证;2024–2026 年的信息主要来自网络检索,个别数据存在多口径,已在附录 C 注明。标注”未证实”的信息(如 GPT-4 参数量)仅作传闻引用,不作为事实结论。
〇、总览:这篇文章讲什么
文章系统梳理了 OpenAI 从 2015 年 12 月成立到 2026 年 7 月发布 GPT-5.6 之间的十年历史。与 DeepSeek 以论文为骨干不同,ChatGPT 这条线以模型发布与产品迭代为骨架——OpenAI 走的是”研究 → 产品 → 生态”一体化的路线,每一个技术节点几乎都对应一个可用的产品。全文沿三条技术主线展开:
- 规模与扩展定律(Scaling Law)——为什么”大力出奇迹”能一路成立;
- 对齐与推理——从 RLHF 对齐到推理模型再到智能体;
- 多模态统一——从纯文本到语音、图像、视频的原生融合。
文章最后总结出 OpenAI 的四条方法论:规模先行、产品闭环、迭代部署、生态卡位。
一、发展时间线总表
| 时间 | 模型/事件 | 核心贡献 | 关键数据 |
|---|---|---|---|
| 2015.12 | OpenAI 成立 | 非营利研究机构,对标 DeepMind | 承诺募资超 10 亿美元 |
| 2018.06 | GPT-1 | 生成式预训练开山之作 | 1.17 亿参数 |
| 2019.02 | GPT-2 | 规模与风险的分水岭,分阶段发布 | 15 亿参数 |
| 2019.03/07 | OpenAI LP 转型 + 微软投资 | ”上限利润”结构,算力换股权 | 微软投 10 亿美元 |
| 2020.05 | GPT-3 | ”规模即能力”的确认 | 1750 亿参数,3000 亿 token |
| 2021.01/07 | DALL-E、Codex | 多模态储备、代码智能 | Copilot 诞生 |
| 2022.03 | InstructGPT | RLHF 对齐路径确立 | 1.3B 优于 175B |
| 2022.09 | Whisper | 开源语音识别 | 接近人类水平 |
| 2022.11 | ChatGPT(引爆点) | 消费级 AI 拐点 | 5 天百万用户,2 个月 1 亿月活 |
| 2023.02 | ChatGPT Plus / Bing Chat | 商业化启动、微软产品整合 | 20 美元/月 |
| 2023.03 | GPT-4(分水岭①) | 多模态,能力跃升 | MMLU 86.4%,律师考试前 10% |
| 2023.11 | DevDay:GPT-4 Turbo、GPTs | 生态化,开发者平台 | 128K 上下文,周活 1 亿 |
| 2023.11 | 董事会危机 | 权力结构震荡 | 95% 员工联名信 |
| 2024.02/12 | Sora 公告与公测 | 文生视频 | 最长 20 秒,1080p |
| 2024.05 | GPT-4o(分水岭②) | 原生多模态 + 实时语音 | 免费开放,音频 232ms |
| 2024.09 | o1 | 推理模型范式开端 | AIME 74%(GPT-4o 仅 12%) |
| 2024.10 | 66 亿美元融资 | 史上最大 VC 轮 | 估值 1570 亿美元 |
| 2024.12 | o3 公告 | ”测试时扩展”(Test-time Scaling) | ARC-AGI 87.5%,AIME 96.7% |
| 2025.01 | DeepSeek-R1 冲击 | 开源冲击波 | 英伟达单日 -17% |
| 2025.01 | Stargate | 算力军备 | 四年 5000 亿美元 |
| 2025.08 | GPT-5(分水岭③) | 统一系统,免费开放 | 周活 7 亿 |
| 2025.09/10 | Sora 2、估值 5000 亿美元 | 视频生成产品化 | 全球最贵私有公司 |
| 2025.12 | GPT-5.2 + ChatGPT Agent | 通用智能体落地 | Pro 每月 400 次提示 |
| 2026.03 | GPT-5.4 | 1M 上下文 + 计算机操作 | 知识截止 2025.08 |
| 2026.06/07 | S-1 递交 + GPT-5.6 | IPO 启动、旗舰三档 | Sol/Terra/Luna |
三个分水岭:GPT-4(能力质变)、GPT-4o(多模态与免费策略)、GPT-5(统一模型与智能体)。
二、阶段一:奠基——非营利理想与生成式预训练(2015–2019)
1. OpenAI 成立:以 AGI 为使命的非营利机构
2015 年 12 月 11 日在旧金山成立,创始人包括 Sam Altman、Greg Brockman、Ilya Sutskever、Elon Musk、Wojciech Zaremba 等,定位为非营利研究机构,承诺募资超 10 亿美元(早期出资者含 Peter Thiel、Reid Hoffman、AWS、Infosys 等)。使命宣言是”以惠及全人类的方式发展 AGI(通用人工智能)“,当时以”开源安全派”姿态对标谷歌 DeepMind。
补充细节:Elon Musk 2018 年退出董事会(官方口径为特斯拉业务利益冲突,另一说法是他提议接管 OpenAI 被拒)。Musk 退出后不到两年,OpenAI 便放弃了非营利路线——这个转折后来成为 Musk 多次攻击 OpenAI 的由头。
2. GPT-1:生成式预训练的开山之作
2018 年 6 月 11 日论文《Improving Language Understanding by Generative Pre-Training》(作者 Radford、Narasimhan、Salimans、Sutskever)。1.17 亿参数,12 层 decoder-only Transformer,在 BooksCorpus(约 7000 本书、8 亿词)上做”预测下一个词”预训练,再针对下游任务微调。GLUE 得分 72.8(当时 SOTA)。
核心贡献不是参数量,而是确立了 “无监督预训练 + 有监督微调” 的两段式范式——这个范式后来演变成”预训练 + RLHF 对齐”,贯穿 OpenAI 全部后续模型。
3. GPT-2:规模带来的风险与分阶段发布
2019 年 2 月发布,15 亿参数。论文标题《Language Models are Unsupervised Multitask Learners》(语言模型是无监督多任务学习者),首次展示**零样本迁移(Zero-shot Transfer)**能力。
真正载入史册的是分阶段发布争议:OpenAI 以”文本生成能力过于危险、可能被用于大规模欺诈”为由,先发布小模型、推迟发布完整版,引发学术界关于”研究透明度 vs 安全”的大讨论。批评者认为这是营销炒作,支持者认为开创了**迭代式部署(Iterative Deployment)**的先河——后者后来成为 OpenAI 的招牌方法论。
4. OpenAI LP:转型与微软的 10 亿美元
2019 年 3 月 11 日设立”有上限利润”实体 OpenAI LP(capped-profit),7 月 22 日微软投资 10 亿美元,成为独家云计算伙伴(Azure 超级计算)。结构设计:早期投资者回报上限为投资额的 100 倍,超额利润归非营利母体所有。
这一步的意义在于确立了 “算力换股权” 的融资模板——OpenAI 自己没有数据中心,训练大模型必须绑定云厂商;而微软要的是一张通往 AGI 时代的船票。这个结构也埋下了后来 OpenAI 与微软之间既合作又提防的长期张力。
三、阶段二:规模即能力——GPT-3 与工程化(2020–2022.11)
1. GPT-3:1750 亿参数的 Few-shot 学习者
2020 年 5 月 28 日论文(arXiv<2005>2005>.14165,NeurIPS 2020 杰出论文),《Language Models are Few-Shot Learners》。1750 亿参数——当时最大非稀疏模型的 10 倍;96 层,上下文 2048 tokens,训练约 3000 亿 token,训练算力 3640 petaflop/s-days。
核心机制是 in-context learning(上下文学习):不更新任何梯度,仅通过在 prompt 里给几个示例,模型就能完成新任务。这颠覆了”每个任务都要微调一个模型”的范式——规模本身就是能力。
补充细节:GPT-3 也首次暴露了”规模”的另一面:在算数、常识推理上表现不稳定,且模型越大毒性越高。OpenAI 于 2020 年 11 月开放 API 测试,2021 年成为第一个商业化的 GPT 产品。
2. Codex 与 GitHub Copilot:代码智能的落地
Codex 2021 年 7 月发布(API 预览,8 月全面开放):基于 GPT-3 在 159GB GitHub 公共代码上微调,专攻代码生成。催生了 GitHub Copilot(2021 年 6 月技术预览,2022 年 6 月正式版)——这是 OpenAI 技术第一次大规模进入开发者日常工具链。
补充细节:Codex 证明了大模型在结构化语言上的潜力(代码比自然语言更易验证),也为后来 o 系列在编程基准上的统治埋下伏笔。
3. DALL-E、CLIP、Whisper:多模态储备
- DALL-E(2021 年 1 月):约 120 亿参数的 GPT-3 变体实现文本生图(参数为单一综述来源,官方未公开);
- CLIP(2021 年 1 月):4 亿图文对对比预训练,零样本图像分类,后来成为多模态模型的视觉编码器标准件;
- Whisper(2022 年 9 月 21 日开源):多语言语音识别,接近人类水平。
这三者奠定了 OpenAI 在视觉、图文、语音三条模态上的技术储备——2023 年的 GPT-4V、DALL-E 3 和 2024 年的 GPT-4o 都能从这里找到源头。
4. InstructGPT:RLHF 对齐路径的确立
2022 年 3 月 4 日论文(arXiv<2203>2203>.02155),《Training language models to follow instructions with human feedback》。**RLHF(基于人类反馈的强化学习)**三阶段管线:SFT(监督微调)→ 奖励模型(Reward Model)→ PPO(近端策略优化);雇 40 名标注员收集偏好数据。
标志性结论:13 亿参数的 InstructGPT 被标注员认为优于 1750 亿参数的 GPT-3——参数量差 100 倍,方向感(align)比规模更值钱。这是 ChatGPT 的直接技术前身。
5. ChatGPT:2022 年 11 月 30 日的引爆点
2022 年 11 月 30 日以免费研究预览形式上线。基于 GPT-3.5 系列微调(训练方法与 InstructGPT 相同:RLHF + PPO),知识截止 2021 年 9 月。
- 5 天破 100 万用户(12 月 5 日 Altman 宣布);
- 2 个月破 1 亿月活(2023 年 1 月末,UBS 统计)——对比 TikTok 用 9 个月、Instagram 约 2.5 年,史上增长最快的消费级应用。
ChatGPT 不是模型突破,而是交互范式突破:把大模型从 API 文档里拖出来,变成了任何人打开浏览器就能用的对话界面。Google 被迫于 2023 年 2 月 6 日仓促发布 Bard 应对(后来演化为 Gemini)。
四、阶段三:爆发——GPT-4 与商业化元年(2023)
1. GPT-4:多模态与”不说细节”的技术报告(分水岭①)
2023 年 3 月 14 日发布,多模态(图像 + 文本输入)。技术报告不公布架构、参数量、训练算力与数据,仅披露在微软 Azure”超级计算机”上训练——开创了”能力开放、细节保密”的先例。
- MMLU 达 86.4%(GPT-3.5 为 70.0%;57 学科、1.4 万题);
- 模拟律师资格考试进入前 10%(GPT-3.5 为垫底 10%);GRE 语文 99 分位;
- 26 种语言中 24 种超越当时 SOTA;
- API 定价 $0.03/1K prompt + $0.06/1K completion(8K 上下文),32K 版 $0.06/$0.12。
数据深挖(未证实):外界根据推理速度与第三方分析(SemiAnalysis 等)推测 GPT-4 约 1.8 万亿参数、MoE 架构(8 专家 × 约 220B,Top-2 路由,每 token 激活约 220B)——未经 OpenAI 证实,仅属传闻。
2. 微软百亿美元与 Bing Chat
- 2023 年 1 月 23 日:微软追加投资约 100 亿美元(2019 年 10 亿 + 2021 年一轮 + 本次,累计约 130 亿),Azure 为独家云,微软获约 49% 利润分成安排;
- 2023 年 2 月 7 日:**新版 Bing(Bing Chat)**上线,底层实为 GPT-4,48 小时内 100 万人进候补名单;
- 2023 年 3 月 16 日:Microsoft 365 Copilot 发布(Word/Excel/PowerPoint/Outlook/Teams 集成)。
微软用 130 亿美元买到了”AI 时代的优先上车权”,也把 OpenAI 的技术第一次嵌入到数十亿人的生产力软件中。
3. 产品矩阵:Plus、API、插件、DALL-E 3、GPT-4V
2023 年 OpenAI 快速把单一产品铺成矩阵:
- ChatGPT Plus(2023 年 2 月):每月 20 美元,优先访问、更快响应;
- ChatGPT API(2023 年 3 月 1 日):
gpt-3.5-turbo定价 $0.002/1K tokens,比旧 GPT-3.5 便宜 90%; - 插件系统(2023 年 3 月宣布,5 月开放):官方三件套 Browse with Bing(联网浏览)、Code Interpreter(代码解释器)、检索插件 + 11 款第三方插件(KAYAK、Wolfram、Zapier 等);
- GPT-4V(2023 年 9 月 25 日):视觉能力向 Plus/企业用户全量开放;
- DALL-E 3(2023 年 10 月):集成进 ChatGPT,由 GPT-4 代为扩写提示词,支持图内正确文字渲染。
4. DevDay 2023:GPT-4 Turbo 与 GPTs
2023 年 11 月 6 日首届开发者大会,Altman 主讲 45 分钟:
- GPT-4 Turbo:128K 上下文(约 300 页文本),知识截止 2023 年 4 月,输入降价 3 倍、输出降价 2 倍($0.01/$0.03);
- GPTs + GPT Store:无需代码定制专属 ChatGPT;
- Assistants API:Code Interpreter、Retrieval、函数调用、持久线程;
- 多模态 API:vision 预览、DALL-E 3 API、TTS、Whisper v3。
发布会披露的经营数据:ChatGPT 周活 1 亿、200 万开发者、92% 的财富 500 强在使用 OpenAI 产品——这一年 OpenAI 从研究机构完成了向平台公司的转变。
5. 董事会危机:五天的权力漩涡
2023 年 11 月 17 日,董事会以”未始终保持坦诚”为由解雇 Altman,Mira Murati 任临时 CEO,Brockman 辞任主席;微软仅在公告前 1 分钟获通知。此后的五天是 OpenAI 历史上最戏剧性的插曲:
- 11 月 19 日:回归谈判破裂,Emmett Shear 任第二任临时 CEO;
- 11 月 20 日:微软 Nadella 宣布 Altman/Brockman 加入微软新 AI 团队;超 700 名员工(约 95%)签署联名信威胁辞职追随;Ilya Sutskever 亦签名并表态后悔(他是最初投票解雇的四人之一);
- 11 月 21 日深夜:达成协议,Altman 复任 CEO,新董事会为 Bret Taylor(主席)、Larry Summers、Adam D’Angelo;微软获无投票权观察员席位。
事件暴露了 OpenAI “非营利母体 + 营利子公司”治理结构的根本矛盾:公司价值数百亿美元,但控制权掌握在不对资本负责的董事会手里。这次风波直接推动了 2024–2025 年的治理重组。
6. 监管、争议与估值飙升
- 2023 年 3 月 20 日:ChatGPT 数据泄露事件(对话与支付信息);
- 2023 年 3 月:Future of Life Institute 发布”暂停巨型 AI 实验”公开信,马斯克、沃兹尼亚克等 1000+ 人联署(Altman 未署名);
- 2023 年 3 月 31 日:意大利封禁 ChatGPT——全球首个政府禁令,依据 GDPR;4 月 28 日整改后解禁(引入年龄验证、数据处理告知、欧洲用户可拒数据用于训练);
- 估值曲线:2023 年 1 月约 290 亿美元 → 10 月员工股份出售谈判达 860 亿美元 → 12 月传出以 1000 亿美元估值融资。
五、阶段四:多模态与推理——GPT-4o 与 o 系列(2024)
1. GPT-4o:原生多模态与实时语音(分水岭②)
2024 年 5 月 13 日发布,“o” 代表 omni(全模态)。端到端单神经网络处理文本、音频、图像、视频——取代了此前语音助手的”三模型流水线”(语音识别 → 文本模型 → 语音合成)。音频响应最快 232ms、平均 320ms(接近人类对话节奏);API 比 GPT-4 Turbo 快 2 倍、成本降 50%;支持约 50 种语言。
关键决策:GPT-4o 免费向所有用户开放(不再限于订阅者),配合 2024 年 7 月的 GPT-4o mini(MMLU 82%,比 GPT-3.5 Turbo 便宜 60%)——OpenAI 把”最好用的模型免费送”当成获客手段,彻底改变了行业竞争规则。
2. o1:推理模型范式的开端
2024 年 9 月 12 日发布 o1-preview 与 o1-mini(代号 Strawberry)。核心机制:在推理时生成内部思维链(Chain of Thought),用 RL 训练”想清楚再回答”——训练时算力与推理时算力(test-time compute)双扩展。
- AIME 2024 单样本 74%、64 样本共识 83%(GPT-4o 仅 12%);
- Codeforces 第 89 百分位;
- GPQA-diamond 首次超过人类博士水平;MMMU 78.2%。
标志性意义:模型命名弃用 GPT 品牌、计数重置为 1——“推理模型”与”聊天模型”正式分家,此后 Claude、Gemini 全线跟进。
3. Sora:文生视频的震撼
2024 年 2 月 15 日发布公告(文本/图像生视频,时长最长 60 秒),震惊行业,一度成为”大模型无所不能”的标志性事件(时间上早于 GPT-4o,此处按产品线归类);但技术预览拖了 10 个月,直到 12 月 9 日才公测 Sora Turbo(1080p、最长 20 秒,向 Plus/Pro 开放)。产品化节奏明显慢于文本模型——视频生成的算力成本与一致性控制是硬门槛。
4. o3 与 o3-mini:推理的”测试时扩展”登顶
2024 年 12 月 20 日公告(“12 天活动”第 12 天;命名跳过 o2 规避商标冲突):
- ARC-AGI 高计算 87.5%(人类阈值 85)——一度被视为”AGI 基准”的测试首次被攻破;
- AIME 2024 96.7%;Codeforces Elo 2727(o1 为 1891);
- FrontierMath 25.2%(此前所有模型 <2%);SWE-bench 71.7%。
o3-mini 于 2025 年 1 月 31 日正式发布,成为首个向免费用户开放(Reason 选项)的推理模型。
5. 组织与市场:Ilya 离职、1570 亿美元估值、Apple 合作与 ChatGPT Search
- 人事:Ilya Sutskever 2024 年 5 月离职(后创立 SSI);9 月底 CTO Mira Murati、研究主管 Bob McGrew 等离职潮;
- 融资:2024 年 10 月完成 66 亿美元融资(史上最大 VC 轮),估值 1570 亿美元(年初约 800 亿),Thrive Capital 领投 13 亿,微软、英伟达、软银(5 亿)参与;
- Apple 合作(2024 年 6 月 WWDC 宣布):Siri 接入 ChatGPT(GPT-4o 驱动,iOS 18,请求不存储);
- ChatGPT Search:2024 年 11 月 1 日正式上线(GPT-4o 微调版 + 蒸馏 o1-preview),12 月 16 日向所有登录用户开放,直接狙击谷歌;
- 用户:周活从 2024 年 8 月超 2 亿 → 10 月 2.5 亿 → 12 月 3 亿(Altman 在 DealBook 峰会口径);
- 营收:2024 年约 36–37 亿美元,2025 年预期 116 亿。
六、阶段五:智能体元年与 GPT-5(2025)
1. DeepSeek-R1 的冲击
2025 年 1 月 20–27 日,DeepSeek-R1 开源推理模型发布,性能比肩 o1、训练成本约 o1 的 1/30。1 月 27 日美股”黑色星期一”:英伟达单日跌约 17%,AI 硬件股集体重挫。Altman 公开称赞 R1 是”impressive model”,并称”将加快发布速度”。
这场冲击的实质是价格战信号:闭源推理能力的技术护城河,第一次被开源以数量级成本差逼近。OpenAI 随后的应对是加速发布节奏 + 免费开放策略。
2. Stargate:5000 亿美元的算力军备
2025 年 1 月 21 日,OpenAI + 软银 + 甲骨文 + MGX 宣布合资 Stargate(星际之门):四年投入 5000 亿美元、首期 1000 亿,孙正义任董事长,德州率先开工。这是人类历史上规模最大的单笔 AI 基础设施投资——OpenAI 的判断是:模型能力的天花板仍然由算力决定,闭源时代的竞争本质是算力军备竞赛。
3. Operator 与 ChatGPT Agent:智能体落地
- Operator(2025 年 1 月 23 日):首款浏览器智能体,基于 CUA(Computer-Using Agent)模型 + GPT-4o 视觉,可自动订餐、网购、填表,先供美区 Pro 用户;
- ChatGPT Agent(2025 年 7 月 17 日):融合 Operator + Deep Research + ChatGPT 的统一智能体,用自有”虚拟电脑”执行任务;HLE(Humanity’s Last Exam)41.6%。
2025 年 OpenAI 的产品叙事从”聊天”转向”替我干活”——智能体成为与模型同权重的战略方向。
4. GPT-4.5 与 o3/o4-mini
- GPT-4.5(2025 年 2 月 27 日研究预览):当时的”最大聊天模型”,主打通顺、少幻觉;
- 2025 年 3 月底:原生图像生成上线,Ghibli(吉卜力)风格头像爆火出圈;
- o3 与 o4-mini(2025 年 4 月 16 日):o 系列首次能在思考链中调用全部工具;o4-mini 登顶 AIME 2024/25,4 月 24 日起取代 o1、o3-mini。
5. GPT-5:统一系统与免费开放(分水岭③)
2025 年 8 月 7 日发布。统一系统(Unified System):Instant(即时)+ Thinking(思考)双模式 + 实时路由器自动分配,终结了”聊天模型 vs 推理模型”的选择难题——与 DeepSeek V3.1 的混合推理架构同一思路。
- 免费开放,Plus 更高限额,Pro 含 GPT-5 Pro;
- API 定价:每百万 token $1.25 输入 / $10 输出(mini $0.25/$2、nano $0.05/$0.4);
- 400K 上下文;发布时周活约 7 亿;
- 8 月 5 日先开源 gpt-oss(开源权重模型,回归 OpenAI 早期开源传统)。
6. 融资三级跳、Sora 2 与 DevDay 2025
- 2025 年 3 月 31 日:敲定 400 亿美元融资(史上最大私募),估值 3000 亿美元,软银领投、分两期;
- 2025 年 9 月 29 日:加州州长纽森签署 SB 53——美国首部前沿 AI 透明度法(针对营收 >5 亿美元大厂,违者最高罚 100 万美元;OpenAI 游说反对);
- 2025 年 9 月 30 日:Sora 2.0 发布并推出同名社交 App,音画同步、物理真实感、多镜头叙事突破,内置”Cameo”虚拟形象——视频生成进入产品化;
- 2025 年 10 月 2 日:通过 66 亿美元股票交易,估值升至 5000 亿美元(全球最贵私有公司);
- 2025 年 10 月 6 日 DevDay:周活 8 亿、开发者 400 万、API 每分钟 60 亿 token;发布 Apps SDK、AgentKit、Codex 正式版、Sora 2 API、GPT-5 Pro API;
- 2025 年 10 月 28 日微软新协议:微软持股约 27%(约 1350 亿美元);OpenAI 加购 2500 亿美元 Azure 但微软失去算力优先权;AGI 须独立委员会验证、协议延至 2032 年——两家公司的捆绑关系开始松绑。
七、阶段六:高速迭代与上市之路(2026)
1. GPT-5.1 / GPT-5.2:自适应推理与通用智能体
- GPT-5.1(2025 年 11 月 12 日):Instant 新增自适应推理(Adaptive Reasoning),Thinking 升级,语气更温暖、指令遵循更好;11 月 19 日推 GPT-5.1 Pro;
- GPT-5.2(2025 年 12 月 11 日):Instant/Thinking/Pro 三档,知识截止 2025 年 8 月,API $1.75/$14;
- ChatGPT Agent 正式发布(2025 年 12 月 12 日,北京发布会):虚拟电脑自主完成复杂任务,Pro 每月 400 次提示、其余 40 次。
2. GPT-5.3–5.5:实时编码、1M 上下文与”迄今最智能”
- 2026 年 2 月 9 日:美区 Free/Go 用户开始测试广告(免费模式的商业化补充);
- GPT-5.3-Codex-Spark(2026 年 2 月 12 日):首个实时编码模型,速度提升约 15 倍;
- GPT-5.4(2026 年 3 月 5 日):1M token 上下文 + 计算机操作 + 工具搜索;3 月 18 日加推 5.4 mini;
- GPT-5.5(2026 年 4 月 23 日):号称”迄今最智能”,擅长代码/研究/跨工具任务;5 月 5 日 GPT-5.5 Instant 成为默认模型,幻觉较 5.3 Instant 降 52.5%;同月配套 GPT-Rosalind(生命科学)、ChatGPT Images 2.0、Privacy Filter。
3. GPT-5.6:旗舰三档与 IPO
- 2026 年 6 月 8 日:秘密递交 S-1 启动 IPO;
- 2026 年 7 月 9 日:GPT-5.6 系列发布——旗舰 Sol、均衡 Terra、高性价比 Luna,新增 max/ultra(多智能体并行),Agents’ Last Exam 53.6 分,API Sol $5/$30;同日推出 ChatGPT Work,Codex 并入桌面端;
- 2026 年 7 月 23 日:正式推出健康功能(美区 18+,可连接 Apple Health/病历)——产品边界从办公向个人数据服务扩张。
八、三条技术主线
主线一:规模与扩展定律(Scaling Law)
GPT-1(1.17 亿)→ GPT-2(15 亿)→ GPT-3(1750 亿)→ GPT-4(约 1.8 万亿,传闻)→ GPT-5 统一系统 → GPT-5.6 旗舰三档
- GPT-3 用 1000 倍参数换来质变,确认”大力出奇迹”;
- GPT-4 之后参数量不再是公开卖点,转向架构效率与推理时算力;
- 2025 年后竞争主轴变成 test-time compute(测试时计算)——训练规模撞墙后,把更多算力花在推理时的”思考”上(o 系列、GPT-5 的 Thinking 模式都是这一路线)。
主线二:对齐与推理(Alignment → Reasoning → Agent)
预训练 → InstructGPT(RLHF)→ ChatGPT(RLHF 产品化)→ o1/o3(推理时 RL)→ GPT-5 统一模式 → Operator/ChatGPT Agent(智能体)
- RLHF 阶段(2022):解决”如何让模型听人话”;
- 推理阶段(2024):解决”如何让模型想清楚”——RL 从训练时的对齐工具变成训练推理能力的引擎;
- 智能体阶段(2025–2026):解决”如何让模型干活”——从回答问题到操作浏览器、虚拟电脑、跨工具任务。
主线三:多模态统一
纯文本(GPT-1~3)→ 视觉输入(GPT-4V)→ 语音/图像输出(GPT-4o 端到端)→ 视频生成(Sora)→ 原生图像生成(2025.03)→ 健康数据(2026)
- GPT-4 是”多模态输入”(看得懂图);
- GPT-4o 是”多模态原生”(一个网络吃全部模态,输入输出一体);
- Sora 与图像生成则是”多模态创作”——OpenAI 从理解走向生成闭环。
九、ChatGPT 的启示:OpenAI 方法论(四条原则)
- 规模先行,相信扩展定律——每一代模型都押注”更大 + 更多数据 + 更强对齐”的组合拳,GPT-3 到 GPT-4 的路径证明规模红利远未耗尽;
- 产品闭环,研究即产品——与 DeepSeek 的论文驱动不同,OpenAI 的每个技术节点都同步落地为产品(ChatGPT、API、GPTs、Agent),用真实用户反馈反哺研究;
- 迭代部署,边用边安全——GPT-2 的分阶段发布确立先例:不追求一次性完美,而是逐步开放、用真实世界做对齐测试(虽然伴随争议);
- 生态卡位,免费获客——GPT-4o 免费开放、API 连续降价(自 2022 年以来单 token 成本降 99%),用规模换取生态位,再通过订阅、API、企业服务与广告变现。
与 DeepSeek 的对照:DeepSeek 用”更少的计算”挑战闭源(效率路线),OpenAI 用”更多的算力 + 更快迭代”维持领先(规模与速度路线)。2025 年之后两条路线在”混合推理 + 免费开放”上开始趋同。
附录 A:完整时间线(一句话版)
2015.12 OpenAI 成立 → 2018.06 GPT-1 → 2019.02 GPT-2 → 2019.03/07 OpenAI LP 转型 + 微软 10 亿 → 2020.05 GPT-3 → 2021.01 DALL-E/CLIP → 2021.07 Codex/Copilot → 2022.03 InstructGPT → 2022.09 Whisper → 2022.11.30 ChatGPT → 2023.02 Plus/Bing → 2023.03 GPT-4 → 2023.09 GPT-4V → 2023.10 DALL-E 3 → 2023.11 DevDay(Turbo/GPTs)→ 2023.11 董事会危机 → 2024.05 GPT-4o → 2024.09 o1 → 2024.10 估值 1570 亿 → 2024.12 o3/Sora 公测 → 2025.01 R1 冲击/Stargate/Operator → 2025.02 GPT-4.5 → 2025.04 o3/o4-mini → 2025.07 ChatGPT Agent → 2025.08 GPT-5 → 2025.09 Sora 2 → 2025.10 估值 5000 亿 → 2025.11 GPT-5.1 → 2025.12 GPT-5.2/ChatGPT Agent → 2026.02 GPT-5.3-Codex-Spark → 2026.03 GPT-5.4 → 2026.04 GPT-5.5 → 2026.06 S-1 → 2026.07 GPT-5.6
附录 B:主要信息来源
- OpenAI 官方博客与模型发布页(chatgpt、gpt-4、gpt-4o、o1、gpt-5、gpt-5-1 等 index 页)
- GPT-3 论文:arXiv<2005>2005>.14165《Language Models are Few-Shot Learners》
- InstructGPT 论文:arXiv<2203>2203>.02155
- GPT-4 技术报告:arXiv<2303>2303>.08774
- DALL-E 3 System Card:openai.com/papers/DALL_E_3_System_Card.pdf
- Stargate 官方公告:openai.com/index/announcing-the-stargate-project
- ChatGPT Release Notes:help.openai.com/en/articles/6825453-chatgpt-release-notes
- 主流媒体交叉验证:TechCrunch、Ars Technica、Britannica、Reuters、Bloomberg、Fortune(估值、融资、人事、监管)
- 第三方时间线:vectoringai.com、hidekazu-konishi.com(模型发布日历,交叉核对用)
附录 C:信息缺口与口径说明
- GPT-4 参数量:1.8 万亿 MoE 属 SemiAnalysis 等第三方推测,未经 OpenAI 证实,文中已标注。
- 2025–2026 数据多为单源:GPT-5.3/5.4/5.5/5.6、广告测试、S-1、健康功能等为网络检索结果,多数来自官方 release notes 或官方 index 页,但部分细节(如”周活 9 亿”传闻)仅第三方来源,未获官方公告,文中未采纳。
- ChatGPT Agent 发布日:来源冲突(官方新闻页标 2025-08-28,主流媒体记 2025-07-17,2025-12-12 又有一轮重大发布),本文按主流媒体口径取 7 月,正式发布以 12 月为准。
- 用户数口径:2024 年 3 亿、2025 年 8 月 7 亿、10 月 8 亿均为 Altman/官方在不同场合宣布的口径,非同一统计体系,直接对比需谨慎。
- 估值口径:2023 年 860 亿为员工股份出售(非新股融资),2025 年 10 月 5000 亿为股票交易,两者性质不同,已分别注明。
- Codex 发布时间:多数来源为 2021 年 7 月(部分写 8 月);GitHub Copilot 2021 年 6 月为技术预览、2022 年 6 月正式版,本文取此口径。
- DALL-E 参数量(120 亿):仅单一综述来源,官方未公开,需进一步核实。
- 微软利润分成比例:正文”约 49%“为流传较广的媒体口径(The Information 等:收回投资前 75%、之后 49% 上限),条款细节各信源存在出入,实际未公开。
- OpenAI 2026 年下半年规划:GPT-6 截至 2026 年 8 月未发布,仅传闻(Altman 称间隔会短于 GPT-4→5 的 2.5 年);GPT-5.6 内部代号原传闻”Spud”→ 实为 5.5,存在反复。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





