mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
8037 字
24 分钟
ChatGPT发展史
2026-07-27

ChatGPT 发展史:从 GPT-1 到 GPT-5.6 的八年跃迁#


口径说明:本文以 OpenAI 官方博客、技术报告及主流媒体为信息来源,覆盖 2015 年 12 月公司成立至 2026 年 7 月。2023 年及以前的事件已经历史充分验证;2024–2026 年的信息主要来自网络检索,个别数据存在多口径,已在附录 C 注明。标注”未证实”的信息(如 GPT-4 参数量)仅作传闻引用,不作为事实结论。

〇、总览:这篇文章讲什么#

文章系统梳理了 OpenAI 从 2015 年 12 月成立到 2026 年 7 月发布 GPT-5.6 之间的十年历史。与 DeepSeek 以论文为骨干不同,ChatGPT 这条线以模型发布与产品迭代为骨架——OpenAI 走的是”研究 → 产品 → 生态”一体化的路线,每一个技术节点几乎都对应一个可用的产品。全文沿三条技术主线展开:

  1. 规模与扩展定律(Scaling Law)——为什么”大力出奇迹”能一路成立;
  2. 对齐与推理——从 RLHF 对齐到推理模型再到智能体;
  3. 多模态统一——从纯文本到语音、图像、视频的原生融合。

文章最后总结出 OpenAI 的四条方法论:规模先行、产品闭环、迭代部署、生态卡位。


一、发展时间线总表#

时间模型/事件核心贡献关键数据
2015.12OpenAI 成立非营利研究机构,对标 DeepMind承诺募资超 10 亿美元
2018.06GPT-1生成式预训练开山之作1.17 亿参数
2019.02GPT-2规模与风险的分水岭,分阶段发布15 亿参数
2019.03/07OpenAI LP 转型 + 微软投资”上限利润”结构,算力换股权微软投 10 亿美元
2020.05GPT-3”规模即能力”的确认1750 亿参数,3000 亿 token
2021.01/07DALL-E、Codex多模态储备、代码智能Copilot 诞生
2022.03InstructGPTRLHF 对齐路径确立1.3B 优于 175B
2022.09Whisper开源语音识别接近人类水平
2022.11ChatGPT(引爆点)消费级 AI 拐点5 天百万用户,2 个月 1 亿月活
2023.02ChatGPT Plus / Bing Chat商业化启动、微软产品整合20 美元/月
2023.03GPT-4(分水岭①)多模态,能力跃升MMLU 86.4%,律师考试前 10%
2023.11DevDay:GPT-4 Turbo、GPTs生态化,开发者平台128K 上下文,周活 1 亿
2023.11董事会危机权力结构震荡95% 员工联名信
2024.02/12Sora 公告与公测文生视频最长 20 秒,1080p
2024.05GPT-4o(分水岭②)原生多模态 + 实时语音免费开放,音频 232ms
2024.09o1推理模型范式开端AIME 74%(GPT-4o 仅 12%)
2024.1066 亿美元融资史上最大 VC 轮估值 1570 亿美元
2024.12o3 公告”测试时扩展”(Test-time Scaling)ARC-AGI 87.5%,AIME 96.7%
2025.01DeepSeek-R1 冲击开源冲击波英伟达单日 -17%
2025.01Stargate算力军备四年 5000 亿美元
2025.08GPT-5(分水岭③)统一系统,免费开放周活 7 亿
2025.09/10Sora 2、估值 5000 亿美元视频生成产品化全球最贵私有公司
2025.12GPT-5.2 + ChatGPT Agent通用智能体落地Pro 每月 400 次提示
2026.03GPT-5.41M 上下文 + 计算机操作知识截止 2025.08
2026.06/07S-1 递交 + GPT-5.6IPO 启动、旗舰三档Sol/Terra/Luna

三个分水岭:GPT-4(能力质变)、GPT-4o(多模态与免费策略)、GPT-5(统一模型与智能体)。


二、阶段一:奠基——非营利理想与生成式预训练(2015–2019)#

1. OpenAI 成立:以 AGI 为使命的非营利机构#

2015 年 12 月 11 日在旧金山成立,创始人包括 Sam Altman、Greg Brockman、Ilya Sutskever、Elon Musk、Wojciech Zaremba 等,定位为非营利研究机构,承诺募资超 10 亿美元(早期出资者含 Peter Thiel、Reid Hoffman、AWS、Infosys 等)。使命宣言是”以惠及全人类的方式发展 AGI(通用人工智能)“,当时以”开源安全派”姿态对标谷歌 DeepMind。

补充细节:Elon Musk 2018 年退出董事会(官方口径为特斯拉业务利益冲突,另一说法是他提议接管 OpenAI 被拒)。Musk 退出后不到两年,OpenAI 便放弃了非营利路线——这个转折后来成为 Musk 多次攻击 OpenAI 的由头。

2. GPT-1:生成式预训练的开山之作#

2018 年 6 月 11 日论文《Improving Language Understanding by Generative Pre-Training》(作者 Radford、Narasimhan、Salimans、Sutskever)。1.17 亿参数,12 层 decoder-only Transformer,在 BooksCorpus(约 7000 本书、8 亿词)上做”预测下一个词”预训练,再针对下游任务微调。GLUE 得分 72.8(当时 SOTA)。

核心贡献不是参数量,而是确立了 “无监督预训练 + 有监督微调” 的两段式范式——这个范式后来演变成”预训练 + RLHF 对齐”,贯穿 OpenAI 全部后续模型。

3. GPT-2:规模带来的风险与分阶段发布#

2019 年 2 月发布,15 亿参数。论文标题《Language Models are Unsupervised Multitask Learners》(语言模型是无监督多任务学习者),首次展示**零样本迁移(Zero-shot Transfer)**能力。

真正载入史册的是分阶段发布争议:OpenAI 以”文本生成能力过于危险、可能被用于大规模欺诈”为由,先发布小模型、推迟发布完整版,引发学术界关于”研究透明度 vs 安全”的大讨论。批评者认为这是营销炒作,支持者认为开创了**迭代式部署(Iterative Deployment)**的先河——后者后来成为 OpenAI 的招牌方法论。

4. OpenAI LP:转型与微软的 10 亿美元#

2019 年 3 月 11 日设立”有上限利润”实体 OpenAI LP(capped-profit),7 月 22 日微软投资 10 亿美元,成为独家云计算伙伴(Azure 超级计算)。结构设计:早期投资者回报上限为投资额的 100 倍,超额利润归非营利母体所有。

这一步的意义在于确立了 “算力换股权” 的融资模板——OpenAI 自己没有数据中心,训练大模型必须绑定云厂商;而微软要的是一张通往 AGI 时代的船票。这个结构也埋下了后来 OpenAI 与微软之间既合作又提防的长期张力。


三、阶段二:规模即能力——GPT-3 与工程化(2020–2022.11)#

1. GPT-3:1750 亿参数的 Few-shot 学习者#

2020 年 5 月 28 日论文(arXiv<2005>.14165,NeurIPS 2020 杰出论文),《Language Models are Few-Shot Learners》。1750 亿参数——当时最大非稀疏模型的 10 倍;96 层,上下文 2048 tokens,训练约 3000 亿 token,训练算力 3640 petaflop/s-days

核心机制是 in-context learning(上下文学习):不更新任何梯度,仅通过在 prompt 里给几个示例,模型就能完成新任务。这颠覆了”每个任务都要微调一个模型”的范式——规模本身就是能力

补充细节:GPT-3 也首次暴露了”规模”的另一面:在算数、常识推理上表现不稳定,且模型越大毒性越高。OpenAI 于 2020 年 11 月开放 API 测试,2021 年成为第一个商业化的 GPT 产品。

2. Codex 与 GitHub Copilot:代码智能的落地#

Codex 2021 年 7 月发布(API 预览,8 月全面开放):基于 GPT-3 在 159GB GitHub 公共代码上微调,专攻代码生成。催生了 GitHub Copilot(2021 年 6 月技术预览,2022 年 6 月正式版)——这是 OpenAI 技术第一次大规模进入开发者日常工具链。

补充细节:Codex 证明了大模型在结构化语言上的潜力(代码比自然语言更易验证),也为后来 o 系列在编程基准上的统治埋下伏笔。

3. DALL-E、CLIP、Whisper:多模态储备#

  • DALL-E(2021 年 1 月):约 120 亿参数的 GPT-3 变体实现文本生图(参数为单一综述来源,官方未公开);
  • CLIP(2021 年 1 月):4 亿图文对对比预训练,零样本图像分类,后来成为多模态模型的视觉编码器标准件;
  • Whisper(2022 年 9 月 21 日开源):多语言语音识别,接近人类水平。

这三者奠定了 OpenAI 在视觉、图文、语音三条模态上的技术储备——2023 年的 GPT-4V、DALL-E 3 和 2024 年的 GPT-4o 都能从这里找到源头。

4. InstructGPT:RLHF 对齐路径的确立#

2022 年 3 月 4 日论文(arXiv<2203>.02155),《Training language models to follow instructions with human feedback》。**RLHF(基于人类反馈的强化学习)**三阶段管线:SFT(监督微调)→ 奖励模型(Reward Model)→ PPO(近端策略优化);雇 40 名标注员收集偏好数据。

标志性结论:13 亿参数的 InstructGPT 被标注员认为优于 1750 亿参数的 GPT-3——参数量差 100 倍,方向感(align)比规模更值钱。这是 ChatGPT 的直接技术前身。

5. ChatGPT:2022 年 11 月 30 日的引爆点#

2022 年 11 月 30 日以免费研究预览形式上线。基于 GPT-3.5 系列微调(训练方法与 InstructGPT 相同:RLHF + PPO),知识截止 2021 年 9 月。

  • 5 天破 100 万用户(12 月 5 日 Altman 宣布);
  • 2 个月破 1 亿月活(2023 年 1 月末,UBS 统计)——对比 TikTok 用 9 个月、Instagram 约 2.5 年,史上增长最快的消费级应用

ChatGPT 不是模型突破,而是交互范式突破:把大模型从 API 文档里拖出来,变成了任何人打开浏览器就能用的对话界面。Google 被迫于 2023 年 2 月 6 日仓促发布 Bard 应对(后来演化为 Gemini)。


四、阶段三:爆发——GPT-4 与商业化元年(2023)#

1. GPT-4:多模态与”不说细节”的技术报告(分水岭①)#

2023 年 3 月 14 日发布,多模态(图像 + 文本输入)。技术报告不公布架构、参数量、训练算力与数据,仅披露在微软 Azure”超级计算机”上训练——开创了”能力开放、细节保密”的先例。

  • MMLU 达 86.4%(GPT-3.5 为 70.0%;57 学科、1.4 万题);
  • 模拟律师资格考试进入前 10%(GPT-3.5 为垫底 10%);GRE 语文 99 分位;
  • 26 种语言中 24 种超越当时 SOTA;
  • API 定价 $0.03/1K prompt + $0.06/1K completion(8K 上下文),32K 版 $0.06/$0.12。

数据深挖(未证实):外界根据推理速度与第三方分析(SemiAnalysis 等)推测 GPT-4 约 1.8 万亿参数、MoE 架构(8 专家 × 约 220B,Top-2 路由,每 token 激活约 220B)——未经 OpenAI 证实,仅属传闻。

2. 微软百亿美元与 Bing Chat#

  • 2023 年 1 月 23 日:微软追加投资约 100 亿美元(2019 年 10 亿 + 2021 年一轮 + 本次,累计约 130 亿),Azure 为独家云,微软获约 49% 利润分成安排;
  • 2023 年 2 月 7 日:**新版 Bing(Bing Chat)**上线,底层实为 GPT-4,48 小时内 100 万人进候补名单;
  • 2023 年 3 月 16 日:Microsoft 365 Copilot 发布(Word/Excel/PowerPoint/Outlook/Teams 集成)。

微软用 130 亿美元买到了”AI 时代的优先上车权”,也把 OpenAI 的技术第一次嵌入到数十亿人的生产力软件中。

3. 产品矩阵:Plus、API、插件、DALL-E 3、GPT-4V#

2023 年 OpenAI 快速把单一产品铺成矩阵:

  • ChatGPT Plus(2023 年 2 月):每月 20 美元,优先访问、更快响应;
  • ChatGPT API(2023 年 3 月 1 日):gpt-3.5-turbo 定价 $0.002/1K tokens,比旧 GPT-3.5 便宜 90%
  • 插件系统(2023 年 3 月宣布,5 月开放):官方三件套 Browse with Bing(联网浏览)、Code Interpreter(代码解释器)、检索插件 + 11 款第三方插件(KAYAK、Wolfram、Zapier 等);
  • GPT-4V(2023 年 9 月 25 日):视觉能力向 Plus/企业用户全量开放;
  • DALL-E 3(2023 年 10 月):集成进 ChatGPT,由 GPT-4 代为扩写提示词,支持图内正确文字渲染。

4. DevDay 2023:GPT-4 Turbo 与 GPTs#

2023 年 11 月 6 日首届开发者大会,Altman 主讲 45 分钟:

  • GPT-4 Turbo128K 上下文(约 300 页文本),知识截止 2023 年 4 月,输入降价 3 倍、输出降价 2 倍($0.01/$0.03);
  • GPTs + GPT Store:无需代码定制专属 ChatGPT;
  • Assistants API:Code Interpreter、Retrieval、函数调用、持久线程;
  • 多模态 API:vision 预览、DALL-E 3 API、TTS、Whisper v3。

发布会披露的经营数据:ChatGPT 周活 1 亿、200 万开发者、92% 的财富 500 强在使用 OpenAI 产品——这一年 OpenAI 从研究机构完成了向平台公司的转变。

5. 董事会危机:五天的权力漩涡#

2023 年 11 月 17 日,董事会以”未始终保持坦诚”为由解雇 Altman,Mira Murati 任临时 CEO,Brockman 辞任主席;微软仅在公告前 1 分钟获通知。此后的五天是 OpenAI 历史上最戏剧性的插曲:

  • 11 月 19 日:回归谈判破裂,Emmett Shear 任第二任临时 CEO;
  • 11 月 20 日:微软 Nadella 宣布 Altman/Brockman 加入微软新 AI 团队;超 700 名员工(约 95%)签署联名信威胁辞职追随;Ilya Sutskever 亦签名并表态后悔(他是最初投票解雇的四人之一);
  • 11 月 21 日深夜:达成协议,Altman 复任 CEO,新董事会为 Bret Taylor(主席)、Larry Summers、Adam D’Angelo;微软获无投票权观察员席位。

事件暴露了 OpenAI “非营利母体 + 营利子公司”治理结构的根本矛盾:公司价值数百亿美元,但控制权掌握在不对资本负责的董事会手里。这次风波直接推动了 2024–2025 年的治理重组。

6. 监管、争议与估值飙升#

  • 2023 年 3 月 20 日:ChatGPT 数据泄露事件(对话与支付信息);
  • 2023 年 3 月:Future of Life Institute 发布”暂停巨型 AI 实验”公开信,马斯克、沃兹尼亚克等 1000+ 人联署(Altman 未署名);
  • 2023 年 3 月 31 日:意大利封禁 ChatGPT——全球首个政府禁令,依据 GDPR;4 月 28 日整改后解禁(引入年龄验证、数据处理告知、欧洲用户可拒数据用于训练);
  • 估值曲线:2023 年 1 月约 290 亿美元 → 10 月员工股份出售谈判达 860 亿美元 → 12 月传出以 1000 亿美元估值融资。

五、阶段四:多模态与推理——GPT-4o 与 o 系列(2024)#

1. GPT-4o:原生多模态与实时语音(分水岭②)#

2024 年 5 月 13 日发布,“o” 代表 omni(全模态)端到端单神经网络处理文本、音频、图像、视频——取代了此前语音助手的”三模型流水线”(语音识别 → 文本模型 → 语音合成)。音频响应最快 232ms、平均 320ms(接近人类对话节奏);API 比 GPT-4 Turbo 快 2 倍、成本降 50%;支持约 50 种语言。

关键决策:GPT-4o 免费向所有用户开放(不再限于订阅者),配合 2024 年 7 月的 GPT-4o mini(MMLU 82%,比 GPT-3.5 Turbo 便宜 60%)——OpenAI 把”最好用的模型免费送”当成获客手段,彻底改变了行业竞争规则。

2. o1:推理模型范式的开端#

2024 年 9 月 12 日发布 o1-preview 与 o1-mini(代号 Strawberry)。核心机制:在推理时生成内部思维链(Chain of Thought),用 RL 训练”想清楚再回答”——训练时算力与推理时算力(test-time compute)双扩展

  • AIME 2024 单样本 74%、64 样本共识 83%(GPT-4o 仅 12%);
  • Codeforces 第 89 百分位;
  • GPQA-diamond 首次超过人类博士水平;MMMU 78.2%。

标志性意义:模型命名弃用 GPT 品牌、计数重置为 1——“推理模型”与”聊天模型”正式分家,此后 Claude、Gemini 全线跟进。

3. Sora:文生视频的震撼#

2024 年 2 月 15 日发布公告(文本/图像生视频,时长最长 60 秒),震惊行业,一度成为”大模型无所不能”的标志性事件(时间上早于 GPT-4o,此处按产品线归类);但技术预览拖了 10 个月,直到 12 月 9 日才公测 Sora Turbo(1080p、最长 20 秒,向 Plus/Pro 开放)。产品化节奏明显慢于文本模型——视频生成的算力成本与一致性控制是硬门槛。

4. o3 与 o3-mini:推理的”测试时扩展”登顶#

2024 年 12 月 20 日公告(“12 天活动”第 12 天;命名跳过 o2 规避商标冲突):

  • ARC-AGI 高计算 87.5%(人类阈值 85)——一度被视为”AGI 基准”的测试首次被攻破;
  • AIME 2024 96.7%;Codeforces Elo 2727(o1 为 1891);
  • FrontierMath 25.2%(此前所有模型 <2%);SWE-bench 71.7%。

o3-mini 于 2025 年 1 月 31 日正式发布,成为首个向免费用户开放(Reason 选项)的推理模型。

  • 人事:Ilya Sutskever 2024 年 5 月离职(后创立 SSI);9 月底 CTO Mira Murati、研究主管 Bob McGrew 等离职潮;
  • 融资:2024 年 10 月完成 66 亿美元融资(史上最大 VC 轮),估值 1570 亿美元(年初约 800 亿),Thrive Capital 领投 13 亿,微软、英伟达、软银(5 亿)参与;
  • Apple 合作(2024 年 6 月 WWDC 宣布):Siri 接入 ChatGPT(GPT-4o 驱动,iOS 18,请求不存储);
  • ChatGPT Search:2024 年 11 月 1 日正式上线(GPT-4o 微调版 + 蒸馏 o1-preview),12 月 16 日向所有登录用户开放,直接狙击谷歌;
  • 用户:周活从 2024 年 8 月超 2 亿 → 10 月 2.5 亿 → 12 月 3 亿(Altman 在 DealBook 峰会口径);
  • 营收:2024 年约 36–37 亿美元,2025 年预期 116 亿。

六、阶段五:智能体元年与 GPT-5(2025)#

1. DeepSeek-R1 的冲击#

2025 年 1 月 20–27 日,DeepSeek-R1 开源推理模型发布,性能比肩 o1、训练成本约 o1 的 1/30。1 月 27 日美股”黑色星期一”:英伟达单日跌约 17%,AI 硬件股集体重挫。Altman 公开称赞 R1 是”impressive model”,并称”将加快发布速度”。

这场冲击的实质是价格战信号:闭源推理能力的技术护城河,第一次被开源以数量级成本差逼近。OpenAI 随后的应对是加速发布节奏 + 免费开放策略。

2. Stargate:5000 亿美元的算力军备#

2025 年 1 月 21 日,OpenAI + 软银 + 甲骨文 + MGX 宣布合资 Stargate(星际之门):四年投入 5000 亿美元、首期 1000 亿,孙正义任董事长,德州率先开工。这是人类历史上规模最大的单笔 AI 基础设施投资——OpenAI 的判断是:模型能力的天花板仍然由算力决定,闭源时代的竞争本质是算力军备竞赛。

3. Operator 与 ChatGPT Agent:智能体落地#

  • Operator(2025 年 1 月 23 日):首款浏览器智能体,基于 CUA(Computer-Using Agent)模型 + GPT-4o 视觉,可自动订餐、网购、填表,先供美区 Pro 用户;
  • ChatGPT Agent(2025 年 7 月 17 日):融合 Operator + Deep Research + ChatGPT 的统一智能体,用自有”虚拟电脑”执行任务;HLE(Humanity’s Last Exam)41.6%

2025 年 OpenAI 的产品叙事从”聊天”转向”替我干活”——智能体成为与模型同权重的战略方向。

4. GPT-4.5 与 o3/o4-mini#

  • GPT-4.5(2025 年 2 月 27 日研究预览):当时的”最大聊天模型”,主打通顺、少幻觉;
  • 2025 年 3 月底:原生图像生成上线,Ghibli(吉卜力)风格头像爆火出圈;
  • o3 与 o4-mini(2025 年 4 月 16 日):o 系列首次能在思考链中调用全部工具;o4-mini 登顶 AIME 2024/25,4 月 24 日起取代 o1、o3-mini。

5. GPT-5:统一系统与免费开放(分水岭③)#

2025 年 8 月 7 日发布。统一系统(Unified System):Instant(即时)+ Thinking(思考)双模式 + 实时路由器自动分配,终结了”聊天模型 vs 推理模型”的选择难题——与 DeepSeek V3.1 的混合推理架构同一思路。

  • 免费开放,Plus 更高限额,Pro 含 GPT-5 Pro;
  • API 定价:每百万 token $1.25 输入 / $10 输出(mini $0.25/$2、nano $0.05/$0.4);
  • 400K 上下文;发布时周活约 7 亿
  • 8 月 5 日先开源 gpt-oss(开源权重模型,回归 OpenAI 早期开源传统)。

6. 融资三级跳、Sora 2 与 DevDay 2025#

  • 2025 年 3 月 31 日:敲定 400 亿美元融资(史上最大私募),估值 3000 亿美元,软银领投、分两期;
  • 2025 年 9 月 29 日:加州州长纽森签署 SB 53——美国首部前沿 AI 透明度法(针对营收 >5 亿美元大厂,违者最高罚 100 万美元;OpenAI 游说反对);
  • 2025 年 9 月 30 日:Sora 2.0 发布并推出同名社交 App,音画同步、物理真实感、多镜头叙事突破,内置”Cameo”虚拟形象——视频生成进入产品化;
  • 2025 年 10 月 2 日:通过 66 亿美元股票交易,估值升至 5000 亿美元(全球最贵私有公司);
  • 2025 年 10 月 6 日 DevDay:周活 8 亿、开发者 400 万、API 每分钟 60 亿 token;发布 Apps SDK、AgentKit、Codex 正式版、Sora 2 API、GPT-5 Pro API;
  • 2025 年 10 月 28 日微软新协议:微软持股约 27%(约 1350 亿美元);OpenAI 加购 2500 亿美元 Azure 但微软失去算力优先权;AGI 须独立委员会验证、协议延至 2032 年——两家公司的捆绑关系开始松绑。

七、阶段六:高速迭代与上市之路(2026)#

1. GPT-5.1 / GPT-5.2:自适应推理与通用智能体#

  • GPT-5.1(2025 年 11 月 12 日):Instant 新增自适应推理(Adaptive Reasoning),Thinking 升级,语气更温暖、指令遵循更好;11 月 19 日推 GPT-5.1 Pro;
  • GPT-5.2(2025 年 12 月 11 日):Instant/Thinking/Pro 三档,知识截止 2025 年 8 月,API $1.75/$14;
  • ChatGPT Agent 正式发布(2025 年 12 月 12 日,北京发布会):虚拟电脑自主完成复杂任务,Pro 每月 400 次提示、其余 40 次。

2. GPT-5.3–5.5:实时编码、1M 上下文与”迄今最智能”#

  • 2026 年 2 月 9 日:美区 Free/Go 用户开始测试广告(免费模式的商业化补充);
  • GPT-5.3-Codex-Spark(2026 年 2 月 12 日):首个实时编码模型,速度提升约 15 倍;
  • GPT-5.4(2026 年 3 月 5 日):1M token 上下文 + 计算机操作 + 工具搜索;3 月 18 日加推 5.4 mini;
  • GPT-5.5(2026 年 4 月 23 日):号称”迄今最智能”,擅长代码/研究/跨工具任务;5 月 5 日 GPT-5.5 Instant 成为默认模型,幻觉较 5.3 Instant 降 52.5%;同月配套 GPT-Rosalind(生命科学)、ChatGPT Images 2.0、Privacy Filter。

3. GPT-5.6:旗舰三档与 IPO#

  • 2026 年 6 月 8 日:秘密递交 S-1 启动 IPO
  • 2026 年 7 月 9 日:GPT-5.6 系列发布——旗舰 Sol、均衡 Terra、高性价比 Luna,新增 max/ultra(多智能体并行),Agents’ Last Exam 53.6 分,API Sol $5/$30;同日推出 ChatGPT Work,Codex 并入桌面端;
  • 2026 年 7 月 23 日:正式推出健康功能(美区 18+,可连接 Apple Health/病历)——产品边界从办公向个人数据服务扩张。

八、三条技术主线#

主线一:规模与扩展定律(Scaling Law)#

GPT-1(1.17 亿)→ GPT-2(15 亿)→ GPT-3(1750 亿)→ GPT-4(约 1.8 万亿,传闻)→ GPT-5 统一系统 → GPT-5.6 旗舰三档

  • GPT-3 用 1000 倍参数换来质变,确认”大力出奇迹”;
  • GPT-4 之后参数量不再是公开卖点,转向架构效率与推理时算力
  • 2025 年后竞争主轴变成 test-time compute(测试时计算)——训练规模撞墙后,把更多算力花在推理时的”思考”上(o 系列、GPT-5 的 Thinking 模式都是这一路线)。

主线二:对齐与推理(Alignment → Reasoning → Agent)#

预训练 → InstructGPT(RLHF)→ ChatGPT(RLHF 产品化)→ o1/o3(推理时 RL)→ GPT-5 统一模式 → Operator/ChatGPT Agent(智能体)

  • RLHF 阶段(2022):解决”如何让模型听人话”;
  • 推理阶段(2024):解决”如何让模型想清楚”——RL 从训练时的对齐工具变成训练推理能力的引擎;
  • 智能体阶段(2025–2026):解决”如何让模型干活”——从回答问题到操作浏览器、虚拟电脑、跨工具任务。

主线三:多模态统一#

纯文本(GPT-1~3)→ 视觉输入(GPT-4V)→ 语音/图像输出(GPT-4o 端到端)→ 视频生成(Sora)→ 原生图像生成(2025.03)→ 健康数据(2026)

  • GPT-4 是”多模态输入”(看得懂图);
  • GPT-4o 是”多模态原生”(一个网络吃全部模态,输入输出一体);
  • Sora 与图像生成则是”多模态创作”——OpenAI 从理解走向生成闭环。

九、ChatGPT 的启示:OpenAI 方法论(四条原则)#

  1. 规模先行,相信扩展定律——每一代模型都押注”更大 + 更多数据 + 更强对齐”的组合拳,GPT-3 到 GPT-4 的路径证明规模红利远未耗尽;
  2. 产品闭环,研究即产品——与 DeepSeek 的论文驱动不同,OpenAI 的每个技术节点都同步落地为产品(ChatGPT、API、GPTs、Agent),用真实用户反馈反哺研究;
  3. 迭代部署,边用边安全——GPT-2 的分阶段发布确立先例:不追求一次性完美,而是逐步开放、用真实世界做对齐测试(虽然伴随争议);
  4. 生态卡位,免费获客——GPT-4o 免费开放、API 连续降价(自 2022 年以来单 token 成本降 99%),用规模换取生态位,再通过订阅、API、企业服务与广告变现。

与 DeepSeek 的对照:DeepSeek 用”更少的计算”挑战闭源(效率路线),OpenAI 用”更多的算力 + 更快迭代”维持领先(规模与速度路线)。2025 年之后两条路线在”混合推理 + 免费开放”上开始趋同。


附录 A:完整时间线(一句话版)#

2015.12 OpenAI 成立 → 2018.06 GPT-1 → 2019.02 GPT-2 → 2019.03/07 OpenAI LP 转型 + 微软 10 亿 → 2020.05 GPT-3 → 2021.01 DALL-E/CLIP → 2021.07 Codex/Copilot → 2022.03 InstructGPT → 2022.09 Whisper → 2022.11.30 ChatGPT → 2023.02 Plus/Bing → 2023.03 GPT-4 → 2023.09 GPT-4V → 2023.10 DALL-E 3 → 2023.11 DevDay(Turbo/GPTs)→ 2023.11 董事会危机 → 2024.05 GPT-4o → 2024.09 o1 → 2024.10 估值 1570 亿 → 2024.12 o3/Sora 公测 → 2025.01 R1 冲击/Stargate/Operator → 2025.02 GPT-4.5 → 2025.04 o3/o4-mini → 2025.07 ChatGPT Agent → 2025.08 GPT-5 → 2025.09 Sora 2 → 2025.10 估值 5000 亿 → 2025.11 GPT-5.1 → 2025.12 GPT-5.2/ChatGPT Agent → 2026.02 GPT-5.3-Codex-Spark → 2026.03 GPT-5.4 → 2026.04 GPT-5.5 → 2026.06 S-1 → 2026.07 GPT-5.6


附录 B:主要信息来源#

  1. OpenAI 官方博客与模型发布页(chatgpt、gpt-4、gpt-4o、o1、gpt-5、gpt-5-1 等 index 页)
  2. GPT-3 论文:arXiv<2005>.14165《Language Models are Few-Shot Learners》
  3. InstructGPT 论文:arXiv<2203>.02155
  4. GPT-4 技术报告:arXiv<2303>.08774
  5. DALL-E 3 System Card:openai.com/papers/DALL_E_3_System_Card.pdf
  6. Stargate 官方公告:openai.com/index/announcing-the-stargate-project
  7. ChatGPT Release Notes:help.openai.com/en/articles/6825453-chatgpt-release-notes
  8. 主流媒体交叉验证:TechCrunch、Ars Technica、Britannica、Reuters、Bloomberg、Fortune(估值、融资、人事、监管)
  9. 第三方时间线:vectoringai.com、hidekazu-konishi.com(模型发布日历,交叉核对用)

附录 C:信息缺口与口径说明#

  1. GPT-4 参数量:1.8 万亿 MoE 属 SemiAnalysis 等第三方推测,未经 OpenAI 证实,文中已标注。
  2. 2025–2026 数据多为单源:GPT-5.3/5.4/5.5/5.6、广告测试、S-1、健康功能等为网络检索结果,多数来自官方 release notes 或官方 index 页,但部分细节(如”周活 9 亿”传闻)仅第三方来源,未获官方公告,文中未采纳。
  3. ChatGPT Agent 发布日:来源冲突(官方新闻页标 2025-08-28,主流媒体记 2025-07-17,2025-12-12 又有一轮重大发布),本文按主流媒体口径取 7 月,正式发布以 12 月为准。
  4. 用户数口径:2024 年 3 亿、2025 年 8 月 7 亿、10 月 8 亿均为 Altman/官方在不同场合宣布的口径,非同一统计体系,直接对比需谨慎。
  5. 估值口径:2023 年 860 亿为员工股份出售(非新股融资),2025 年 10 月 5000 亿为股票交易,两者性质不同,已分别注明。
  6. Codex 发布时间:多数来源为 2021 年 7 月(部分写 8 月);GitHub Copilot 2021 年 6 月为技术预览、2022 年 6 月正式版,本文取此口径。
  7. DALL-E 参数量(120 亿):仅单一综述来源,官方未公开,需进一步核实。
  8. 微软利润分成比例:正文”约 49%“为流传较广的媒体口径(The Information 等:收回投资前 75%、之后 49% 上限),条款细节各信源存在出入,实际未公开。
  9. OpenAI 2026 年下半年规划:GPT-6 截至 2026 年 8 月未发布,仅传闻(Altman 称间隔会短于 GPT-4→5 的 2.5 年);GPT-5.6 内部代号原传闻”Spud”→ 实为 5.5,存在反复。
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

ChatGPT发展史
https://mizuki-eaf.pages.dev/posts/chatgpt/chatgpt发展史/
作者
无名之子
发布于
2026-07-27
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录