Grok 4.5 模型解读:把 Cursor 塞进训练数据的编程旗舰
模型:Grok 4.5(xAI / SpaceXAI) 发布:2026-07-08(API 上线;内部 Beta 06-28;正式公告 07-16) 定价:API $2/$6 每百万 token(缓存读 $0.50);约 80 tokens/s 这是 Grok 系列的第一个”编程向旗舰”。Grok 4.5 用全新 V9 基座(1.5T 参数),SWE-Bench Pro 64.7% 与 Claude Opus 4.8 只差 4.5 个点,但输出价只有人家的约 1/4——还顺手把 Cursor 的开发者会话数据(Anysphere 被 SpaceX 以 600 亿美元收购后的战利品)喂进了训练管线。它发布当天撞上 OpenAI 公开 GPT-5.6,把”编程 Agent 价格战”打到了白热化。
一、引言:一场被 GPT-5.6 抢了头条的发布
2026 年 7 月 8 日,Grok 4.5 的 API 正式上线(6 月 28 日已在 SpaceX/Tesla 内部 Beta,7 月 16 日官方公告)。巧的是同一天 OpenAI 公开了 GPT-5.6——两个”编程向旗舰”撞在同一天,媒体头条被 GPT-5.6 抢走,但真正改变市场价格的,是 Grok 4.5。
它也是 xAI 并入 SpaceX(更名 SpaceXAI)后发布的第一个旗舰模型,生来就带着”航天集团军”的气质。
二、基座:V9,1.5T 参数
- 全新 V9 基座,1.5T 参数——约为 Grok 4.3 所用 v8-small 的 3 倍,是 Grok 系列有明确口径的最大模型;
- 上下文缩至 500K(从 4.3 的 1M 回调——xAI 显然权衡了”长上下文 vs 能力密度”);
- 训练使用数万张 GB300 GPU;异步训练(agent 边推理边学习,训练与推理共用数据流);
- ⚠️ 速度口径:官方约 80 tokens/s;Artificial Analysis 实测约 91–119 t/s(TTFT 约 13.7s)。
三、训练:Cursor 数据的争议与真相
Grok 4.5 最出圈的是它的训练数据——真实 Cursor 开发者会话数据:
- 背景:2026 年 6 月 16 日,SpaceX 以 600 亿美元全股票收购 Anysphere(Cursor 母公司),Q3 交割——xAI 母公司买下了编程 IDE 的头号玩家;
- 官方明确:Cursor 数据用于补训(post-pretraining)而非预训练起点——不是”从 Cursor 语料从零训练”,而是把真实开发者的编码行为(修 bug、重构、跑测试的完整轨迹)灌进后训练阶段;
- 争议:Cursor 曾披露其旧代码快照意外混入训练集(数据污染,⚠️ 具体影响存疑);“用竞品生态的数据训模型”也让部分开发者反感。
这套”收购 IDE → 拿真实工作流数据 → 反哺模型”的闭环,是 2026 年 AI 行业最激进的数据策略——OpenAI 买不出 Cursor 这种数据,Anthropic 只能靠 Claude Code 自己的遥测,xAI 直接买断了最大数据源。
四、成绩:逼近 Opus 4.8,价格只有 1/4
xAI 自测基准(多数被 Artificial Analysis 独立复现):
- SWE-Bench Pro 64.7%(vs Claude Opus 4.8 的 69.2%、GPT-5.5 的 58.6%、Fable 5 的 80.4%);
- Terminal-Bench 2.1 83.3%;SWE-Bench Verified 86.6%;LiveCodeBench 87.4%;
- SWE Marathon 29%(第一);AA 智能指数 54(第 4/168,agentic 工具使用第一);
- token 效率:单编码任务平均 1.6 万 token vs Opus 4.8 的 6.7 万(约 4.2 倍省);AA 实测单编码任务成本约 $2.5(GPT-5.5 约 $5、Fable 5 约 $11.8)。
价格:API $2/$6,缓存读 $0.50——输出价约为 Opus 4.8 的 1/4。马斯克的原话:“Opus 4.7 级别,但快得多、便宜得多。“
五、发布生态:从 API 到全家桶
- 与 Cursor 全套餐捆绑(自家产品,深度集成);
- 开源 Grok Build(7 月 16 日,编程工具链);
- 接入 GitHub Copilot、Google Workspace、Office 插件全渠道分发。
六、争议
- 幻觉问题:AA-Omniscience 评测显示幻觉率 25% → 54%——越自信的场合越容易出错,对编程模型是硬伤;
- EU 缺席:首发不含欧盟(7 月 17 日补上线),合规进度落后;
- SWE-Bench Pro 基准本身:它是 Scale AI 的 1865 题多文件基准(平均 4.1 文件/107 行),因 SWE-Bench Verified 污染问题(2025 年起)而成为新标准——Grok 4.5 在这个”新标准”上拿 64.7%,含金量需时间检验。
收尾:我的一点看法
Grok 4.5 是”收购 + 数据 + 价格”三位一体的教科书案例。它让我重新理解了 SpaceX 为什么要花 600 亿美元买 Cursor:买的不只是 IDE 的用户,是训练下一代编程模型的数据命脉。Grok 4.5 的 SWE-Bench Pro 64.7% 有 Cursor 会话数据的功劳,这个数据优势在 2027 年只会越滚越大。
价格上它更是把编程 Agent 市场打穿了——Opus 4.8 的 1/4 价格、4 倍 token 效率,等于告诉所有开发者”同样的活,用 Grok 只要零头”。Anthropic 当时约占编码助手营收的一半,Grok 4.5 就是冲着这块蛋糕去的。
但我不认为它已经赢了。幻觉率 25%→54% 是个危险信号:编程场景里”自信地写错代码”比”承认不会”贵得多;SWE-Bench Pro 64.7% 与 Opus 4.8 的 69.2%、Fable 5 的 80.4% 仍有代差;而且”编程向旗舰”意味着它牺牲了通用性——一个只会写代码的 1.5T 模型,在 2026 年的全能时代能走多远,要打问号。不过,作为 SpaceXAI 时代的第一份答卷,它足够凶悍:数据、价格、生态三张牌全押上桌了。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 发布 | 2026-07-08(API);07-16(公告) |
| 基座 | V9,1.5T 参数(4.3 的 v8-small 的 3 倍) |
| 上下文 | 500K |
| 速度 | 官方约 80 t/s;AA 实测 91–119 t/s |
| 定价 | $2/$6(缓存 $0.50) |
关键基准(xAI 自测,AA 多数复现)
| 基准 | Grok 4.5 | 对比 |
|---|---|---|
| SWE-Bench Pro | 64.7% | Opus 4.8 69.2%;Fable 5 80.4%;GPT-5.5 58.6% |
| SWE-Bench Verified | 86.6% | — |
| Terminal-Bench 2.1 | 83.3% | — |
| SWE Marathon | 29%(第一) | — |
| AA 智能指数 | 54(agentic 工具使用第一) | GPT-5.5 60 / Opus 4.7 57 |
| 单任务成本 | 约 $2.5 | GPT-5.5 约 $5;Fable 5 约 $11.8 |
关键事件
- 2026-06-16 SpaceX 以 $600 亿收购 Anysphere(Cursor)
- 训练引入真实 Cursor 开发者会话数据(补训)
- 2026-07-08 同日 OpenAI 公开 GPT-5.6
关键概念清单
- SWE-Bench Pro = Scale AI 的多文件软件工程基准(2025.8 发布)
- 编程向旗舰 = coding-first,以编程能力为第一优先的旗舰模型
- 异步训练 = agent 边推理边学习的训练方式
- TTFT = Time To First Token,首个 token 生成延迟
- token 效率 = 完成同一任务消耗的 token 数
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





