Grok Code 模型解读:把编程做成”速度 + 白菜价”
模型:grok-code-fast-1(xAI,Grok Code 系列首作) 发布:2025-08-28(正式);此前一周以代号 “Sonic” 静默上线 定价:$0.20/$1.50/$0.02 每百万 token(输入/输出/缓存输入) 这是 xAI 第一次为”场景”而不是为”全能”造模型。Grok Code 不做全知全能,只做一件事:agentic coding——像程序员一样自己搜代码、改文件、跑测试。SWE-Bench Verified 70.8% 是当时第一梯队(和 GPT-5 的 74.9%、Claude Sonnet 4 的 72.7% 同台),但更狠的是价格——输出 token 比同级便宜 80-95%,外加 90%+ 的缓存命中率。它把”编程模型的竞争维度”从分数拉到了成本,是 2025 年编程 Agent 价格战的开幕者。
一、引言:安静地投下一颗炸弹
2025 年 8 月 28 日,xAI 发布 grok-code-fast-1。没有直播、没有大场面,就是一篇博客加一个 API——但它安静得很成功:发布前一周,这个模型以代号 “Sonic” 在 GitHub Copilot、Cursor 等 IDE 里静默上线,让开发者白嫖反馈,团队按社区意见连更了好几个 checkpoint 才正式官宣。这种”先偷跑、再发布”的打法,在 AI 圈独一份。
二、定位:为 agentic coding 而生
Grok Code 的目标不是”帮你写一段代码”,而是”替你干完整个编码任务”——像人类程序员那样:用 grep 搜代码库、操作终端、编辑文件、跑测试、自我纠错。官方说它是”从全新架构从零训练”:
- 预训练语料以编程内容为主,后训练数据来自真实 pull request 和编码任务;
- 上下文 256K,工具调用(function calling)是训练重心;
- ⚠️ 参数量官方未披露,第三方推断约 314B MoE(存疑)。
三、成绩:不是榜首,但稳得可怕
核心基准 SWE-Bench Verified 70.8%(xAI 内部评测 harness):
- 第三方 BenchLM 榜单给出同样的 70.8%——官方与第三方数字罕见地完全一致,可信度拉满;
- 同期对比:GPT-5 74.9%、Claude Sonnet 4 72.7%——Grok Code 排在后面,但差距在个位数百分点;
- 90%+ 的提示缓存命中率:agentic 场景下反复调用同一上下文,缓存让成本进一步暴跌。
速度口径很有意思,三家测出三个数:
| 来源 | 速度 |
|---|---|
| xAI 官方宣传图 | 190 tokens/s(对比 Gemini 2.5 Pro 92、GPT-5 50.1) |
| xAI 模型卡 | 约 92 tokens/s |
| Artificial Analysis 实测 | 约 110.6 tokens/s |
官方宣传图的 190 明显注水,实测 110 左右依然是第一梯队——快是真的,但没快到官方吹的两倍。
四、价格:掀桌子的那一刀
Grok Code 真正让行业紧张的是价格:
- 输入 $0.20、输出 $1.50、缓存输入 $0.02 每百万 token;
- 输出价比 Claude Sonnet 4、GPT-5 低 80-95%;
- 首发即接入 GitHub Copilot、Cursor、Cline、Kilo Code、Roo Code、opencode、Windsurf 七家 IDE/工具,限时免费。
“速度 × 性价比”的组合拳,直接把编程模型从”看谁分数高”拉进”看谁成本低”的新战场。xAI 的算力自建优势在这里兑现了——Colossus 的规模效应让推理成本低到别人跟不动。
五、影响:编程 Agent 价格战的开幕
Grok Code 发布后两个月内,编程模型市场进入”性价比竞赛”:各家纷纷降价、出 fast 档。它的历史定位有三层:
- 场景专用化的先行者:xAI 第一个把”全能旗舰”和”场景专用”分家(后面 Grok 4.5 直接做成编程向旗舰);
- 价格战的引爆点:$1.50/M 的输出价让”用顶级编程模型”的成本门槛骤降一个数量级;
- agentic 工作流的模板:工具调用、缓存优化、IDE 集成三件套,成了后来所有编程模型的标配。
收尾:我的一点看法
Grok Code 是一篇”四两拨千斤”的解读——xAI 没把它当主角宣传,但它对行业的影响比同期的大模型发布都实在。
我最欣赏它的一点是诚实:70.8% 的 SWE-Bench 官方和第三方数字一致,没玩 cons@64 那套花活;模型卡里的 92 tokens/s 也比宣传图的 190 实诚。这种”做工具的态度”和 Grok-4 的营销风格形成鲜明对比——也许正是因为定位是”给开发者用的工具”,xAI 才收敛了表演欲。
短板也清楚:它不是 SWE-Bench 榜首(GPT-5、Claude 4.5 系列更高),“快和便宜”换不来”最强”;314B 的体量在长任务、复杂架构改造上仍有瓶颈;而且它依赖 IDE 生态,自己没有独立入口。但对”日常 agentic 编码”这个最大众的场景,它用 1/5 的价格提供了 90% 的能力——这笔账,开发者算得过来。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 发布 | 2025-08-28(代号 Sonic,前一周静默上线) |
| 定位 | agentic coding(自主搜索/编辑/测试代码库) |
| 上下文 | 256K |
| 参数量 | 官方未披露;第三方推断约 314B MoE(⚠️) |
| 工具 | grep、终端、文件编辑(function calling) |
基准与性能
| 项目 | 数值 |
|---|---|
| SWE-Bench Verified | 70.8%(xAI harness 与 BenchLM 第三方一致) |
| 同期对比 | GPT-5 74.9%;Claude Sonnet 4 72.7% |
| 缓存命中率 | 90%+ |
| 实测速度 | 约 110 tokens/s(AA 实测;官方宣传 190 ⚠️注水) |
定价(每百万 token)
- 输入 $0.20;输出 $1.50;缓存输入 $0.02
- 输出价较同级低 80-95%
关键概念清单
- agentic coding = 自主编码(模型独立完成搜索/编辑/测试)
- SWE-Bench Verified = 软件工程任务基准(修复真实 GitHub issue)
- function calling = 函数调用(模型调用外部工具)
- prompt caching = 提示缓存(重复上下文低成本复用)
- tokens/s = 每秒生成 token 数
- IDE = 集成开发环境
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





