mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1651 字
5 分钟
Grok Code:编程也拼价格
2026-07-12

Grok Code 模型解读:把编程做成”速度 + 白菜价”#

模型:grok-code-fast-1(xAI,Grok Code 系列首作) 发布:2025-08-28(正式);此前一周以代号 “Sonic” 静默上线 定价:$0.20/$1.50/$0.02 每百万 token(输入/输出/缓存输入) 这是 xAI 第一次为”场景”而不是为”全能”造模型。Grok Code 不做全知全能,只做一件事:agentic coding——像程序员一样自己搜代码、改文件、跑测试。SWE-Bench Verified 70.8% 是当时第一梯队(和 GPT-5 的 74.9%、Claude Sonnet 4 的 72.7% 同台),但更狠的是价格——输出 token 比同级便宜 80-95%,外加 90%+ 的缓存命中率。它把”编程模型的竞争维度”从分数拉到了成本,是 2025 年编程 Agent 价格战的开幕者。


一、引言:安静地投下一颗炸弹#

2025 年 8 月 28 日,xAI 发布 grok-code-fast-1。没有直播、没有大场面,就是一篇博客加一个 API——但它安静得很成功:发布前一周,这个模型以代号 “Sonic” 在 GitHub Copilot、Cursor 等 IDE 里静默上线,让开发者白嫖反馈,团队按社区意见连更了好几个 checkpoint 才正式官宣。这种”先偷跑、再发布”的打法,在 AI 圈独一份。

二、定位:为 agentic coding 而生#

Grok Code 的目标不是”帮你写一段代码”,而是”替你干完整个编码任务”——像人类程序员那样:用 grep 搜代码库、操作终端、编辑文件、跑测试、自我纠错。官方说它是”从全新架构从零训练”:

  • 预训练语料以编程内容为主,后训练数据来自真实 pull request 和编码任务
  • 上下文 256K,工具调用(function calling)是训练重心;
  • ⚠️ 参数量官方未披露,第三方推断约 314B MoE(存疑)。

三、成绩:不是榜首,但稳得可怕#

核心基准 SWE-Bench Verified 70.8%(xAI 内部评测 harness):

  • 第三方 BenchLM 榜单给出同样的 70.8%——官方与第三方数字罕见地完全一致,可信度拉满;
  • 同期对比:GPT-5 74.9%、Claude Sonnet 4 72.7%——Grok Code 排在后面,但差距在个位数百分点;
  • 90%+ 的提示缓存命中率:agentic 场景下反复调用同一上下文,缓存让成本进一步暴跌。

速度口径很有意思,三家测出三个数:

来源速度
xAI 官方宣传图190 tokens/s(对比 Gemini 2.5 Pro 92、GPT-5 50.1)
xAI 模型卡约 92 tokens/s
Artificial Analysis 实测约 110.6 tokens/s

官方宣传图的 190 明显注水,实测 110 左右依然是第一梯队——快是真的,但没快到官方吹的两倍

四、价格:掀桌子的那一刀#

Grok Code 真正让行业紧张的是价格:

  • 输入 $0.20、输出 $1.50、缓存输入 $0.02 每百万 token;
  • 输出价比 Claude Sonnet 4、GPT-5 低 80-95%
  • 首发即接入 GitHub Copilot、Cursor、Cline、Kilo Code、Roo Code、opencode、Windsurf 七家 IDE/工具,限时免费。

“速度 × 性价比”的组合拳,直接把编程模型从”看谁分数高”拉进”看谁成本低”的新战场。xAI 的算力自建优势在这里兑现了——Colossus 的规模效应让推理成本低到别人跟不动。

五、影响:编程 Agent 价格战的开幕#

Grok Code 发布后两个月内,编程模型市场进入”性价比竞赛”:各家纷纷降价、出 fast 档。它的历史定位有三层:

  1. 场景专用化的先行者:xAI 第一个把”全能旗舰”和”场景专用”分家(后面 Grok 4.5 直接做成编程向旗舰);
  2. 价格战的引爆点:$1.50/M 的输出价让”用顶级编程模型”的成本门槛骤降一个数量级;
  3. agentic 工作流的模板:工具调用、缓存优化、IDE 集成三件套,成了后来所有编程模型的标配。

收尾:我的一点看法#

Grok Code 是一篇”四两拨千斤”的解读——xAI 没把它当主角宣传,但它对行业的影响比同期的大模型发布都实在。

我最欣赏它的一点是诚实:70.8% 的 SWE-Bench 官方和第三方数字一致,没玩 cons@64 那套花活;模型卡里的 92 tokens/s 也比宣传图的 190 实诚。这种”做工具的态度”和 Grok-4 的营销风格形成鲜明对比——也许正是因为定位是”给开发者用的工具”,xAI 才收敛了表演欲。

短板也清楚:它不是 SWE-Bench 榜首(GPT-5、Claude 4.5 系列更高),“快和便宜”换不来”最强”;314B 的体量在长任务、复杂架构改造上仍有瓶颈;而且它依赖 IDE 生态,自己没有独立入口。但对”日常 agentic 编码”这个最大众的场景,它用 1/5 的价格提供了 90% 的能力——这笔账,开发者算得过来。


附:核心数据速查#

基本盘

项目数值
发布2025-08-28(代号 Sonic,前一周静默上线)
定位agentic coding(自主搜索/编辑/测试代码库)
上下文256K
参数量官方未披露;第三方推断约 314B MoE(⚠️)
工具grep、终端、文件编辑(function calling)

基准与性能

项目数值
SWE-Bench Verified70.8%(xAI harness 与 BenchLM 第三方一致)
同期对比GPT-5 74.9%;Claude Sonnet 4 72.7%
缓存命中率90%+
实测速度约 110 tokens/s(AA 实测;官方宣传 190 ⚠️注水)

定价(每百万 token)

  • 输入 $0.20;输出 $1.50;缓存输入 $0.02
  • 输出价较同级低 80-95%

关键概念清单

  • agentic coding = 自主编码(模型独立完成搜索/编辑/测试)
  • SWE-Bench Verified = 软件工程任务基准(修复真实 GitHub issue)
  • function calling = 函数调用(模型调用外部工具)
  • prompt caching = 提示缓存(重复上下文低成本复用)
  • tokens/s = 每秒生成 token 数
  • IDE = 集成开发环境
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Grok Code:编程也拼价格
https://mizuki-eaf.pages.dev/posts/grok/grok-code编程也拼价格/
作者
无名之子
发布于
2026-07-12
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录