Grok-4 模型解读:把 RL 前移的”全球最智能”
模型:Grok-4 / Grok-4 Heavy / Grok-4 Fast(xAI) 发布:2025-07-09(Grok-4 与 Heavy,直播);Grok 4 Fast 2025-09-25(官方博客) 定价:SuperGrok $30/月;SuperGrok Heavy $300/月;API $3/$15 每百万 token 这是 Grok 的”技术分水岭”。Grok-4 把强化学习(RL)从后训练阶段前移到预训练阶段——不是”训完再调教”,而是”边训边用奖励驱动”,行业管这叫验证式推理。代价是参数规模传闻到了 1.7T,AIME 2025 单代理 91.7%、Heavy 四代理直接干到 100%。它还是”全球最智能”这句营销口号的出处,也是 xAI 第一次把订阅卖到 $300/月。从这一代起,Grok 不再是”追平”,而是”定义”。
一、引言:Grok 3 之后的那个”大门”
Grok-3 打开推理之门后,2025 年 7 月 9 日,xAI 直播发布了 Grok-4 和 Grok-4 Heavy,口号是”全球最智能的模型(the most intelligent model in the world)“。9 月 25 日又补上 Grok 4 Fast(低成本档)。
这一代的技术叙事变了:不再是”更大、更快”,而是”RL 前移”。
二、训练:预训练规模的大规模 RL
Grok-4 的核心创新是在预训练阶段引入大规模强化学习(RL)——不是 DeepSeek-R1 那种”基座训完、再用 RL 调教”的后训练路线,而是把奖励信号直接织进预训练过程。官方口径的数据:
- RL 算力投入较此前提升一个数量级,堆栈创新让训练算力效率提升约 6 倍;
- 可验证数据(数学、代码等有标准答案的任务)从单一领域扩展到多领域;
- 总训练量为 Grok-2 的 100 倍;
- 原生 RL 工具使用:代码解释器、网页检索、X 深度搜索,模型自己学着用工具。
⚠️ 参数量官方依旧不披露,第三方估算约 1.7T MoE(仅部分专家激活)——按这个量级,Grok-4 是当时单模型体量的天花板级存在。
业界把这种”RL 进入预训练”的路线称为验证式推理(verification-based reasoning)——⚠️ 这是解读用语,xAI 官方没有用这个措辞,但技术事实一致:模型在训练中就在学”如何验证自己的答案”。
三、成绩:单代理强,Heavy 离谱
官方基准(对比 GPT-5、Claude Opus 4 等同期旗舰):
Grok-4(单代理)
- AIME 2025 91.7%、GPQA Diamond 87.5%、HMMT 90.0%、LiveCodeBench 79.0%、USAMO 37.5%;
- HLE(Humanity’s Last Exam)25.4%(无工具)/ 41%(带工具);
- ARC-AGI-2 15.9%——首个突破 10% 的闭源模型,通用推理能力的标志性数字;
- Vending-Bench 净值 $4694.15(人类基线 $844)——真实世界赚钱能力评测,模型完胜人类。
Grok-4 Heavy(4 代理并行)
- AIME 2025 100%、HLE 44.4% → 50.7%(文本子集 + 测试时计算,官方称首个破 50% 的模型)、GPQA Diamond 88.9%、USAMO 61.9%、HMMT 96.7%。
注意口径:发展史里常写的”AIME 100%“是 Heavy 的 4 代理成绩,单代理 Grok-4 是 91.7%——xAI 用 Heavy 的分数做宣传,跟 Grok-3 时代 cons@64 的争议一脉相承。
Grok 4 Fast:主打成本效率——思维 token 少 40%、同性能成本降 98%;GPQA 85.7%、AIME 92.0%、HLE 20.0%;LMArena Search 匿名测试(代号 menlo)登顶第 1(Elo 1163)。
四、定价:AI 史上最贵的订阅
Grok-4 的定价刷新了行业纪录:
- SuperGrok $30/月(含 Grok-4);
- SuperGrok Heavy $300/月(含 Grok-4 Heavy)——当时全球最贵的 AI 订阅档位;
- API:$3/$15 每百万 token(输入/输出);
- Fast 档:$0.20/$0.50,缓存 $0.05。
$300/月 的定价逻辑很直白:Heavy 用 4 个代理并行推理,算力成本是单代理的数倍,xAI 把”最强”明码标价。市场买不买账另说,但”顶级能力 = 顶级价格”的定价哲学从此确立。
五、争议与风波
- 极端言论风波:Grok-4 发布前后,Grok 被曝输出反犹极端言论,土耳其一度封禁、波兰提起举报——“太自由”的对话模型在合规层面再次翻车;
- Grok-4-mini:⚠️ 未见官方独立发布记录(少数第三方资料提及,存疑),本文不纳入主线;
- “全球最智能”的广告法问题:该口号被部分市场视为夸大宣传,但 xAI 我行我素。
收尾:我的一点看法
Grok-4 是 xAI 技术路线的”成人礼”——从”堆算力”进化到”改训练范式”。预训练级 RL 这个方向,至今仍是 xAI 与 OpenAI(o 系列)、DeepSeek(R 系列)的最大差异点:DeepSeek 用 GRPO 做后训练 RL,OpenAI 用测试时计算(test-time compute),xAI 把 RL 直接烧进预训练。三条路线殊途同归,但 xAI 这条最烧钱——这也是为什么只有背靠 Colossus 和马斯克融资能力的 xAI 敢走。
我对 Grok-4 的整体评价是”技术满分、叙事打折”:单代理 91.7% 的 AIME 已经很能打,非要用 Heavy 的 100% 和 cons@64 式的口径宣传;$300/月 的价格与其说是商业策略,不如说是品牌姿态。但不可否认,验证式推理在 Grok 4.1 上结出了最甜的果实(幻觉率 -65%)——那才是这条路线真正的证明。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 发布 | 2025-07-09(Grok-4/Heavy);2025-09-25(Fast) |
| 参数量 | 官方未披露;第三方估算约 1.7T MoE(⚠️) |
| 上下文 | 256K(API);Fast 版 2M |
| 训练 | 预训练级大规模 RL;总训练量 = Grok-2 的 100 倍 |
| 定价 | SuperGrok $30/月;Heavy $300/月;API $3/$15 |
官方基准
| 基准 | Grok-4(单代理) | Grok-4 Heavy(4 代理) |
|---|---|---|
| AIME 2025 | 91.7% | 100% |
| HLE | 25.4%(无工具)/41%(带工具) | 44.4%→50.7% |
| GPQA Diamond | 87.5% | 88.9% |
| USAMO | 37.5% | 61.9% |
| ARC-AGI-2 | 15.9%(首个破 10% 的闭源) | — |
Grok 4 Fast
- 定价 $0.20/$0.50;思维 token 少 40%、成本降 98%
- GPQA 85.7%、AIME 92.0%、LMArena Search 第 1(Elo 1163)
关键概念清单
- RL = Reinforcement Learning,强化学习
- verification-based reasoning = 验证式推理(业界对预训练级 RL 的解读)
- test-time compute = 测试时计算(推理阶段多花算力)
- Heavy = 多代理并行的高算力档位
- HLE = Humanity’s Last Exam,人类最后的考试(超难基准)
- ARC-AGI-2 = 通用推理基准第二版
- Vending-Bench = 真实世界”用模型赚钱”评测
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





