mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1802 字
5 分钟
Grok-4:RL 前移封神
2026-07-25

Grok-4 模型解读:把 RL 前移的”全球最智能”#

模型:Grok-4 / Grok-4 Heavy / Grok-4 Fast(xAI) 发布:2025-07-09(Grok-4 与 Heavy,直播);Grok 4 Fast 2025-09-25(官方博客) 定价:SuperGrok $30/月;SuperGrok Heavy $300/月;API $3/$15 每百万 token 这是 Grok 的”技术分水岭”。Grok-4 把强化学习(RL)从后训练阶段前移到预训练阶段——不是”训完再调教”,而是”边训边用奖励驱动”,行业管这叫验证式推理。代价是参数规模传闻到了 1.7T,AIME 2025 单代理 91.7%、Heavy 四代理直接干到 100%。它还是”全球最智能”这句营销口号的出处,也是 xAI 第一次把订阅卖到 $300/月。从这一代起,Grok 不再是”追平”,而是”定义”。


一、引言:Grok 3 之后的那个”大门”#

Grok-3 打开推理之门后,2025 年 7 月 9 日,xAI 直播发布了 Grok-4 和 Grok-4 Heavy,口号是”全球最智能的模型(the most intelligent model in the world)“。9 月 25 日又补上 Grok 4 Fast(低成本档)。

这一代的技术叙事变了:不再是”更大、更快”,而是”RL 前移”。

二、训练:预训练规模的大规模 RL#

Grok-4 的核心创新是在预训练阶段引入大规模强化学习(RL)——不是 DeepSeek-R1 那种”基座训完、再用 RL 调教”的后训练路线,而是把奖励信号直接织进预训练过程。官方口径的数据:

  • RL 算力投入较此前提升一个数量级,堆栈创新让训练算力效率提升约 6 倍
  • 可验证数据(数学、代码等有标准答案的任务)从单一领域扩展到多领域
  • 总训练量为 Grok-2 的 100 倍
  • 原生 RL 工具使用:代码解释器、网页检索、X 深度搜索,模型自己学着用工具。

⚠️ 参数量官方依旧不披露,第三方估算约 1.7T MoE(仅部分专家激活)——按这个量级,Grok-4 是当时单模型体量的天花板级存在。

业界把这种”RL 进入预训练”的路线称为验证式推理(verification-based reasoning)——⚠️ 这是解读用语,xAI 官方没有用这个措辞,但技术事实一致:模型在训练中就在学”如何验证自己的答案”。

三、成绩:单代理强,Heavy 离谱#

官方基准(对比 GPT-5、Claude Opus 4 等同期旗舰):

Grok-4(单代理)

  • AIME 2025 91.7%、GPQA Diamond 87.5%、HMMT 90.0%、LiveCodeBench 79.0%、USAMO 37.5%
  • HLE(Humanity’s Last Exam)25.4%(无工具)/ 41%(带工具);
  • ARC-AGI-2 15.9%——首个突破 10% 的闭源模型,通用推理能力的标志性数字;
  • Vending-Bench 净值 $4694.15(人类基线 $844)——真实世界赚钱能力评测,模型完胜人类。

Grok-4 Heavy(4 代理并行)

  • AIME 2025 100%、HLE 44.4% → 50.7%(文本子集 + 测试时计算,官方称首个破 50% 的模型)、GPQA Diamond 88.9%、USAMO 61.9%、HMMT 96.7%

注意口径:发展史里常写的”AIME 100%“是 Heavy 的 4 代理成绩,单代理 Grok-4 是 91.7%——xAI 用 Heavy 的分数做宣传,跟 Grok-3 时代 cons@64 的争议一脉相承。

Grok 4 Fast:主打成本效率——思维 token 少 40%、同性能成本降 98%;GPQA 85.7%、AIME 92.0%、HLE 20.0%;LMArena Search 匿名测试(代号 menlo)登顶第 1(Elo 1163)。

四、定价:AI 史上最贵的订阅#

Grok-4 的定价刷新了行业纪录:

  • SuperGrok $30/月(含 Grok-4);
  • SuperGrok Heavy $300/月(含 Grok-4 Heavy)——当时全球最贵的 AI 订阅档位;
  • API:$3/$15 每百万 token(输入/输出);
  • Fast 档:$0.20/$0.50,缓存 $0.05。

$300/月 的定价逻辑很直白:Heavy 用 4 个代理并行推理,算力成本是单代理的数倍,xAI 把”最强”明码标价。市场买不买账另说,但”顶级能力 = 顶级价格”的定价哲学从此确立。

五、争议与风波#

  • 极端言论风波:Grok-4 发布前后,Grok 被曝输出反犹极端言论,土耳其一度封禁、波兰提起举报——“太自由”的对话模型在合规层面再次翻车;
  • Grok-4-mini:⚠️ 未见官方独立发布记录(少数第三方资料提及,存疑),本文不纳入主线;
  • “全球最智能”的广告法问题:该口号被部分市场视为夸大宣传,但 xAI 我行我素。

收尾:我的一点看法#

Grok-4 是 xAI 技术路线的”成人礼”——从”堆算力”进化到”改训练范式”。预训练级 RL 这个方向,至今仍是 xAI 与 OpenAI(o 系列)、DeepSeek(R 系列)的最大差异点:DeepSeek 用 GRPO 做后训练 RL,OpenAI 用测试时计算(test-time compute),xAI 把 RL 直接烧进预训练。三条路线殊途同归,但 xAI 这条最烧钱——这也是为什么只有背靠 Colossus 和马斯克融资能力的 xAI 敢走。

我对 Grok-4 的整体评价是”技术满分、叙事打折”:单代理 91.7% 的 AIME 已经很能打,非要用 Heavy 的 100% 和 cons@64 式的口径宣传;$300/月 的价格与其说是商业策略,不如说是品牌姿态。但不可否认,验证式推理在 Grok 4.1 上结出了最甜的果实(幻觉率 -65%)——那才是这条路线真正的证明。


附:核心数据速查#

基本盘

项目数值
发布2025-07-09(Grok-4/Heavy);2025-09-25(Fast)
参数量官方未披露;第三方估算约 1.7T MoE(⚠️)
上下文256K(API);Fast 版 2M
训练预训练级大规模 RL;总训练量 = Grok-2 的 100 倍
定价SuperGrok $30/月;Heavy $300/月;API $3/$15

官方基准

基准Grok-4(单代理)Grok-4 Heavy(4 代理)
AIME 202591.7%100%
HLE25.4%(无工具)/41%(带工具)44.4%→50.7%
GPQA Diamond87.5%88.9%
USAMO37.5%61.9%
ARC-AGI-215.9%(首个破 10% 的闭源)

Grok 4 Fast

  • 定价 $0.20/$0.50;思维 token 少 40%、成本降 98%
  • GPQA 85.7%、AIME 92.0%、LMArena Search 第 1(Elo 1163)

关键概念清单

  • RL = Reinforcement Learning,强化学习
  • verification-based reasoning = 验证式推理(业界对预训练级 RL 的解读)
  • test-time compute = 测试时计算(推理阶段多花算力)
  • Heavy = 多代理并行的高算力档位
  • HLE = Humanity’s Last Exam,人类最后的考试(超难基准)
  • ARC-AGI-2 = 通用推理基准第二版
  • Vending-Bench = 真实世界”用模型赚钱”评测
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Grok-4:RL 前移封神
https://mizuki-eaf.pages.dev/posts/grok/grok-4rl-前移封神/
作者
无名之子
发布于
2026-07-25
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录