mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1823 字
5 分钟
Grok-3:20 万卡堆冠军
2026-08-05

Grok-3 模型解读:20 万 GPU 堆出的推理冠军#

模型:Grok-3 / Grok-3 mini / Grok-3 Fast(xAI) 发布:2025-02-17(马斯克直播发布;官方博客 02-19) 定价:X Premium+ 用户优先,随后 API 开放;2025 年 3 月起免费用户可用 这是 Grok 系列真正封神的一代。20 万张 GPU、Grok-2 十倍的训练算力、第一个思维链(Think 模式)、LMArena Elo 1402 首次破 1400——Grok-3 把”算力军备竞赛”这条路走到了极致,也第一次在推理基准上压过了 o3-mini。争议同样拉满:cons@64 对比口径被喷、Big Brain 模式画饼不兑现、系统提示词翻车。它既是 xAI 技术的顶点,也是 xAI 营销争议的巅峰。


一、引言:一场直播发布的”算力秀”#

2025 年 2 月 17 日,马斯克带着团队搞了一场直播发布会,当场演示 Grok-3 解题。这本身就很”马斯克”——不用文字博客,用直播,带弹幕。

但真正震撼行业的是训练规模:20 万张 NVIDIA GPU(Colossus 集群,122 天建成),训练算力是 Grok-2 的 10 倍。这个数字放在当时是什么概念?DeepSeek-V3 用 2.788M H800 GPU 小时(约 557 万美元)训出了 671B 模型;xAI 是反着来的——不省算力,往死里堆。两家公司在 2025 年初正面撞上,成了”效率路线 vs 资源路线”的教科书级对照。

二、能力:思维链 + DeepSearch#

Grok-3 第一次给 Grok 系列装上了思维链(Chain-of-Thought,CoT)推理

  • Think 模式:像 o1 一样”先想后答”,把推理过程展开再给结论;
  • DeepSearch:一个深度搜索智能体——先拆解问题、检索 X/网络、交叉验证、再综合回答,相当于”带搜索的 Agent”;
  • 语音模式、图像理解同步上线;
  • ⚠️ 澄清一个流传很广的误传:Grok-3 的上下文不是 1M,API 实际是 131K。各家营销号以讹传讹,官方从未给 Grok-3 开 1M 上下文。

三、成绩:首次破 1400 的 Elo#

官方基准(对比 o3-mini / Gemini 2 Flash Thinking):

  • AIME 2025 93.3%(cons@64)、AIME’24 与 GPQA Diamond 84.6%、LiveCodeBench 79.4%
  • LMArena Elo 1402——史上第一个破 1400 的模型;
  • Grok-3 mini:AIME’24 95.8%(cons@64)、LiveCodeBench 80.4%
  • 后续版本:Grok 3 Fast 于 2025 年 4 月随 API 上线(轻量高速档),DeepSearch 2025 年 3 月向 Premium 用户开放。

从纯数字看,Grok-3 在数学、代码、竞技场三条线上同时登顶,把 OpenAI 的 o3-mini、谷歌的 Gemini 2 Flash Thinking 都压在身下——这是 xAI 第一次”全面超越”而非”追平”。

四、争议:三连翻车#

Grok-3 的发布伴随三场争议,每一场都值得记录:

  1. cons@64 口径之争:xAI 拿”64 次采样取众数(cons@64)“的 Grok-3 去对比 o3-mini 的单次输出(cons@1)——这不是同一起跑线,被社区喷”胜之不武”。后来 OpenAI 的 o3-mini 用相同口径反超,xAI 的宣传被打脸。同口径才是硬道理,xAI 这波营销吃相难看。

  2. Big Brain 画饼:发布时宣布的”Big Brain”模式(更高算力的推理档位)此后从未上线,成为 xAI 著名的”PPT 功能”。

  3. 系统提示词风波:2025 年 2 月 20 日,Grok-3 的系统提示词被曝包含”忽略提及马斯克/特朗普的传谣来源”等规则,舆论哗然;xAI 工程主管回应是”个别员工行为”。此事直接催生了后来 Grok 的”去政治化”路线(2025 年 5 月核心信念改为”追求真理与中立”)。

五、意义:算力路线的总决战#

Grok-3 的历史意义要放在 2025 年初的行业格局里看:

  • 它是”资源至上”路线的巅峰证明:20 万 GPU + 思维链 + 大规模 RL,确实把推理能力堆到了世界第一——证明只要算力够猛,后来者也能在半年内追上 o1;
  • 它是”效率至上”路线的反衬:同期 DeepSeek-R1 用 2048 张 H800 训出世界级推理,成本差了两个数量级。两相对照,行业第一次认真讨论”算力军备竞赛是否可持续”;
  • 它把 xAI 送进第一集团:Grok-3 之后,xAI 与 OpenAI、Anthropic、谷歌并列,成了”五大”之一,估值火箭式上升(2025 年 7 月到 1500 亿美元)。

收尾:我的一点看法#

Grok-3 是 xAI 的”梭哈之作”——把公司几乎全部资源押在一个模型上,赌”堆算力 + 思维链 + RL 就能登顶”,赌赢了。从技术史看,它和 DeepSeek-R1 是 2025 年推理革命的双生子:一个证明”大力出奇迹”,一个证明”巧力也能出奇迹”,合起来把”推理模型”从概念推成了标配。

但我不太喜欢它背后的营销文化。cons@64 对比、Big Brain 画饼、系统提示词风波——连续三次在”诚实性”上失分。这跟 DeepSeek 论文里那种严谨形成鲜明反差。技术可以激进,营销不能造假,xAI 在 Grok-3 上把两者混为一谈,代价是长期公信力。

技术层面它的遗产是清晰的:思维链 + 大规模 RL + 实时搜索的组合,直接铺出了 Grok-4 的”验证式推理”路线。Grok-3 是那个”打开推理之门”的版本——门后有什么,5 个月后 Grok-4 给出了答案。


附:核心数据速查#

基本盘

项目数值
发布2025-02-17(直播)/ 官方博客 02-19
训练规模20 万 GPU(Colossus),算力为 Grok-2 的 10 倍
上下文131K(API;⚠️ 非 1M)
推理模式Think(思维链)+ DeepSearch 智能体
版本Grok-3 / Grok-3 mini / Grok-3 Fast(2025-04)

官方基准(vs o3-mini 等)

基准Grok-3Grok-3 mini
AIME 202593.3%(cons@64)
AIME’2495.8%(cons@64)
GPQA Diamond84.6%
LiveCodeBench79.4%80.4%
LMArena Elo1402(首个破 1400)

争议清单

  • cons@64 vs o3-mini cons@1 对比口径问题
  • Big Brain 模式宣布后未上线
  • 系统提示词”忽略传谣来源”风波(2025-02-20)
  • 后续:2025-05 核心信念改为”追求真理与中立”

关键概念清单

  • CoT = Chain-of-Thought,思维链(先推理后回答)
  • DeepSearch = 深度搜索智能体(检索 + 验证 + 综合)
  • cons@64 = 64 次采样取众数(提高得分但费算力)
  • Elo = 竞技场排名积分
  • Colossus = xAI 自建超算集群
  • Big Brain = 未兑现的高算力推理模式
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Grok-3:20 万卡堆冠军
https://mizuki-eaf.pages.dev/posts/grok/grok-320-万卡堆冠军/
作者
无名之子
发布于
2026-08-05
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录