mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1429 字
4 分钟
Grok-1.5:补推理短板
2026-07-06

Grok-1.5 模型解读:把推理短板补上的一代#

模型:Grok-1.5(xAI) 发布:2024-03-28(官方博客公告,随后在 X 平台上线) 定价:随 X Premium+ 订阅提供 这是 Grok 系列”从玩具走向工具”的一代。Grok-1 被诟病最多的短板——推理——在 1.5 上被重点修理:MATH 从 23.9% 干到 50.6%,翻了一倍还多。上下文也一口气从 8K 拉到 128K。参数量官方一个字没提,但能力提升肉眼可见。如果说 Grok-1 是”马斯克品牌的玩偶”,Grok-1.5 开始有”能干活”的迹象了。


一、引言:一次针对性极强的补课#

Grok-1 发布时最难看的就是数学推理——MATH 23.9%,被 GPT-4 吊起来打。xAI 显然听进去了社区的吐槽,2024 年 3 月 28 日发布的 Grok-1.5 就干了两件事:补推理、拉长上下文

二、架构:没说的比说的多#

Grok-1.5 的官方博客没有披露任何架构细节——参数量、是否 MoE、层数、数据量,一个字没提。外界只能合理推测:它大概率是 Grok-1 那套 JAX 自研栈的延续(同一套基础设施),MoE 架构应该也保留了(xAI 后来从未离开过稀疏路线)。

可以确认的信息只有两条:

  • 上下文从 8192 提升到 128K token(16 倍),长文档处理能力直接跃迁;
  • 基础能力全面升级,推理是重点改进方向。

这种”官方三缄其口”的做法后来成了 xAI 的常态——对比 OpenAI 的发布会和 DeepSeek 的论文,xAI 是”基准表格给全、技术细节保密”。好处是省事,坏处是第三方只能靠估算和拆解补全拼图。

三、成绩:数学翻倍,全面进档#

官方博客的基准表格(对比 Grok-1 与 GPT-4):

  • MATH 50.6%(Grok-1 为 23.9%,涨了 26.7 个点)——推理短板被显著修复;
  • GSM8K 90%
  • MMLU 81.3%(Grok-1 为 73%);
  • HumanEval 74.1%(Grok-1 为 63.2%);
  • 长上下文能力:官方演示了 128K 上下文下的文档理解。

横向对比:Grok-1.5 的 MMLU 81.3% 已经摸到 GPT-4 的脚后跟(GPT-4 约 86%),数学虽然还落后,但已经不再是”不能看”的水平。对一个发布仅 4 个月的模型家族来说,这个进步速度相当可观——它说明 xAI 的 JAX 自研栈迭代效率不低,补短板不用重写架构。

四、意义:从”玩偶”到”能用”#

Grok-1.5 的意义不在单个分数,而在定位转变:

  • 128K 上下文让它第一次能处理”整本书”级别的输入,企业级长文档场景开始可用;
  • 数学和代码的进步,让它从”聊天玩具”变成”有生产力的助手”;
  • 它也是 Grok 系列第一次明确把”推理”当成训练重心——这个重心此后一路加强,直到 Grok-3 的思维链和 Grok-4 的验证式推理。

还有一层容易被忽略的伏笔:1.5 发布仅两周后(4 月 12 日),xAI 就推出了多模态的 1.5V。这说明 1.5 家族是 xAI 第一次做”同一基座、多能力分支”的尝试——语言推理和多模态并行开发,这种组织方式后来延续了整个 Grok 系列。

收尾:我的一点看法#

Grok-1.5 是那种”没什么戏剧性、但很重要”的迭代。它没有爆点技术,没有惊悚参数,官方连架构都不肯说——但它证明了一件关键的事:xAI 的迭代速度是真的

从 2023 年 11 月 Grok-1 到 2024 年 3 月 Grok-1.5,四个月,数学翻倍、上下文扩 16 倍、MMLU 追到 GPT-4 边缘。这份迭代效率,靠的是自研栈和 12 人创始团队带出来的工程文化。后来的历史也印证了:Grok-2 在 8 月发布时直接追平 GPT-4o,Grok-3 在 2025 年 2 月登顶推理榜——这条”火箭式迭代”曲线,就是从 1.5 开始变陡的。

短板当然还在:数学 50.6% 放在 2024 年 3 月只能说”及格”,跟 Claude 3、Gemini 1.5 比仍有差距;且官方对架构保密,导致模型的可研究性大打折扣(对比 DeepSeek 每代都发论文,xAI 的”黑盒式发布”是社区长期的槽点)。但作为一个承上启下的版本,它把该补的短板补了,该探的路探了,任务完成得干净。


附:核心数据速查#

基本盘

项目数值
发布2024-03-28
上下文128K token(Grok-1 的 16 倍)
架构官方未披露(推断为 JAX 栈 MoE 延续)
参数量官方未披露
定价随 X Premium+ 订阅

官方基准(Grok-1 → Grok-1.5)

基准Grok-1Grok-1.5变化
MATH23.9%50.6%+26.7
GSM8K62.9%90%+27.1
MMLU73.0%81.3%+8.3
HumanEval63.2%74.1%+10.9

关键概念清单

  • MATH / GSM8K = 数学推理基准
  • MMLU = 多任务语言理解基准(知识面)
  • HumanEval = 代码生成基准
  • 128K 上下文 = 可一次处理约 10 万字输入
  • JAX 自研栈 = xAI 从零搭建的训练基础设施
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Grok-1.5:补推理短板
https://mizuki-eaf.pages.dev/posts/grok/grok-15补推理短板/
作者
无名之子
发布于
2026-07-06
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录