mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1819 字
5 分钟
Grok 4.1:只动后训练
2026-07-13

Grok 4.1 模型解读:不动架构,只动后训练的胜利#

模型:Grok 4.1 / Grok 4.1-Fast(xAI) 发布:2025-11-17(4.1 全量开放,含免费用户);11-19(4.1-Fast + Agent Tools API) 定价:输入 $0.20、输出 $0.50、缓存 $0.05 每百万 token;Agent Tools 每千次调用 $5 这是 2025 年”后训练价值”的巅峰证明。Grok 4.1 没有换基座、没有加参数——就是把 RLHF 后训练彻底重做了一遍,结果幻觉率从 12.09% 砍到 4.22%(-65%),LMArena 双榜登顶(Thinking 1483 Elo 史上第一)。它证明了在架构接近上限的年代,对齐与后训练就是性价比最高的”智能来源”。同期发布的 Agent Tools API 则标志着 xAI 从”卖模型”转向”卖工具”。


一、引言:最安静的版本,最狠的提升#

2025 年 11 月 17 日,xAI 把 Grok 4.1 悄悄推给所有用户(含免费用户,Auto 模式默认开启)。此前 11 月 1 日到 14 日,它已经以灰度形式静默测试了两周。没有发布会、没有大词,官方博客的标题只有一句话:“重做后训练(a complete post-training overhaul)”

两天后(11 月 19 日),Grok 4.1-Fast(2M 上下文版本)和 Agent Tools API 一起上线。

二、训练:非新架构,新后训练#

Grok 4.1 的基座还是 Grok-4,但 xAI 把整个后训练管线推倒重来

  • 沿用 Grok-4 的大规模 RL 基础设施,重点优化风格、个性、对齐等不可验证信号(可验证的数学/代码已经在上代练好了);
  • 关键创新:以前沿智能体推理模型作为奖励模型(reward model),让 AI 评委自主评估、迭代输出——不再依赖人工标注偏好;
  • 叠加可验证奖励:有标准答案的任务用规则判分,没有标准答案的任务用 AI 评委打分,两套信号混合驱动。

一句话概括:“让最聪明的模型当裁判,教下一个模型变得更聪明。” 这套”AI 教 AI”的循环,是 4.1 提升的核心引擎。

三、成绩:幻觉率 -65%,LMArena 双冠#

官方基准,每一项都打在”对齐质量”上:

  • 幻觉率 12.09% → 4.22%(降 65%);FActScore 错误率 9.89 → 2.97(降 70%)——事实性显著提升;
  • 盲测偏好 64.78%(人类评委更爱 4.1 而非 4);
  • LMArena:Thinking 版(代号 quasarflux)Elo 1483 登顶,比非 xAI 的最高分高出 31 分;非推理版(代号 tensor)1465 第二,且超过所有竞品的完整推理配置;
  • EQ-Bench3 1586 第一、Creative Writing v3 1722;
  • ⚠️ AIME / GPQA 官方未披露(第三方数据混乱,存疑,本文不引用)。

Grok 4.1-Fast(2M 上下文,含 reasoning / non-reasoning 两个变体):τ²-bench Telecom 100%、Berkeley Function Calling v4 72%、幻觉率较 4 Fast 减半。

四、Agent Tools API:从”卖模型”到”卖工具”#

与 4.1-Fast 同期发布的 Agent Tools API 是这代产品里最被低估的一笔:

  • 服务端工具套件:实时 X/网页搜索、文件集合检索、沙箱 Python 执行、MCP(Model Context Protocol)连接
  • 计费:每千次工具调用 $5(模型 token 另计)。

它的意义在于:xAI 不再只卖”会说话的模型”,而是卖”会动手的 Agent 基础设施”——搜索、执行、检索全部封装成 API。这是 Grok 从”聊天机器人”彻底转向”Agent 平台”的产品宣言。

五、意义:后训练时代的转折点#

Grok 4.1 的历史价值要放到 2025 年底的行业语境里看:

  • 预训练红利见顶:2025 年下半年,各家新基座带来的提升开始边际递减(OpenAI 的 GPT-5.1、Anthropic 的 4.5 都有”换基座不如重训”的争论);
  • 后训练成为主战场:4.1 用 -65% 幻觉率证明——当基座逼近上限,对齐和后训练是性价比最高的”智能来源”
  • 评测的转向:行业评测重心从”考试分数”(MMLU/AIME)转向”实际质量”(幻觉率、盲测偏好、工具调用成功率),4.1 是这股风潮的推手。

收尾:我的一点看法#

Grok 4.1 是我在 Grok 全系列里评价最高的一代——不是因为分数,而是因为它改变了”模型进步从哪来”的叙事

Grok-3 时代,进步 = 堆算力;Grok-4 时代,进步 = 换训练范式;到了 4.1,进步 = 重做后训练。三次迭代,成本递减、收益递增,这本身就是 2025 年 AI 行业从”蛮力时代”走进”精调时代”的缩影。它跟 DeepSeek 的”涌现优于监督”形成了有趣的对照:DeepSeek 赌”少干预、让能力自发涌现”,xAI 赌”多干预、用 AI 评委精雕细琢”。4.1 的结果说明,当基座足够强时,精雕细琢的收益可能比静观其变大得多。

短板也要说:AIME/GPQA 官方不发,说明”硬推理”的提升有限——4.1 强在”变可信、变好用”,而不是”变聪明”;Agent Tools 生态刚起步,MCP 连接数还远不如 OpenAI/Anthropic 的成熟度。但作为”后训练革命”的代表作,它给整个行业的启示已经足够了:下一代模型的差距,可能不在训练房,而在对齐车间。


附:核心数据速查#

基本盘

项目数值
发布2025-11-17(4.1 全量);11-19(Fast + Agent Tools)
基座Grok-4(非新架构)
核心变更彻底重做后训练(RL + AI 评委奖励模型)
上下文4.1 标准 256K;4.1-Fast 2M(reasoning/non-reasoning 变体)
定价$0.20/$0.50/$0.05;Agent Tools $5/千次调用

官方关键成绩

项目4 → 4.1变化
幻觉率12.09% → 4.22%-65%
FActScore 错误率9.89 → 2.97-70%
盲测偏好64.78%
LMArena ThinkingElo 1483 登顶
LMArena 非推理Elo 1465 第二
EQ-Bench31586 第一

Agent Tools API 能力

  • 实时 X/网页搜索;文件集合检索;沙箱 Python 执行;MCP 连接
  • $5/千次调用

关键概念清单

  • post-training = 后训练(预训练之后的对齐/微调阶段)
  • RLHF = 基于人类反馈的强化学习
  • reward model = 奖励模型(给输出打分的 AI 评委)
  • FActScore = 事实性评测指标
  • EQ-Bench3 = 情商/人格一致性基准
  • MCP = Model Context Protocol,模型上下文协议(工具互联标准)
  • Auto 模式 = 自动决定是否用推理模式
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Grok 4.1:只动后训练
https://mizuki-eaf.pages.dev/posts/grok/grok-41只动后训练/
作者
无名之子
发布于
2026-07-13
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录