Grok 4.1 模型解读:不动架构,只动后训练的胜利
模型:Grok 4.1 / Grok 4.1-Fast(xAI) 发布:2025-11-17(4.1 全量开放,含免费用户);11-19(4.1-Fast + Agent Tools API) 定价:输入 $0.20、输出 $0.50、缓存 $0.05 每百万 token;Agent Tools 每千次调用 $5 这是 2025 年”后训练价值”的巅峰证明。Grok 4.1 没有换基座、没有加参数——就是把 RLHF 后训练彻底重做了一遍,结果幻觉率从 12.09% 砍到 4.22%(-65%),LMArena 双榜登顶(Thinking 1483 Elo 史上第一)。它证明了在架构接近上限的年代,对齐与后训练就是性价比最高的”智能来源”。同期发布的 Agent Tools API 则标志着 xAI 从”卖模型”转向”卖工具”。
一、引言:最安静的版本,最狠的提升
2025 年 11 月 17 日,xAI 把 Grok 4.1 悄悄推给所有用户(含免费用户,Auto 模式默认开启)。此前 11 月 1 日到 14 日,它已经以灰度形式静默测试了两周。没有发布会、没有大词,官方博客的标题只有一句话:“重做后训练(a complete post-training overhaul)”。
两天后(11 月 19 日),Grok 4.1-Fast(2M 上下文版本)和 Agent Tools API 一起上线。
二、训练:非新架构,新后训练
Grok 4.1 的基座还是 Grok-4,但 xAI 把整个后训练管线推倒重来:
- 沿用 Grok-4 的大规模 RL 基础设施,重点优化风格、个性、对齐等不可验证信号(可验证的数学/代码已经在上代练好了);
- 关键创新:以前沿智能体推理模型作为奖励模型(reward model),让 AI 评委自主评估、迭代输出——不再依赖人工标注偏好;
- 叠加可验证奖励:有标准答案的任务用规则判分,没有标准答案的任务用 AI 评委打分,两套信号混合驱动。
一句话概括:“让最聪明的模型当裁判,教下一个模型变得更聪明。” 这套”AI 教 AI”的循环,是 4.1 提升的核心引擎。
三、成绩:幻觉率 -65%,LMArena 双冠
官方基准,每一项都打在”对齐质量”上:
- 幻觉率 12.09% → 4.22%(降 65%);FActScore 错误率 9.89 → 2.97(降 70%)——事实性显著提升;
- 盲测偏好 64.78%(人类评委更爱 4.1 而非 4);
- LMArena:Thinking 版(代号 quasarflux)Elo 1483 登顶,比非 xAI 的最高分高出 31 分;非推理版(代号 tensor)1465 第二,且超过所有竞品的完整推理配置;
- EQ-Bench3 1586 第一、Creative Writing v3 1722;
- ⚠️ AIME / GPQA 官方未披露(第三方数据混乱,存疑,本文不引用)。
Grok 4.1-Fast(2M 上下文,含 reasoning / non-reasoning 两个变体):τ²-bench Telecom 100%、Berkeley Function Calling v4 72%、幻觉率较 4 Fast 减半。
四、Agent Tools API:从”卖模型”到”卖工具”
与 4.1-Fast 同期发布的 Agent Tools API 是这代产品里最被低估的一笔:
- 服务端工具套件:实时 X/网页搜索、文件集合检索、沙箱 Python 执行、MCP(Model Context Protocol)连接;
- 计费:每千次工具调用 $5(模型 token 另计)。
它的意义在于:xAI 不再只卖”会说话的模型”,而是卖”会动手的 Agent 基础设施”——搜索、执行、检索全部封装成 API。这是 Grok 从”聊天机器人”彻底转向”Agent 平台”的产品宣言。
五、意义:后训练时代的转折点
Grok 4.1 的历史价值要放到 2025 年底的行业语境里看:
- 预训练红利见顶:2025 年下半年,各家新基座带来的提升开始边际递减(OpenAI 的 GPT-5.1、Anthropic 的 4.5 都有”换基座不如重训”的争论);
- 后训练成为主战场:4.1 用 -65% 幻觉率证明——当基座逼近上限,对齐和后训练是性价比最高的”智能来源”;
- 评测的转向:行业评测重心从”考试分数”(MMLU/AIME)转向”实际质量”(幻觉率、盲测偏好、工具调用成功率),4.1 是这股风潮的推手。
收尾:我的一点看法
Grok 4.1 是我在 Grok 全系列里评价最高的一代——不是因为分数,而是因为它改变了”模型进步从哪来”的叙事。
Grok-3 时代,进步 = 堆算力;Grok-4 时代,进步 = 换训练范式;到了 4.1,进步 = 重做后训练。三次迭代,成本递减、收益递增,这本身就是 2025 年 AI 行业从”蛮力时代”走进”精调时代”的缩影。它跟 DeepSeek 的”涌现优于监督”形成了有趣的对照:DeepSeek 赌”少干预、让能力自发涌现”,xAI 赌”多干预、用 AI 评委精雕细琢”。4.1 的结果说明,当基座足够强时,精雕细琢的收益可能比静观其变大得多。
短板也要说:AIME/GPQA 官方不发,说明”硬推理”的提升有限——4.1 强在”变可信、变好用”,而不是”变聪明”;Agent Tools 生态刚起步,MCP 连接数还远不如 OpenAI/Anthropic 的成熟度。但作为”后训练革命”的代表作,它给整个行业的启示已经足够了:下一代模型的差距,可能不在训练房,而在对齐车间。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 发布 | 2025-11-17(4.1 全量);11-19(Fast + Agent Tools) |
| 基座 | Grok-4(非新架构) |
| 核心变更 | 彻底重做后训练(RL + AI 评委奖励模型) |
| 上下文 | 4.1 标准 256K;4.1-Fast 2M(reasoning/non-reasoning 变体) |
| 定价 | $0.20/$0.50/$0.05;Agent Tools $5/千次调用 |
官方关键成绩
| 项目 | 4 → 4.1 | 变化 |
|---|---|---|
| 幻觉率 | 12.09% → 4.22% | -65% |
| FActScore 错误率 | 9.89 → 2.97 | -70% |
| 盲测偏好 | — | 64.78% |
| LMArena Thinking | — | Elo 1483 登顶 |
| LMArena 非推理 | — | Elo 1465 第二 |
| EQ-Bench3 | — | 1586 第一 |
Agent Tools API 能力
- 实时 X/网页搜索;文件集合检索;沙箱 Python 执行;MCP 连接
- $5/千次调用
关键概念清单
- post-training = 后训练(预训练之后的对齐/微调阶段)
- RLHF = 基于人类反馈的强化学习
- reward model = 奖励模型(给输出打分的 AI 评委)
- FActScore = 事实性评测指标
- EQ-Bench3 = 情商/人格一致性基准
- MCP = Model Context Protocol,模型上下文协议(工具互联标准)
- Auto 模式 = 自动决定是否用推理模式
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





