mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1394 字
4 分钟
Grok-1.5V:多模态开门枪
2026-07-24

Grok-1.5V 模型解读:多模态的开门一枪#

模型:Grok-1.5V(xAI) 发布:2024-04-12(官方预览博客) 定价:随 X Premium+ 订阅(模型实际未大规模公开部署) 这是 Grok 系列第一次”看世界”。1.5V 能理解文档、图表、截图和照片,还顺手发布了一个叫 RealWorldQA 的真实世界理解基准。它的成绩(RealWorldQA 68.7%)压过了 GPT-4V,但要注意:官方当时给的是”预览”,而这个预览版本后来并没有真正向公众放量——多数中文报道都没提这一点。它的真实价值是给 Grok-2 的视觉能力探了路。


一、引言:4 月 12 日的”意外发布”#

Grok-1.5 发布两周后,2024 年 4 月 12 日,xAI 又甩出一个预览:Grok-1.5V,自家第一个多模态模型。节奏快得反常——但也符合 xAI 一贯”先秀肌肉、再补细节”的发布习惯。

1.5V 的能力清单:看文档、读图表、理解屏幕截图、分析照片,并且能”结合 X 平台数据做真实世界问答”。官方强调它能”连接数字世界与物理世界”。

二、RealWorldQA:xAI 的第一个自研基准#

比模型本身更重要的是,xAI 借 1.5V 发布了 RealWorldQA——一个评估”真实世界物理空间理解”的基准。它的题目是实拍照片 + 物理常识问答,比如”这辆车能停进这个车位吗""这个斜坡和那个楼梯哪个更陡”。这类问题纯语言模型答不了,多模态模型也经常翻车,因为它要求模型真正理解空间几何,而不是匹配文字模式。

RealWorldQA 后来成了 xAI 的常驻基准,Grok-2、Grok-3 的官方博客里都能看到它。“发布模型顺便定义基准” 这套打法,xAI 跟 OpenAI(MMMU 等)学了个十成十——自己定规则、自己当裁判,虽然有点鸡贼,但基准本身确实填补了”真实世界理解”这个评测空白。

三、成绩:压过 GPT-4V,但没赢全套#

官方公布的基准对比(vs GPT-4V 和 Gemini 1.5 Pro):

  • RealWorldQA 68.7% vs GPT-4V 61.4%——xAI 自研基准上领先 7.3 个点;
  • MMMU 53.6%、DocVQA 85.6%
  • MathVista 与 Gemini 1.5 Pro 互有胜负。

注意两个细节:

  1. RealWorldQA 是 xAI 自己的基准,自家模型在上面领先,含金量要打折;
  2. 1.5V 并没有在所有维度上全面压制 GPT-4V——它在通用视觉问答(MMMU)上只是追平,而不是碾压。

四、关键事实:预览版没有真正放量#

这是最容易被忽略、但对历史判断很重要的一点:Grok-1.5V 的发布停留在”预览”层面,官方后来并未将其作为正式产品大规模向公众部署。它更像是 xAI 的一次能力展示和技术探路,而不是一个交付给用户的产品。

为什么?合理的推测是:视觉能力需要更长的训练打磨,xAI 选择直接跳到下一代——四个月后的 Grok-2 就把成熟的多模态视觉能力(OCR、文档理解、图表分析)带给了所有用户。1.5V 是那个”跳板”。

收尾:我的一点看法#

Grok-1.5V 是一篇”开门的作业”:能力有亮点(RealWorldQA 压过 GPT-4V)、思路有价值(自研基准 + 多模态探路),但产品没落地,多少有点”PPT 模型”的味道。

它的历史意义要从两条线看:

  1. 技术线:RealWorldQA 确立了 xAI”真实世界理解”的评测方向,这个方向后来贯穿 Grok-2(视觉理解)、Grok-3(图像 + 实时)、Grok-4(工具 + 多模态)直到 2026 年的 Grok 4.3(原生视频输入);
  2. 组织线:1.5 家族证明了 xAI”一个基座、多能力分支并行开发”的节奏,语言和视觉两条产品线可以各自独立迭代。

说句公道话,1.5V 放在整个 Grok 历史里是小角色——没有它,Grok-2 的多模态也照样会来。但它替 xAI 验证了”视觉 + 实时数据”这个组合拳的可行性,也提前给社区打了一针”xAI 要往多模态走”的预防针。作为承上启下的一篇,够格。


附:核心数据速查#

基本盘

项目数值
发布2024-04-12(预览)
模态文本 + 图像(文档/图表/截图/照片)
部署状态预览版未大规模公开部署(⚠️)
架构/参数官方未披露

官方基准(对比 GPT-4V)

基准Grok-1.5VGPT-4V
RealWorldQA68.7%61.4%
MMMU53.6%56.8%(略落后)
DocVQA85.6%

关键概念清单

  • RealWorldQA = xAI 自研的真实世界物理空间理解基准
  • MMMU = 大学水平多模态理解基准
  • DocVQA = 文档视觉问答基准
  • 多模态 = 同时处理文本与图像等多种输入
  • 预览(Preview)= 能力展示版,非正式产品
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Grok-1.5V:多模态开门枪
https://mizuki-eaf.pages.dev/posts/grok/grok-15v多模态开门枪/
作者
无名之子
发布于
2026-07-24
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录