mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2572 字
7 分钟
DeepSeek-OCR 2:学会阅读顺序
2026-07-16

DeepSeek-OCR 2 论文解读:让视觉编码器学会”阅读顺序”#

论文:DeepSeek-OCR 2: Visual Causal Flow 作者:Haoran Wei、Yaofeng Sun、Yukun Li,DeepSeek-AI 2026 年 1 月。这篇挑战一个很基础的假设,视觉 token 为什么要按”从左到右、从上到下”的固定顺序进语言模型?人眼看图不是这么扫的,眼睛的移动遵循语义驱动的因果流。DeepSeek-OCR 2 把 DeepEncoder 里的 CLIP 换成一个 LLM 结构的编码器,用可学习的因果查询 token 给视觉 token 重新排序,让编码器自己决定”先看哪里”。OmniDocBench v1.5 上整体 91.09%,比上一代涨 3.73 个点,阅读顺序的编辑距离下降约三分之一。


一、动机:栅格扫描违背人眼直觉#

现有 VLM 一律把图像 patch 按栅格顺序(左上到右下)拍平,配固定位置编码喂给 LLM。但人眼不是这么看的,人眼扫视序列是由语义驱动的,比如顺着一条螺旋线看,每一次注视都因果地依赖前一次。把 2D 图像强行拍平成一维栅格序列,等于强加了一个不看语义的归纳偏置。

论文提出一个更大胆的问题,2D 图像理解能不能通过”两级级联的 1D 因果推理”实现?编码器先做阅读逻辑推理(给视觉 token 排个语义顺序),解码器再在这个有序序列上做任务推理。

二、DeepEncoder V2:把 LLM 当视觉编码器#

结构#

跟 DeepEncoder 一样,前段是视觉 tokenizer,80M 的 SAM-base 加两层卷积,16 倍压缩,输出维度从 1024 降到 896。关键改动在中段,把原来的 CLIP-large 换成 Qwen2-0.5B(500M),一个 decoder-only 的 LLM 结构。

双流注意力掩码#

这个 LLM 结构里有两类 token:

  • 视觉 token(前缀),用双向注意力,保留 CLIP 式的全局建模能力。
  • 因果流查询 token(后缀),可学习参数,用因果注意力(三角掩码),每个查询能看所有视觉 token 和它前面的查询。

查询和视觉 token 数量相等,只取后半段(查询的输出)喂给 LLM 解码器。这就实现了”语义重排”,查询 token 在双向视觉信息的基础上,逐个生成新的阅读顺序,而顺序本身是因果的。

有个重要工程细节,视觉 token 必须以”前缀拼接”方式放进编码器,作者试过 mBART 式的交叉注意力编码器-解码器结构,不收敛。前缀设计让视觉 token 全程参与各层计算,跟查询的交互才充分。

多分辨率#

用多裁剪策略,全局视图 1024×1024(256 个查询),局部裁剪 768×768(144 个查询),裁剪数 0 到 6。喂给 LLM 的 token 数 = k×144+256,范围 [256, 1120]。上限 1120 恰好对齐 Gemini-3-Pro 的最大视觉 token 预算,比上一代 Gundam 模式的 1156 还少。

三、训练:三段式#

  1. 编码器预训练:DeepEncoder V2 单独训,视觉 tokenizer 从 DeepEncoder 初始化,LLM 结构编码器从 Qwen2-0.5B-base 初始化,接轻量解码器做 next token prediction。160 张 A100,batch 640,4 万步,约 1 亿图文对,学习率 1e-4 到 1e-6。
  2. 查询增强:冻结 tokenizer,联合优化 LLM 编码器和解码器,统一成多裁剪数据流。160 卡,DP 40,batch 1280,1.5 万步。
  3. 解码器专化:冻结整个 DeepEncoder V2,只训 LLM,吃数据速度翻倍,2 万步,学习率 1e-6 到 5e-8,让解码器适应重排后的视觉 token。

四、成绩:OmniDocBench v1.5#

整体 91.09%,是当时端到端模型里最好的,而且用的是全场最小的视觉 token 上限(1120)。对比上一代 DeepSeek-OCR(87.36%,1156 token),涨 3.73 个点,训练数据源还差不多。不过 OCR 占比从上代的 70% 提到了 80%,采样与标签合并也有微调,严格说不是纯架构红利。

分项对比:

  • 文本编辑距离 0.048(上一代 0.073,Gemini-2.5-Pro 是 0.075)
  • 公式 CDM 90.31(上一代 84.14)
  • 表格 TEDS 92.06(上一代 89.01)
  • 阅读顺序编辑距离 0.057(上一代 0.085,下降约三分之一),这是”视觉因果流”最直接的证据,编码器真的学会了按图像信息重排 token

跟闭源比,整体编辑距离 0.100,好过同 token 预算(1120)的 Gemini-3-Pro(0.115)和 5120 token 的 Seed-1.8(0.106)。

也有短板,报纸类文档还是弱(文本 ED 超 0.13),原因两个,一是 1120 的 token 上限对超文本密集的报纸不够,加局部裁剪就行;二是训练数据里报纸只有 25 万样本,不够训这个能力。

生产环境的表现也更好,在线用户图的重复杂率从 6.25% 降到 4.17%,PDF 数据管线从 3.69% 降到 2.88%。

五、展望:两条大路#

真正的 2D 推理。两级级联因果推理这个架构,理论上把 2D 理解拆成两个正交的 1D 因果推理子任务,编码器做阅读逻辑、解码器做任务推理。作者承认路还长,比如多次回看和多跳重排可能需要比视觉 token 更长的因果流 token。

原生多模态。DeepEncoder V2 验证了”LLM 结构当编码器”这条路,而且它天然能扩展成统一的全模态编码器,共享 Wk、Wv 投影、注意力和 FFN,只换模态专属的可学习查询,就能同时处理图像、音频、文本。还能白嫖 LLM 社区的架构红利,MoE、高效注意力直接搬。

收尾:我的一点看法#

这篇论文的价值在于提出并验证了一个新范式:视觉编码器不该是被动的特征提取器,它应该是一个”会思考顺序的阅读器”。把 CLIP 换成 LLM 结构,加一组因果查询 token,让编码器自己决定阅读顺序,这个设计在概念上很漂亮,而且 R-order 编辑距离从 0.085 掉到 0.057 是实打实的证据,不是玄学。

“两级级联 1D 因果推理逼近 2D 推理”这个提法,我认为是这篇论文最重要的理论贡献,虽然作者自己都说是初步探索。Transformer 处理 2D 结构一直靠拍平加位置编码,DeepEncoder V2 提供了一条新路,先用因果查询把 2D 结构”翻译”成语义有序的 1D 序列,再让 LLM 处理。这个思路如果成立,影响面远超 OCR。

工程细节也值得学。前缀拼接优于交叉注意力这个负结果,避免后来者再踩坑;多裁剪加固定查询配置避免了不同分辨率维护多套查询的麻烦;token 上限对齐 Gemini-3-Pro 说明他们在对标闭源的资源预算。

几个保留意见。一是性能提升主要验证在文档阅读上,通用视觉推理还没测,说”2D 推理”为时过早;二是报纸类文档的短板说明 token 预算和数据覆盖仍是瓶颈;三是 1120 个 token 的压缩率上限跟上一代比并没有本质提升,论文主打的还是”同样的预算下读得更好”。不过作为”用 LLM 结构重造视觉编码器”的探路石,这篇够格。


附:核心数据速查#

DeepEncoder V2 结构

组件说明
视觉 tokenizerSAM-base(80M)+ 两层卷积(输出 896 维),16× 压缩
LLM 结构编码器Qwen2-0.5B(500M),前缀拼接 + 双流注意力掩码
因果流查询与视觉 token 等量,因果三角掩码,只输出查询部分给解码器
多裁剪全局 1024(256 查询)+ 0-6 个 768 局部块(每块 144),共 [256, 1120] token

训练三段式

  1. 编码器预训练(40k 步,1 亿图文对,LR 1e-4→1e-6)
  2. 查询增强(冻结 tokenizer,联合训练,15k 步)
  3. 解码器专化(冻结编码器,20k 步,速度翻倍)

OmniDocBench v1.5 成绩

指标OCR 2OCR(上代)
Overall91.09%87.36%(+3.73)
V-token 上限1120(全场最小)1156
文本 ED0.0480.073
公式 CDM90.3184.14
表格 TEDS92.0689.01
R-order ED0.0570.085

对比

  • 整体 ED 0.100 vs Gemini-3-Pro 0.115(同 1120 token)、Seed-1.8 0.106(5120 token)
  • 端到端模型 SOTA;管线模型 PaddleOCR-VL 92.86% 仍更高

生产表现

  • 在线图片重复率 6.25% → 4.17%
  • PDF 管线重复率 3.69% → 2.88%

关键概念清单

  • visual causal flow = 视觉因果流(语义驱动的阅读顺序)
  • DeepEncoder V2 = LLM 结构视觉编码器(Qwen2-0.5B 替代 CLIP)
  • causal flow query = 因果流查询 token(可学习、因果注意力、重排视觉 token)
  • dual-stream attention mask = 双流注意力掩码(视觉双向 + 查询因果)
  • raster-scan order = 栅格扫描顺序(左上到右下的固定排布)
  • multi-crop = 多裁剪(全局视图 + 局部块)
  • cascade causal reasoning = 级联因果推理(编码器重排 + 解码器推理)
  • OmniDocBench v1.5 = 文档解析评测基准(1355 页,9 大类)
  • R-order = 阅读顺序(编辑距离衡量)
  • repetition rate = 重复率(生产环境质量指标)
  • omni-modal encoder = 全模态统一编码器(共享参数 + 模态专属查询)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

DeepSeek-OCR 2:学会阅读顺序
https://mizuki-eaf.pages.dev/posts/deepseek/deepseek-ocr-2学会阅读顺序/
作者
无名之子
发布于
2026-07-16
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录