mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2597 字
7 分钟
DeepSeek-VL:多模态不忘语言
2026-07-15

DeepSeek-VL 论文解读:多模态训练,先把语言能力保住#

论文:DeepSeek-VL: Towards Real-World Vision-Language Understanding 作者:Haoyu Lu、Wen Liu、Bo Zhang 等,DeepSeek-AI 2024 年 3 月,DeepSeek 的第一篇多模态论文(据公开资料),1.3B 和 7B 两个型号。它解决的核心问题很朴素,多模态预训练会严重侵蚀模型的语言能力,怎么在练视觉的同时不把语言忘了。答案是语言数据至少占七成,再加一个模态预热策略。架构上用 SigLIP 加 SAM 的混合视觉编码器,1024 分辨率的高清图压进 576 个 token。数据层面最值得看的是,他们从真实的 GPT-4V、Gemini 测试用例里整理出使用场景分类法,按真实场景做指令微调。


一、背景:开源多模态模型的真实差距#

开源多模态模型在 benchmark 上追得很快,但真实场景体验跟 GPT-4V 差距明显。作者归因于四个问题:一是把算力都砸在指令微调上,忽略了预训练才是通识的来源;二是指令微调数据就是把学术数据集拼在一起,跟真实使用场景脱节;三是视觉编码器分辨率太低(336 或 448),OCR、小物体识别这些真实需求搞不定;四是多模态训练把语言能力搞退化。

二、架构:混合视觉编码器#

为什么一个编码器不够#

SigLIP 这类 CLIP 家族编码器擅长语义表征,但有两个毛病,一是”CLIP-blind pairs”,视觉上完全不同的图可能被编码得很像;二是输入分辨率低,处理不了密集 OCR 和视觉定位这种需要细节的任务。

两个编码器融合#

  • SigLIP-L,384×384 低分辨率,负责高层语义。
  • SAM-B(ViTDet 预训练),1024×1024 高分辨率,负责低层细节。

高分辨率特征图 64×64×256 经过适配器插值、两层步长 2 的卷积,压成 24×24×1024,reshape 成 576 个 token,跟 SigLIP 的 576 个 token 拼接,最后 576 个 2048 维视觉 token 进语言模型。1024 分辨率的高清图,576 个 token 搞定,token 预算固定,图文交错和多轮对话都能扛。

视觉适配器是两层混合 MLP,高分辨率特征和低分辨率特征先用各自单层 MLP 处理,再拼起来过一层 MLP 进 LLM。语言模型用 DeepSeek-LLM 的中间 checkpoint(1B 见过 500B token,7B 见过 2T token)。

三、数据:按真实场景建分类法#

预训练数据#

多模态预训练数据按类别组织,交错图文(MMC4、Wiki、Wikihow、Epub 教材)、图像描述(Capsfusion、TaiSu、详细描述)、表格图表(12 个数据集)、网页代码(WebSight 加从 146 万个 Jupyter notebook 里提取的 200 万对图码数据)、场景文字 OCR(10 个数据集)、文档 OCR(140 万篇 arXiv 论文用 Nougat 渲染成图文对,86 万本英文加 18 万本中文电子书,还有数百万道 K-12 考试题,自建的英中双语文档 OCR 数据集在当时是独一份)。外加 70% 的纯文本语料(DeepSeek-LLM 的 2T 语料)。

指令微调数据:从真实用例出发#

这是这篇论文最有特色的部分。作者从互联网上人工收集 GPT-4V 和 Gemini 的真实测试用例,整理成一个系统的使用场景分类法(识别、转换、分析、常识、逻辑、多图等),再按这个分类法为每张测试图选提示词,构建指令微调数据。SFT 数据里 47.9% 是纯文本对话数据,保证聊天能力不掉。

四、训练:三段式,重点是别忘语言#

Stage 1,适配器预热。视觉编码器和 LLM 全冻住,只训适配器,1.25M 条 ShareGPT4V 描述加 2.5M 条文档 OCR 对。作者做了个很反直觉的实验,这个阶段数据量从 2K 步加到 80K 步,性能不升反降,说明适配器容量太小,堆数据没用,得解冻 LLM 干大事。

Stage 2,联合预训练。视觉编码器冻结,适配器和 LLM 一起训。一开始直接全多模态数据训,多模态指标涨,语言指标雪崩式下跌。原因是多模态语料太简单、跟语言语料的分布差异大,而且两个模态之间存在竞争关系,语言被灾难性遗忘。

解法是联合训练,掺语言数据。作者在 1.3B 模型(底座 DeepSeek-LLM-1B)上系统扫了不同模态混合比,100% 多模态时语言崩得最狠,掺入语言后语言能力大幅回升,多模态损失很小。最终选了语言<多模态> ≈ 7<3>

小模型迭代的技巧也在这节。1.3B 模型在生成式评测上波动剧烈,难以监控训练,作者用多选 PPL 评测(把选项都输进去算困惑度)加在预训练里掺少量 SFT 数据,解决 1.3B 模型指令跟随能力成为瓶颈的问题。

Stage 3,监督微调。SAM-B 冻结(显存不够),其余全训。用多模态 SFT 数据加纯文本对话数据混合。

训练成本:7B 版 64 节点 × 8 张 A100 跑 5 天,1.3B 版 16 节点跑 7 天。

五、成绩#

多模态基准(7B)。MMB 73.2、MMC 72.8、SEED 70.4(GPT-4V 是 71.6)、OCRBench 456、POPE 88.1、MMVet 41.5,同规模开源模型里全面领先。数学逻辑 MathVista 36.1 超过所有开源,但离 GPT-4V 的 47.8 还远,作者归因于底座规模。1.3B 版 MMB 64.6,参数只有 MobileVLM 2.7B 的一半,分数反超。

语言基准(7B)。HellaSwag 68.4 对 DeepSeek-LLM-7B 的 68.5,基本持平;MMLU 52.4 对 49.4、AGIEval 27.8 对 19.3,反而涨了。GSM8K 55.0 对 63.0,掉了 8 个点,数学是唯一明显受损的,说明视觉语言竞争关系还在,7B 容量太小扛不住。

人工评测。100 道真实场景题,7 大类。整体 GPT-4V 最强,DeepSeek-VL-7B 在识别、转换、常识推理上逼近 GPT-4V,逻辑推理差得远。GPT-4V 当裁判的对比评测里,DeepSeek-VL 对开源模型胜率超 60%。

收尾:我的一点看法#

DeepSeek-VL 在 DeepSeek 系里存在感不高,但它的方法论遗产很重。最核心的一条是”语言数据至少七成”,这个比例后来(据公开资料)成了 DeepSeek 多模态训练的默认配方,Janus 系列继承的就是这条线。多模态训练必然侵蚀语言能力,这个认知在 2024 年初还很稀缺,很多团队练完视觉模型回头发现语言崩了。

混合视觉编码器也是被低估的设计。SigLIP 管语义、SAM 管细节的分工,用 576 个 token 扛住 1024 分辨率,这个”token 预算固定但分辨率拉满”的思路,后来在 Janus、OCR 系列里都有回响。DeepSeek 的视觉路线一直是”能用小预算办大事”,跟语言侧的 MLA 是一个哲学。

“适配器预热阶段堆数据没用”这个负结果实验也很值钱。它告诉后来者,投影层容量就那么大,别在这个阶段浪费算力,该解冻 LLM 就解冻。这种”记录负结果”的诚实,在论文里不常见。

不足也明显。7B 底座限制了上限,MathVista 只有 36.1,逻辑推理跟 GPT-4V 的差距是模型规模的差距,不是方法的差距;GSM8K 掉 8 个点说明 7B 规模下视觉语言竞争仍然无解。1.3B 模型在预训练阶段监控困难的问题,论文用多选 PPL 绕过去了,但这是治标,模型太小就是难搞。DeepSeek 后来多模态直接跳到 VL2 的 MoE 架构,也是在规模路线上换了赛道。


附:核心数据速查#

模型基本盘

项目DeepSeek-VL-1BDeepSeek-VL-7B
底座DeepSeek-LLM-1B(500B token)DeepSeek-LLM-7B(2T token)
视觉编码器SigLIP-LSigLIP-L + SAM-B(混合)
输入分辨率3841024(576 token 预算)
训练成本16 节点 7 天64×8 A100 5 天

架构

  • 混合视觉编码器:SigLIP-L(384 语义)+ SAM-B(1024 细节)
  • 1024 图像 → 576 个 2048 维视觉 token
  • 两层混合 MLP 适配器

训练策略

  • Stage 1 适配器预热(全冻结,数据堆不动性能)
  • Stage 2 联合预训练(语言<多模态> ≈ 7<3>,配模态预热)
  • Stage 3 SFT(SAM-B 冻结)
  • 1B 迭代技巧:多选 PPL 评测 + 预训练掺少量 SFT 数据

7B 关键成绩

指标DeepSeek-VL-7BGPT-4V
MMB73.275.0
MMC72.874.7
SEED70.471.6
OCRBench456659
POPE88.1-
MathVista36.147.8
HellaSwag(语言)68.4-
MMLU(语言)52.4-
GSM8K(语言)55.0-

关键概念清单

  • VL = Vision-Language,视觉语言
  • LMM = Large Multimodal Model,大型多模态模型
  • SigLIP = 基于对比学习的视觉编码器
  • SAM = Segment Anything Model(这里用 ViTDet 图像编码器)
  • hybrid vision encoder = 混合视觉编码器
  • VL adaptor = 视觉语言适配器(两层混合 MLP)
  • CLIP-blind pairs = CLIP 家族的盲区(视觉不同但编码相似)
  • modality warm-up = 模态预热(逐步提高多模态数据比例)
  • catastrophic forgetting = 灾难性遗忘
  • Multi-choice PPL = 多选困惑度评测
  • use case taxonomy = 使用场景分类法
  • MMBench / MMMU / SEED-Bench / OCRBench / POPE / MathVista / MMVet = 多模态评测基准
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

DeepSeek-VL:多模态不忘语言
https://mizuki-eaf.pages.dev/posts/deepseek/deepseek-vl多模态不忘语言/
作者
无名之子
发布于
2026-07-15
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录