DeepSeek-VL_中文翻译版
DeepSeek-VL:迈向真实世界的视觉-语言理解
摘要
我们提出了 DeepSeek-VL,一个面向真实世界视觉与语言理解应用的开源视觉-语言(Vision-Language, VL)模型。我们的方法围绕三个核心维度展开:
-
数据构建:我们致力于确保数据的多样性、可扩展性,并广泛覆盖真实世界场景,包括网页截图、PDF、OCR、图表和知识型内容(专业知识、教材),旨在全面表征实际应用场景。此外,我们从真实用户场景出发构建了用例分类体系(Use Case Taxonomy),并据此构建了指令微调数据集。使用该数据集进行微调显著提升了模型在实际应用中的用户体验。
-
模型架构:考虑到效率和大多数真实场景的需求,DeepSeek-VL 采用了混合视觉编码器(Hybrid Vision Encoder),能够在固定 token 预算内高效处理高分辨率图像(1024×1024),同时保持相对较低的计算开销。这一设计确保模型能够捕捉各种视觉任务中的关键语义和细节信息。
-
训练策略:我们认为一个优秀的视觉-语言模型首先应具备强大的语言能力。为确保预训练过程中 LLM 能力的保留,我们研究了一种有效的 VL 预训练策略——从一开始就整合 LLM 训练,并仔细管理视觉和语言模态之间的竞争动态。从聚焦文本开始,我们逐步调整比例以实现两种模态的平衡融合。
DeepSeek-VL 系列(包括 1.3B 和 7B 模型)在真实世界应用中作为视觉-语言聊天机器人展现出卓越的用户体验,在相同模型规模下的多种视觉-语言基准测试中达到最先进或具有竞争力的性能,同时在以语言为中心的基准测试中也保持稳健表现。我们已经公开发布了 1.3B 和 7B 模型,以促进基于此基础模型的创新。
1. 引言:开启视觉与语言融合的新篇章
在人工智能的浪潮中,大型语言模型(LLM)如 GPT、Gemini 等已展现出令人惊叹的文本理解和生成能力,彻底改变了人机交互的方式。然而,现实世界的信息远不止文字——图像、图表、文档、界面截图等视觉内容承载着海量知识。能否让 AI 像理解文字一样“看懂”图片,并在此基础上进行推理、创作与对话?这已成为下一代通用人工智能的核心挑战。
DeepSeek-VL 正是在此背景下应运而生。我们致力于构建一个面向真实世界应用的开源视觉-语言(Vision-Language, VL)模型,它不仅要在学术基准上取得优异成绩,更要在实际场景中——无论是解析复杂的学术图表、理解网页布局、识别手写笔记,还是进行多轮视觉问答——都能提供流畅、可靠、实用的体验。
为什么需要 DeepSeek-VL?
当前,尽管已有不少开源多模态模型,但它们与顶尖闭源模型(如 GPT-4V)在真实场景下的用户体验上仍存在明显差距。许多模型过于依赖指令微调,忽视了大规模预训练对世界知识积累的关键作用;架构上往往受限于低分辨率输入,难以处理 OCR、细节定位等需要高分辨率感知的任务;更常见的是,在多模态训练中语言能力会严重退化,导致模型“看得懂图,却说不好话”。
DeepSeek-VL 从三个维度系统性地应对这些挑战:
- 数据构建:我们构建了覆盖网页、PDF、图表、教材、代码等真实场景的大规模预训练数据集,并设计了基于真实用户用例的分类体系来指导高质量的指令微调数据收集。
- 模型架构:创新性地提出混合视觉编码器,融合低分辨率语义编码器与高分辨率细节编码器,在固定 Token 预算内高效处理 1024×1024 的高清图像。
- 训练策略:我们探索了联合语言-多模态预训练与模态预热策略,确保模型在获得强大视觉理解能力的同时,不牺牲其原有的语言能力。
本文你将收获什么?
通过阅读本文,你将深入了解:
- DeepSeek-VL 的整体设计哲学与技术路线:我们如何从真实需求出发,构建数据、设计模型、制定训练策略。
- 大规模视觉-语言模型训练的核心洞见:包括如何平衡多模态与语言数据、如何设计高效的视觉编码器、如何避免训练中的能力遗忘等。
- 详实的实验分析与性能对比:DeepSeek-VL 在 MMBench、ScienceQA、MathVista 等多个权威基准测试上的表现,以及与同类开源、闭源模型的对比。
- 开源模型的实际部署与应用前景:我们已经公开了 1.3B 和 7B 两个规模的模型,为社区研究和应用提供了坚实的基础。
我们相信,DeepSeek-VL 不仅是一个高性能的模型,更为开源社区探索视觉-语言智能提供了新的思路与工具。接下来,让我们深入探讨其背后的数据、方法与卓越性能。

图1 | DeepSeek-VL 具备通用的多模态理解能力,能够处理逻辑图、网页、公式识别、科学文献、自然图像以及复杂场景中的具身智能任务。
2. 数据构建
多样化的大规模数据集是视觉语言模型训练最重要的要素。我们的数据集可分为两部分:视觉-语言预训练数据和视觉-语言监督微调数据。VL 预训练数据由来自各种来源的视觉-文本数据组成,旨在增强模型的基础跨模态理解能力;而 VL 监督微调数据规模相对较小,旨在教会模型完成特定的下游任务。按照设计,VL 预训练数据用于在训练阶段 1 预热视觉-语言适配器,并在阶段 2 联合预训练视觉-语言模型;VL 监督微调数据则在训练阶段 3(即视觉语言监督微调)中使用。
2.1 视觉-语言预训练数据
本研究中使用的预训练数据集包含多样化的公开可访问来源以及部分专有数据。我们在表 1 中提供了联合视觉和语言预训练阶段所使用的数据源的综合概述。这样的数据集可以促进 LLM 对图像中所描绘实体的理解。此外,我们提供了完整数据集的详细分解,组织如下:
| 类别 | 数据集 | 占比 |
|---|---|---|
| 交错图文数据 | MMC4 (Zhu et al., 2024) — 13.1% Wikipedia 中英文(基础版) WikiHow (Yang et al., 2021) 内部 PDF 和 Epub 教材 |
13.1% |
| 图像描述 | CapsFusion (Yu et al., 2023a) TaiSu (Liu et al., 2022b) DetailedCaption (echo840, 2024) |
11.1% |
| 表格与图表 | Chart2text, Geo170K, Ureader, UniChart, M-paper, ScienceQA, ScreenQA, SciGraphQA-295K, Paper2figure100k, WidgetCaptioning, Screen2words, Refexp |
2.1% |
| Web代码 | Websight (HuggingFace M4, 2024) — UI逆向渲染 GitHub Notebook 中的 Python 绘图代码 |
0.4% |
| 场景文本OCR | ArT, MLT-17, LSVT, UberText, Coco-text, RCTW-17, ReCTS, TextOCR, OpenVINO, HierText |
1.2% |
| 文档OCR | arXiv 渲染的 Markdown (Blecher et al., 2023) | 2.1% |
| 纯文本语料 | DeepSeek-LLM2T 文本语料库 (DeepSeek-AI, 2024) | 70.0% |
表1 | 联合视觉和语言预训练阶段使用的数据集汇总
各数据类别详解
交错图文数据使模型具备更好的多模态输入上下文学习能力。我们利用三个公开数据集:MMC4(Zhu et al., 2024)、Wiki(Burns et al., 2023)、WikiHow(Yang et al., 2021)和 Epub 教材。
图像描述数据来自三个高质量的图像-文本配对数据集:CapsFusion(Yu et al., 2023a)、TaiSu(Liu et al., 2022b)和 DetailedCaption(echo840, 2024)。
表格和图表数据使模型能够学习通用表格和图表图像的理解能力。它包含多样化的公开数据源,包括 Chart2text(Kantharaj et al., 2022)、Geo170K(Gao et al., 2023)、UniChart(Masry et al., 2023)、Ureader(Ye et al., 2023)、M-paper(Hu et al., 2023)、ScienceQA(Lu et al., 2022b)、ScreenQA(Hsiao et al., 2022)、SciGraphQA-295K(Li & Tajbakhsh, 2023)、Paper2figure100k(Rodriguez et al., 2023)、WidgetCaptioning(Li et al., 2020)、Screen2words(Wang et al., 2021)和 Refexp(Mao et al., 2016)。
Web代码数据赋予模型从图形界面或可视化图表重建代码的能力。利用 Websight(HuggingFace M4, 2024)进行 UI 逆向渲染,我们采用了类似于 MATCHA(Liu et al., 2022a)的可视化图表逆向渲染策略。这涉及处理来自 Stack 数据集(Kocetkov et al., 2023)的约 146 万个 Jupyter Notebook。通过提取这些笔记本并整理所有图表及其对应的前置代码段,我们成功策展了一个包含 200 万对图像和代码的集合。为保证更好的数据质量,我们筛选了 110 万个实例(每个实例包含单张图像和至少 5 行代码)作为主要训练数据集。
文档 OCR 数据促进文档级别的光学字符识别,即使在具有挑战性的真实场景中也是如此。据我们所知,目前没有公开可用的大规模数据集同时涵盖英文和中文文档。尽管存在公开的小规模数据集 Latex-OCR(Blecher, 2024),我们还额外构建了一个全面的英文和中文文档 OCR 数据集。它由两部分组成:
- arXiv 文章:我们收集了 140 万篇 arXiv 文章的源代码和编译后的 PDF。利用 Nougat(Blecher et al., 2023)的预处理工具,将这些文章渲染成图像-文本对;
- 电子书和教育材料:我们从 Anna’s Archive 清理了 86 万本英文和 18 万本中文电子书,以及数百万 K-12 教育考试题目。随后,我们使用 HTML 渲染工具将这些具有不同模板的 HTML 文件转换为图像-文本对格式。
场景文本 OCR 数据增强模型从文本融入环境的图像中识别和提取文本的能力。该数据集由多个公开数据集组成,包括 ArT(Chng et al., 2019)、MLT-17(Nayef et al., 2017)、LSVT(Sun et al., 2019)、UberText(Zhang et al., 2017)、Coco-text(Veit et al., 2016)、RCTW-17(Shi et al., 2017)、ReCTS(Zhang et al., 2019)、TextOCR(Singh et al., 2021)、OpenVINO(Krylov et al., 2021)和 HierText(Long et al., 2022)。
纯文本语料用于维持语言中心任务的熟练度。在本研究中,我们采用与 DeepSeek-LLM(DeepSeek-AI, 2024)相同的文本语料库。
2.2 监督微调数据
本研究中使用的监督微调数据集涵盖多样化的多模态和语言数据来源,包括知名的开源共享 GPT-4V 数据集,如 ShareGPT4V(Chen et al., 2023)、LAION-GPTV(LAION, 2023)、LVIS-Instruct4V(Wang et al., 2023a)、textOCR-GPT4V(Carter, 2024)、LLaVA 1.6-GPT4V(Liu et al., 2024a)和 IconQA(Lu et al., 2021)。此外,我们还整合了从预训练数据集中提取的部分表格和图表数据,如 Ureader(Ye et al., 2023)、ScreenQA(Hsiao et al., 2022)、Geo170K(Gao et al., 2023)和 ScienceQA(Lu et al., 2022b)。此外,我们集成了从 Screen-to-code(Abi, 2024)任务获取的 UI 代码数据集。
为提升多模态 SFT 数据的质量,我们还策展了一部分高质量的自有高质量多模态 SFT 数据,其中部分为中文内容。我们的自有指令微调数据集经过精心设计,以反映真实世界的使用场景并覆盖广泛的任务范围。我们从各种在线来源收集多样化的 GPT-4V 和 Gemini 真实测试用例。然后对这些测试用例进行仔细分析和组织,形成一个全面的分类体系,涵盖多个类别,如识别、转换、分析、推理、评估和安全(详见表 3)。这一结构化的分类体系作为为每张测试图像选择代表性提示词的指导方针,确保我们的指令微调数据集既实用又与真实世界应用相关。此外,该分类体系还用于构建平衡且全面的评估数据集,使我们能够有效评估模型在不同任务和类别上的性能。通过这种系统化方法,我们确保自有高质量多模态 SFT 数据所覆盖的类别与分类体系良好对齐,并能代表真实世界的使用场景。
| 类别 | 数据集 | 占比 |
|---|---|---|
| 自有数据 | 基于分类体系(表3)的 SFT 数据 | 10.5% |
| 通用多模态 | ShareGPT4V, LAION-GPTV, LVIS-Instruct4V, textOCR-GPT4V, LLaVA1.6-GPT4V, IconQA |
35.5% |
| 表格与图表 | Ureader, Geo170K, ScienceQA | 4.1% |
| Web代码 | Screen-to-code, ScreenQA | 2.0% |
| 纯文本SFT | DeepSeek-LLM (DeepSeek-AI, 2024) | 47.9% |
表2 | 联合视觉和语言监督微调阶段使用的数据汇总
自有 SFT 数据的分类体系(Taxonomy)
我们对自有 SFT 数据进行了系统性的分类整理,形成如下完整的分类体系:
| 主类别 | 描述 | 子类别 |
|---|---|---|
| 识别(Recognition) | 主要考察大模型对图像内容的理解和描述能力,不需要高知识储备和推理能力 | 全局描述:主题描述、事件/行为描述、位置/场景描述、情绪/氛围描述、风格识别、食物识别等 局部描述:指向描述、位置描述、人物识别、物体属性描述、Logo识别、计数、货币识别 OCR与转录:印刷体文本转录、手写体文本转录、指定格式转录、指定语言转录 |
| 转换(Conversion) | 要求模型能够描述和识别图像内容,并使用特定知识将图像内容转换为另一种形式 | 图像转代码:UI转代码、图表转代码、照片转SVG/p64编码、公式转代码、流程图转代码 图像转文本:图像转Prompt、文本摘要、基于图像的创作、文本解读 |
| 分析(Analysis) | 要求模型使用特定知识和逻辑能力基于图像内容进行合理分析 | 数据图表分析:图形解读、表格解读 专业图表分析:电路图、流程图、地图、乐谱、财务图表、平面图等 专业图像分析:传感器图像、生物医学图像、声纹图像、点云图像 百科知识分析:艺术文化知识、自然环境知识、衣食住行相关知识、娱乐相关知识、历史知识 |
| 常识推理(Commonsense Reasoning) | 主要测试模型对生活常识的理解和掌握 | 关系推理:人际关系、空间关系、大小关系、物种关系 功能推理:硬件功能推理、软件功能推理 环境推理:环境状态分析、基于环境的行为推理、具身智能 异常推理:图像异常识别、缺陷检测、事故判断 幽默推理 其他常识推理:状态推理、原因推理、属性比较、视错觉、趣味游戏、意图解释、行为预测 |
| 逻辑推理(Logical Reasoning) | 要求模型结合图像理解,综合运用领域知识和逻辑推理能力完成任务 | 数学推理:代数与运算、平面几何、立体几何 其他逻辑推理:物理、化学、生物、编程、智力题 |
| 评估(Evaluation) | 要求模型根据特定标准评估图像内容 | 现实评估、相似性评估、美学评估、开放式评估、改进建议 |
| 多图(Multi-graph) | 考察模型分析和理解多张图像的能力 | 时间序列理解:事件预测、图像排序、行为分析 多图比较:属性比较、图文匹配、找关联、找不同、图像判别 |
| 安全(Safety) | 考察模型在安全方面的表现 | 诱导性问题、反事实提问、提示注入 |
表3 | 自有 SFT 数据的分类体系
此外,我们将 DeepSeek-LLM(DeepSeek-AI, 2024)中使用的纯文本 SFT 数据作为联合视觉和语言 SFT 数据的一部分纳入。
3. 方法
3.1 架构设计
我们的系统包含三个模块:混合视觉编码器、视觉适配器和语言模型。本节逐一介绍各部分。
混合视觉编码器(Hybrid Vision Encoder)
我们采用 SigLIP 作为视觉编码器,从视觉输入中提取高级语义特征表示。然而,我们观察到单个 SigLIP 编码器难以全面解决所有真实世界问题。CLIP 家族的视觉编码器(包括 SigLIP)主要针对语义视觉表示进行设计,但在模糊编码方面面临挑战,导致视觉上不同的图像因所谓的 “CLIP 盲对”(CLIP-blind pairs) 而被编码为相似(Tong et al., 2024)。同时,CLIP 家族模型受限于其相对较低的分辨率输入(如 224×224、336×336、384×384、512×512),这限制了它们处理需要更详细低级特征的任务的能力,如密集 OCR 和视觉定位任务。
为解决这些限制,近期研究(Lin et al., 2023b; Tong et al., 2024; Wei et al., 2023)主张集成额外的纯视觉自监督编码器,以增强多模态模型的视觉定位能力。基于先前动机,我们还额外利用基于 SAM-B(Kirillov et al., 2023)的纯视觉编码器——一个预训练的 ViTDet(Li et al., 2022)图像编码器来处理低级特征,它接受高分辨率 1024×1024 图像输入。除了 SAM-B 编码器外,我们保留了低分辨率 384×384 图像输入的 SigLIP-L 视觉编码器。因此,我们的混合视觉编码器结合了 SAM-B 和 SigLIP-L 编码器,在保留语义和详细信息的同时高效编码高分辨率 1024×1024 图像。
具体来说,高分辨率 SAM-B 视觉编码器首先将图像调整为 1024×1024,生成 64×64×256 的特征图。对于 SAM-B 生成的大小为 64×64×256 的高分辨率特征图,VL 适配器首先将其插值为 96×96×256。随后,它使用两个步长为 2 的卷积层,产生 24×24×1024 的特征图,并将其重塑为 576×1024。与此同时,SigLIP-L 生成的 576×1024 低分辨率特征图与高分辨率特征拼接,产生 576 个维度为 2048 的视觉 token。这些视觉 token 具有增强高级语义视觉识别和低级视觉定位任务的强大能力。然后它们经过 GeLU 激活并通过嵌入层建立与语言模型的连接。
视觉-语言适配器(Vision-Language Adaptor)
我们采用两层混合 MLP 来桥接视觉编码器和 LLM。最初,使用不同的单层 MLP 分别处理高分辨率特征和低分辨率特征。随后,这些特征沿维度拼接,然后通过另一层 MLP 转换到 LLM 的输入空间。
语言模型(Language Model)
我们的语言模型建立在 DeepSeek LLM(DeepSeek-AI, 2024)之上,其微观设计很大程度上遵循 LLaMA(Touvron et al., 2023a,b)的设计,采用 Pre-Norm 结构配合 RMSNorm(Zhang & Sennrich, 2019)函数,并使用 SwiGLU(Shazeer, 2020)作为前馈网络(FFN)的激活函数,中间层维度为 8dmodel8d_{model}8dmodel。它还融合了旋转嵌入(Rotary Embedding)(Su et al., 2024)进行位置编码,并与 DeepSeek-LLM 使用相同的分词器。
我们引入了一系列 DeepSeek-VL 模型。鉴于我们要进行多模态和语言的联合预训练目标,我们选择了 DeepSeek 预训练模型的中间检查点继续预训练。具体来说,DeepSeek-VL-1B 模型基于 DeekSeek-LLM-1B 模型构建,该模型使用了约 5000 亿文本 token 的语料库进行训练。而 DeekSeek-VL-7B 模型则利用 DeepSeek-LLM-7B 模型开发,该模型使用了约 2 万亿文本 token 进行训练。

图2 | 可视化结果示例:DeepSeek-VL 能够捕捉微小物体并给出有条理的解释。(例如准确判断骑行者在女性手提包的哪一侧)
3.2 训练流程
我们按图 3 所示的三个连续阶段训练 DeepSeek-VL:视觉-语言适配器预热 → 联合视觉-语言预训练 → 监督微调。目前我们专注于视觉理解能力,仅在语言部分计算下一个 token 预测损失。
┌─────────────────────────────────────────────────────────────────────┐
│ 阶段1: 训练VL适配器 │ 阶段2: 联合VL预训练 │ 阶段3: 监督微调 │
├─────────────────────────────────────────────────────────────────────┤
│ DeepSeek LLM │ DeepSeek LLM │ DeepSeek LLM │
│ ┌─────────┐ │ ┌─────────┐ │ ┌─────────┐ │
│ │VL Adaptor│ │ │VL Adaptor│ │ │VL Adaptor│ │
│ └────┬─────┘ │ └────┬─────┘ │ └────┬─────┘ │
│ │ │ │ │ │ │
│ ┌────▼─────┐ │ ┌────▼─────┐ │ ┌────▼─────┐ │
│ │SAM-B │ │ │SAM-B │ │ │SAM-B │ │
│ │SigLIP-L │ │ │SigLIP-L │ │ │SigLIP-L │ │
│ └──────────┘ │ └──────────┘ │ └──────────┘ │
│ 混合视觉编码器(冻结) │ 混合视觉编码器(冻结) │ 混合视觉编码器(SigLIP-L训练)│
├─────────────────────────────────────────────────────────────────────┤
│ 数据: │ 数据: │ 数据: │
│ • 交错VL数据 │ • 交错VL + VL对话数据 │ • VL对话SFT数据 │
│ • 图像-文本对 │ • 纯语言序列 │ • 纯语言对话数据 │
│ • 文档OCR渲染对 │ │ │
└─────────────────────────────────────────────────────────────────────┘

图3 | 我们的训练流程包含三个阶段
阶段一:训练视觉-语言适配器
本阶段的主要目标是在嵌入空间内建立视觉和语言元素之间的概念链接,从而促进大语言模型(LLM)对图像中所描绘实体的全面理解。与 LLaVA(Liu et al., 2024b)和 Instruct-BLIP(Dai et al., 2023)的先前研究一致,我们采用类似的方法,在此阶段保持视觉编码器和 LLM 冻结,仅允许视觉-语言适配器内的可训练参数参与训练。我们使用包含从 ShareGPT4V 获取的 125 万图像-文本配对描述以及 250 万文档 OCR 渲染对的数据集来训练 VL 适配器。
然而,与大语言模型(LLMs)相比,视觉-语言适配器(如 2 层 MLP)的参数容量明显较小。这种模型容量的限制限制了此阶段可学习的能力。一个自然的问题是:数据缩放定律在此阶段是否有效? 为解决这个问题,我们在表 8 中进行了简单实验。结果表明,在此阶段扩大数据规模不会带来好处,甚至可能导致性能下降。因此,我们继续解冻大语言模型(LLM),并在阶段 2 探索高效的视觉-语言预训练方法。
阶段二:联合视觉-语言预训练
在此阶段,我们探索有效的预训练策略,这可以作为使大语言模型(LLMs)理解多模态输入的额外阶段。我们保持视觉编码器冻结,优化语言模型和 VL 适配器。
最初,我们尝试直接使用多模态数据训练 LLM。然而,我们发现虽然多模态性能指标逐步提高,但语言指标出现急剧严重的下降(如图 4 所示,多模态:语言 = 100%:0%)。这凸显了在 LLM 基础上进行直接多模态预训练的固有挑战,揭示了增强多模态能力和保留语言熟练度之间的关键权衡。
我们假设观察到的现象源于两个主要因素:首先,大多数多模态语料库过于简单,与语言数据的复杂性和分布存在显著差异;其次,多模态和语言模态之间存在竞争动态,导致 LLM 内语言能力的灾难性遗忘。
联合语言-多模态训练
为应对这一挑战,我们设计了一种直接而有效的联合语言-多模态训练策略。在训练过程中,我们不仅进行多模态数据训练,还将大量比例的语言数据纳入训练。这种方法旨在平衡训练重点,减轻观察到的负面影响。我们在 DeepSeek-VL 1B 模型上进行了实验(图 4),探索不同模态混合比例的影响。
对图表的分析得出几个关键结论:
- 整合语言数据显著缓解了语言能力的下降,表明模型的语言性能有大幅改善;
- 加入语言数据不会导致多模态性能的显著损失,表明模型保留了多模态处理能力;
- 不同模态的性能与其在训练数据集中的比例密切相关,证实了两种模态之间的竞争关系。
最终,我们为最终模型选择了约 7:3 的语言与多模态数据训练比例。这一比例使模型能够在保持语言能力的同时,在多模态数据上实现更好的预训练,有效平衡了语言和多模态能力的发展。
视觉-语言预训练的扩展
然而,模型的预训练阶段会产生大量的计算成本,在 7B 模型上进行迭代需要过多的计算能力和时间。一种合适的策略是在较小的模型(特别是 1.3B 模型)上进行实验,然后将其扩展到 7B 模型。幸运的是,我们观察到 1.3B 模型获得的大部分结果可以通过 SFT 有效转移到 7B 模型(如编码器设计)。然而,在阶段 2 训练期间,我们遇到了 1.3B 模型生成指标的相当大波动,使得难以有效监督训练过程。正如 Schaeffer et al. (2024) 所讨论的:“即使模型系列的每 token 错误率随规模增加平滑、连续且可预测地变化,研究者选择的测量方式也可能导致剧烈且不可预测的变化。” 后续实验使我们确定了问题的根本原因:1.3B 模型的容量有限以及训练数据集中缺乏 SFT 数据,这两者都阻碍了模型准确遵循指令的能力。即使模型拥有正确选项的知识,也难以精确地生成它们。
为缓解这些挑战,我们采用双重方法:首先,我们采用多项选择 PPL 方法来监控模型的进展。这不仅涉及将提示词和图像输入网络,还涉及输入与问题相关的所有答案。随后,我们计算每个答案位置(如 A、B、C、D)的 PPL,并将模型认为正确的选项选为最终答案。其次,我们以最小比例将 SFT 数据引入训练数据集,使模型获得一定的指令遵循能力。这两种方法的结合确保了 1.3B 模型稳定训练指标的维护,并在阶段 3 后带来更好的性能。

图4 | 训练阶段 2 不同模态融合比例的比较性能结果
过大的多模态数据比例(多模态:语言=100%:0%)导致 LLM 语言能力的严重遗忘。合适的比例(多模态:语言≈70%:30%)能有效缓解语言遗忘问题,同时增强模型的多模态能力。
阶段三:监督微调
在此阶段,我们使用基于指令的微调对预训练的 DeepSeek-VL 模型进行微调,以增强其遵循指令和进行对话的能力,最终创建交互式的 DeepSeek-VL-Chat 模型。我们使用表 2 中的视觉-语言 SFT 数据优化语言模型、VL 适配器和混合视觉编码器(SAM-B 由于 GPU 内存有限保持冻结)。我们只监督答案和特殊 token,屏蔽系统和用户提示词。为保证模型在对话中的全面熟练度,我们使用 DeepSeek-LLM 中使用的多模态数据和纯文本对话数据的混合。这种方法确保模型在各种对话场景中的多功能性。

图5 | 可视化结果示例:DeepSeek-VL 能够理解 Python 代码并提供详细且有组织的解释。
3.3 超参数与基础设施
所有阶段的详细超参数如表 4 所示。我们使用 HAI-LLM(High-flyer, 2023)——一个轻量级高效的分布式训练框架来训练和评估 DeepSeek-VL。由于我们使用视觉编码器将图像转换为嵌入向量,然后将图像嵌入和文本嵌入统一处理,我们可以轻松地将管道并行性适配到 VL 模型训练中:我们需要做的就是将视觉编码器和文本嵌入视为单个模块,并将其作为结果模型的第一层。这一第一层具有复杂的模型结构,排除了标准张量并行技术的使用,但幸运的是,与上层标准 Transformer 块相比,它需要的计算量相对较小。因此,我们只需在所有张量并行秩上重新计算视觉编码器的前向传播。视觉编码器的存在还导致模型层之间的执行时间不均匀,因此我们在流水线并行秩之间重新划分模型层,以实现更好的负载平衡和吞吐量。DeepSeek-VL 的上层与 DeepSeek-LLM 完全相同。通过这种微小的修改,我们现在可以像 Megatron(Korthikanti et al., 2023; Narayanan et al., 2021; Shoeybi et al., 2019)一样执行规范的 3D 并行技术,并像 DeepSeek-LLM(DeepSeek-AI, 2024)一样重叠计算和通信。
DeepSeek-VL-7B 在包含 64 个节点(每个节点配备 8 块 Nvidia A100 GPU)的集群上消耗了 5 天时间,而 DeepSeek-VL-1B 在包含 16 个节点的设置上消耗了 7 天时间。
| 超参数 | DeepSeek-VL-1B | DeepSeek-VL-7B | ||||
|---|---|---|---|---|---|---|
| 阶段1 | 阶段2 | 阶段3 | 阶段1 | 阶段2 | 阶段3 | |
| 视觉编码器 | SigLIP | SigLIP | SigLIP | SigLIP+SAM | SigLIP+SAM | SigLIP+SAM |
| 学习率 | 1.0×10⁻³ | 3×10⁻⁵ | 2.0×10⁻⁵ | 1.0×10⁻³ | 4.2×10⁻⁵ | 2.0×10⁻⁵ |
| LR调度器 | Cosine | Step | Cosine | Cosine | Step | Cosine |
| 权重衰减 | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 |
| 梯度裁剪 | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 |
| 优化器 | AdamW (β₁=0.9, β₂=0.95) | AdamW (β₁=0.9, β₂=0.95) | ||||
| 预热步数 | 128 | 2000 | 256 | 128 | 2000 | 256 |
| 训练步数 | 15000 | 96000 | 10000 | 15000 | 42000 | 10000 |
| 批次大小 | 256 | 1024 | 256 | 256 | 2304 | 256 |
| 序列长度 | 512 | 4096 | 4096 | 512 | 4096 | 4096 |
| 序列打包 | ✗ | ✓ | ✓ | ✓ | ✓ | ✓ |
| 流水线并行 | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ |
表4 | DeepSeek-VL 的详细超参数配置
4. 评估
4.1 公开多模态基准测试
我们在一系列公开基准测试上评估模型:
- 多模态综合理解数据集:MMMU(Yue et al., 2023)、CMMU(Zhang et al., 2024)、MMBench(Liu et al., 2023a)、MMBench-CN(Liu et al., 2023a)、SeedBench(Li et al., 2023a)和 MMV(Yu et al., 2023b)
- 图表/表格理解数据集:OCRBench(Liu et al., 2023b)
- 幻觉数据集:POPE(Li et al., 2023b)
- 科学问题数据集:ScienceQA(Lu et al., 2022a)和 MathVista(Lu et al., 2023)
我们采用基于生成的评估方法配合贪心解码。比较结果(表 5)显示,DeepSeek-VL-7B 在各种基准测试中超越了大多数同等规模的开源模型。
DeepSeek-VL 在 MMB、MMC 和 SEED Bench 等基准测试中超越同等规模的开源模型,甚至接近专有模型(DeepSeek-VL vs. GPT-4V = 70.4 vs. 71.6 on SeedBench),展示了其强大的自然图像理解能力。该模型在数学逻辑上也超越了所有开源模型,但仍显著落后于 GPT-4V 等专有模型(MathVista 上 36.1 vs. 47.8)。这种差异可能归因于基础模型规模的差异。
此外,如表 6 所示,DeepSeek-VL-1.3B 显著超越同等规模的模型。它在 MMB 基准测试中展现出优于领先开源模型的性能,同时使用的参数量仅接近一半(1.3B vs. 2.7B),表明其稳健的自然图像理解能力。DeepSeek-VL-1.3B 甚至在 MathVista 上达到了与 7B 开源模型相当的结果,进一步验证了 DeepSeek-VL 系列强大的逻辑理解能力。
表5:不同多模态模型对比(上半部分为专有模型,下半部分为开源模型)
| LLM | MMMU | CMMMU | MMB | MMC | SEED | OCRB | POPE | MathV | MMVet |
|---|---|---|---|---|---|---|---|---|---|
| 闭源 LMMs | |||||||||
| Gemini Pro | Unk | 48.9 | - | 75.2 | 74.0 | 70.7 | 659 | - | 45.2 |
| GPT-4V | Unk | 56.8 | 42.5 | 75.0 | 74.7 | 71.6 | 659 | - | 47.8 |
| Qwen-VL-Plus | Unk | 45.2 | 39.5 | 66.2 | 69.6 | 72.7 | - | - | 43.3 |
| Qwen-VL-MAX | Unk | 51.4 | - | 78.1 | 76.4 | 72.7 | - | - | 51.0 |
| 开源 13B LMMs | |||||||||
| LLaVA-1.5 13B | 36.4 | - | 68.2 | 61.9 | 68.2 | 331 | 85.9 | 26.4 | 38.3 |
| VILA 13B | - | - | 70.3 | 64.3 | - | - | 84.2 | - | 38.8 |
| LLaVA-Next 13B | 36.2 | - | 70.0 | 64.4 | 71.9 | - | 86.7 | 35.3 | 48.4 |
| 开源 7B LMMs | |||||||||
| EMU2-Chat 7B | 36.3 | 23.8 | 63.6 | 45.9 | 68.9 | - | - | 30.0 | 31.0 |
| Qwen-VL-Chat 7B | 37.0 | - | 60.6 | 56.7 | 64.8 | - | - | 33.8 | 47.3 |
| CogVLM 7B | 37.3 | 24.8 | 63.7 | 53.8 | 68.8 | - | - | 34.7 | 54.5 |
| LLaVA-Next 7B | 35.8 | - | 67.4 | 60.0 | 70.2 | - | 86.5 | 34.6 | 43.9 |
| Yi-VL 6B | 37.8 | 35.8 | 68.2 | 68.9 | 67.6 | - | - | 28.0 | 31.1 |
| DeepSeek-VL (Ours) 7B | 36.6 | 37.9 | 73.2 | 72.8 | 70.4 | 456 | 88.1 | 36.1 | 41.5 |
表5 | 不同多模态模型的对比
表6:小型多模态模型对比
| LLM | MMMU | CMMMU | MMB | MMC | SEED | OCRB | POPE | MathV | MMVet |
|---|---|---|---|---|---|---|---|---|---|
| MobileVLM 1.4B | - | - | 53.2 | - | - | 84.5 | - | - | - |
| MobileVLM 2.7B | - | - | 59.6 | - | - | 84.9 | - | - | - |
| MobileVLM V2 1.4B | - | - | 59.6 | - | - | 84.3 | - | - | - |
| MobileVLM V2 2.7B | - | - | 63.2 | - | - | 84.7 | - | - | - |
| LLaVA-Phi 2.7B | - | - | 59.5 | - | - | 85.0 | - | 28.9 | - |
| DeepSeek-VL (Ours) 1.3B | 32.2 | 27.4 | 64.6 | 61.3 | 66.7 | 409 | 87.6 | 31.1 | 34.8 |
表6 | 小型多模态模型的对比
4.2 公开语言基准测试
我们在以下公开语言基准测试上评估模型:
- 多科目多项选择数据集:MMLU(Hendrycks et al., 2020)
- 语言理解和推理数据集:HellaSwag(Zellers et al., 2019)
- 语言建模数据集:Pile(Gao et al., 2020)
- 数学数据集:GSM8K(Cobbe et al., 2021)
- 代码数据集:MBPP(Austin et al., 2021)
- 标准化考试:AGIEval(Zhong et al., 2023)
我们对需要从多个选项中选择答案的数据集采用基于困惑度的评估。这些数据集包括 HellaSwag 和 MMLU。基于困惑度的评估是指计算每个选项的困惑度并选择最低的一个作为模型预测。基于困惑度的评估有助于区分模型预测之间的微妙概率差异,避免精确匹配风格评估的不连续性。我们对 GSM8K 和 AGIEval 采用基于生成的评估配合贪心解码。我们对 Pile-test 采用基于语言建模的评估,即在测试语料库上计算每字节数(bits-per-byte)。结果如表 7 所示。
| 基准测试 | DeepSeek-VL 1B Chat | DeepSeek-VL 7B Chat | DeepSeek-LLM 7B Chat |
|---|---|---|---|
| 编码器 | SigLIP | SigLIP+SAM | None |
| HellaSwag | 56.0 | 68.4 | 68.5 |
| MMLU | 32.5 | 52.4 | 49.4 |
| GSM8K | 18.0 | 55.0 | 63.0 |
| MBPP | 10.0 | 35.2 | 35.2 |
| AGIEval | 14.0 | 27.8 | 19.3 |
表7 | 语言基准测试性能
可以看出,在大多数语言基准测试上,DeepSeek-VL 的表现与甚至超过 DeepSeek-7B 相当。例如,它在 HellaSwag 上分别达到 68.4 vs. 68.5 的分数,HellaSwag 是评估一般语言能力的通用基准。DeepSeek-VL 在 MMLU 和 AGIEval 等指标上优于 DeepSeek-7B,表明多模态训练方法甚至可能有助于语言任务。不过,DeepSeek-VL-7B 在数学方面(GSM8K)表现出一定程度的下降,这表明尽管努力促进视觉和语言模态之间的和谐,两者之间仍存在竞争关系。这可能归因于有限的模型容量(7B),更大的模型可能会显著缓解这一问题。总体而言,DeepSeek-VL 致力于在应对这些挑战的同时,最大限度地减少语言能力的下降。
4.3 人工评估
为进一步探索 DeepSeek-VL 的能力,我们独立构建了一个用于人工评估的数据集。该数据集包含 100 个问题,分为七个类别,每个类别包含特定任务。这些类别和任务与我们自有 SFT 数据的分类体系(表 3)相同。这种方法确保我们测试的任务具有普遍性,并涵盖多模态模型的大多数用例。
此外,根据现有报告中描述的类别和任务,我们收集了相似的图像材料并开发了提示词。这些图像材料的来源包括免版税图像社区和研究人员拍摄的照片。这种有条理的收集和提示词制定过程确保我们的数据集既全面又能代表真实世界的多模态模型应用。
我们将 DeepSeek-VL-7B 与 InternLM-XComposer2-VL、CogVLM 和 GPT-4V 进行比较(如图 6 所示,我们还在附录 A 中提供了可视化结果)。GPT-4V 在大多数维度上表现出色。所有开源模型在逻辑推理方面仍远落后于 GPT-4V,突显了扩大大型语言模型(LLM)规模的必要性。DeepSeek-VL-7B 在整体性能上取得更好结果,在识别、转换和常识推理方面接近 GPT-4V 的水平。

图6 | 人工评估结果:InternLM-XComposer2-VL、CogVLM-17B、DeepSeek-VL 和 GPT-4V 的对比
此外,我们使用 GPT-4V 进行 comparative assessment,在 99 个专为人工评估设计的测试样本上评估 DeepSeek-VL 与其他模型的性能。按照 Zheng et al. (2024) 的方法,我们向 GPT-4V 展示问题和两个不同模型的答案,并让 GPT-4V 判断哪个更好或宣布平局。结果表明,在大多数情况下倾向于 DeepSeek-VL 的回答,因为 GPT-4V 倾向于对 DeepSeek-VL 的答案质量给予更高的评价。如图 7 所示,在与开源多模态模型(包括 Fuyu-8B、CogVLM-17B 和 InternLM-XComposer2-VL)的比较中,DeepSeek-VL 在超过 60% 的实例中被判定为更优。此外,与其他专有模型(如 GPT-4V 本身)相比,DeepSeek-VL 展现出同样出色的性能。

图7 | 基于 GPT-4V 的评估结果:DeepSeek-VL 与其他模型的对比(99 个测试样本)
4.4 消融实验
投影器训练数据扩展
我们扩展了阶段 1(投影器预热)的数据集,然后应用监督微调。结果(图 8)表明,在此阶段增加训练数据量并不能提高性能。这意味着投影器的容量本质上受到限制,无法捕获多模态任务所需的广泛知识。
| 阶段1 训练步数 | MMB | MMC | SEED | POPE | MMMU | 平均 |
|---|---|---|---|---|---|---|
| 2K | 59.0 | 54.0 | 61.8 | 82.3 | 30.3 | 57.5 |
| 8K | 58.0 | 45.0 | 58.5 | 84.9 | 29.2 | 55.1 |
| 20K | 56.0 | 52.3 | 59.0 | 81.7 | 28.6 | 55.5 |
| 80K | 58.1 | 55.0 | 58.6 | 78.6 | 27.9 | 55.6 |
表8 | 扩展阶段 1 数据后直接 SFT 性能对比结果
结果表明,在此阶段扩大数据规模不会带来好处,甚至导致性能下降。
训练阶段贡献分析
在表 9 中,我们检查了各阶段对模型性能的贡献。很明显,结合阶段 1、阶段 2 和阶段 3 在所有指标上均显著优于仅结合阶段 1 和阶段 3,证明了多模态预训练的有效性。此外,阶段 2 和阶段 3 的组合仍略逊于阶段 1、2、3 的组合性能,表明视觉-语言适配器预热阶段仍有意义。
| 阶段1 | 阶段2 | 阶段3 | MMB | MMC | SEED | POPE | MMMU | 平均 |
|---|---|---|---|---|---|---|---|---|
| ✓ | ✓ | 59.4 | 54.2 | 61.4 | 82.5 | 29.2 | 57.4 | |
| ✓ | ✓ | 63.4 | 60.5 | 65.9 | 87.1 | 31.8 | 61.7 | |
| ✓ | ✓ | ✓ | 64.3 | 61.3 | 66.7 | 87.6 | 32.2 | 62.4 |
表9 | 各训练阶段模型性能分析
模态分组训练

在混合语言和多模态数据时,我们观察到在批次级别直接混合会显著降低训练效率。这种效率低下的原因在于每个批次梯度反向传播过程都需要等待最慢的样本完成。因此,处理速度更快的纯语言数据最终需要等待多模态样本完成,导致整体训练效率下降。
为解决此问题,我们尝试在每个全局步骤对不同模态的数据进行分组。这种方法涉及组织训练数据,使批次在不同的训练步骤中完全由语言数据或多模态数据组成,而不是在同一批次内混合。结果如图 8 所示,我们观察到这种方法在不损害模型性能的同时,将模型的训练效率提高了约 20%。该策略有效规避了模态间处理时间差异造成的瓶颈,优化了训练工作流。
模态预热
考虑到我们的方法涉及在语言模型基础上进行多模态训练,从一开始就以固定比例直接混合多模态数据可能使模型不稳定。为抵消这一问题,我们提出了一种简单而有效的模态预热策略。最初,我们将语言比例设为 1,然后逐渐降低到最终模型训练的目标比例(如 0.7)。
我们的实验(如图 9 所示)证明,该策略有效防止了训练开始时语言能力的显著下降,同时在最终阶段为语言和多模态领域带来相对优越的结果。这种渐进式适应使模型能够更无缝地调整到多模态数据的融入,从而提高整体训练稳定性和性能。

图9 | 模态预热的性能对比(Pile-test 语言基准 / MMBench 和 MMBench_CN 多模态基准)
视觉编码器选择
为了更好地获取和利用图像信息,我们在训练设置下比较了不同视觉编码器的训练损失(为提高效率,将阶段 2 的训练步骤减少到 8000)。如图 10 所示,整合纯视觉自监督编码器被发现能显著提高训练损失方面的性能。为更有效地处理高分辨率图像,我们的研究最终采用了混合视觉编码器策略,结合 SigLIP 和 SAM 进行模型实现。
图10 | 不同视觉编码器在阶段 2 训练损失上的对比分析
视觉-语言适配器设计
为提高从视觉编码器提取信息的效率,同时遵守当前的 token 长度限制,可以从两个方面对视觉-语言适配器进行调整:视觉特征的组合方式和 MLP 适配器的设计。
先前的研究(Tong et al., 2024)表明,沿序列维度组合视觉特征可以获得更好的模型性能,但这伴随着由于视觉特征 token 序列更长而导致计算需求增加的权衡。如表 10 上半部分所示,在序列拼接之前沿图像宽度或高度维度堆叠视觉特征以保持序列长度不变,在大多数指标上并未取得比简单地沿嵌入维度合并更好的结果。
就适配器架构而言,为每个视觉特征编码器采用独立的 MLP 适配器允许对视觉特征的特定值和分布模式进行更精确的调整,促进更平滑的模型训练。相反,为不同的视觉编码器使用共享的 MLP 适配器有助于充分的特征融合。我们采用混合策略并报告了稳定且改进的性能(如表 10 下半部分所示)。
| 架构 | MMB | MMC | SEED | POPE | ScienceQA | MMMU | OCRB | 平均 |
|---|---|---|---|---|---|---|---|---|
| 序列拼接 | ||||||||
| TokenPooling-W | 61.2 | 59.6 | 61.6 | 86.5 | 57.7 | 31.6 | 304 | 55.5 |
| TokenPooling-H | 59.9 | 58.3 | 61.6 | 83.8 | 55.0 | 32.0 | 291 | 54.2 |
| 嵌入拼接 | ||||||||
| HybridMLP | 61.7 | 60.1 | 62.9 | 87.8 | 56.6 | 31.3 | 309 | 55.9 |
| SharedMLP | 62.0 | 58.9 | 62.5 | 86.6 | 54.7 | 30.2 | 318 | 55.2 |
| SeparateMLP | 57.5 | 58.7 | 63.1 | 86.5 | 56.6 | 29.0 | 299 | 54.5 |
表10 | 不同适配器架构对比(使用 SigLIP 和 SAM 作为混合视觉编码器)
粗体表示最佳结果,下划线表示次佳结果。
5. 结论、局限性与未来工作
在本技术报告中,我们介绍了 DeepSeek-VL,一系列大规模多模态语言模型,提供 1.3B 和 6.7B 参数规模。本报告揭示了主流基于投影器的预训练方法的内在局限性,为 DeepSeek-VL 采用的创新方法奠定了基础。通过优先考虑联合视觉和语言(VL)预训练阶段,DeepSeek-VL 通过确保多模态数据的整合不损害大语言模型(LLM)的语言能力而超越传统模型。这是通过战略性的预热更新比例和混合视觉编码器的引入共同实现的,使高效处理高分辨率图像而不丢失语义丰富性成为可能。
混合视觉编码器的融入——能够在受限的 token 预算内处理 1024×1024 图像——体现了我们对跨不同任务保留细致细节和语义完整性的承诺。因此,DeepSeek-VL 作为先驱模型脱颖而出,不仅满足而且超越了同类通用模型的标准。它在以视觉为中心的各种基准测试中展现出色性能,同时在以语言为中心的评估中保持强大的熟练度。
通过公开发布 DeepSeek-VL,我们旨在催化研究社区内的进一步创新和探索,为未来研究提供坚实的基础。这种开放的姿态旨在促进我们在处理多模态数据的理解和能力方面的集体进步。
展望未来,我们兴奋地宣布计划将 DeepSeek-VL 扩展到更大规模,整合混合专家(Mixture of Experts, MoE)技术。这一即将到来的扩展有望进一步提高模型的效率和有效性,为研究和应用领域开辟新的前景。
当前局限性
- 在数学推理(GSM8K)方面,DeepSeek-VL-7B 相比纯语言模型有一定程度的下降,表明视觉和语言模态之间仍存在竞争关系
- 在数学逻辑基准(MathVista)上仍显著落后于 GPT-4V 等专有模型(36.1 vs. 47.8),这可能受限于基础模型规模
- 在逻辑推理方面,所有开源模型(包括 DeepSeek-VL)仍远落后于 GPT-4V,突显了扩大 LLM 规模的必要性
未来方向
- 将 DeepSeek-VL 扩展到更大规模,整合 MoE 技术
- 进一步提升高分辨率图像处理能力
- 探索更多真实世界应用场景
- 持续优化多模态训练策略以更好地平衡语言和多模态能力
参考文献(精选)
- Anthropic. Introducing Claude, 2023.
- Bai, Y., et al. Q-VLM: A Multimodal Large Language Model, 2023.
- Bavishi, R., et al. InstructBLIP, 2023.
- Blecher, J., et al. Nougat: Neural Optical Understanding for Academic Documents, 2023.
- Chen, W., et al. ShareGPT4V, 2023.
- DeepSeek-AI. DeepSeek-LLM: Scaling Open-Source Language Models with Longcontext, 2024.
- Dong, P., et al. InternLM-XComposer2-VL, 2024.
- Google. Gemini, 2023.
- Hendrycks, D., et al. Measuring Massive Multitask Language Understanding, 2020.
- Kirillov, A., et al. Segment Anything (SAM), 2023.
- Li, B., et al. BLIP-2, 2023.
- Li, B., et al. LLaVA, 2024.
- Lin, Z., et al. MiniGPT-4, 2023.
- Liu, F., et al. MMBench, 2023.
- Lu, H., et al. Learn to Explain, 2022.
- Mao, J., et al. Referential Expression Comprehension, 2016.
- OpenAI. GPT-4 Technical Report, 2023.
- OpenAI. GPT-4V System Card, 2023.
- Schaeffer, R., et al. Are Emergent Abilities of Large Language Models a Mirage?, 2024.
- Shazeer, N. GLU Variants Improve Transformer, 2020.
- Team, G., et al. Gemini: A Family of Highly Capable Multimodal Models, 2023.
- Tong, Z., et al. CLIP Blind Spots, 2024.
- Touvron, H., et al. LLaMA, 2023.
- Wang, P., et al. CogVLM, 2023.
- Wei, J., et al. EVA-02, 2023.
- Yang, T., et al. WikiHow, 2021.
- Yu, G., et al. Qwen-VL, 2023.
- Zhu, W., et al. MMC4, 2024.
更多推荐




所有评论(0)