DeepSeek-OCR近期引发了广泛关注,核心原因在于:它通过一种精巧的技术方案,成功解决了多模态文档解析领域长期存在的视觉token压缩难题。简单来说,就是用极少的视觉token,解码出大量的文本token,同时支持高分辨率与长文本场景,效率和内存占用表现均十分出色。
近期开源社区动作频频,多模态文档解析模型层出不穷,例如PaddleOCR-VL、MinerU2.5等。而DeepSeek-OCR作为端到端路线的代表,延续了Vary、GOT-OCR2.0的思路,但进行了全面升级。它的目标非常明确:用更少的视觉token,读取更多文字,输出更精准、更快速的解析结果。


模型架构
整个模型由两大核心组件构成:编码器(DeepEncoder)和解码器(DeepSeek3B-MoE-A570M)。结构清晰,职责明确。

DeepEncoder:高分辨率下的轻量视觉压缩器
这是整个论文最核心的部分。它专门针对现有VLMs视觉编码器的三大痛点而设计:高分辨率输入时token爆炸、激活内存过高、不支持多分辨率。DeepEncoder包含三个模块,协同工作,高效运作。
模块1:视觉感知(窗口注意力主导)
采用SAM-base(80M参数),输入图像被切割为16×16的patch。例如,对于1024×1024的图像,会生成4096个patch token。这一步骤在之前的Vary和GOT-OCR中也有应用,其作用是通过窗口注意力捕捉图像细节——如文字的位置和字体,同时避免全局注意力带来的高内存消耗。
模块2:16×卷积压缩器
位于SAM和CLIP之间,由两层卷积构成(核大小3×3,步长2,通道数从256→1024)。关键作用是对视觉token进行16倍下采样。举例来说:1024×1024输入下,SAM输出的4096个token被压缩成256个。这个压缩比大幅降低了后续全局注意力的计算量,同时有效控制了激活内存。
模块3:视觉知识(全局注意力主导)
采用CLIP-large(300M参数),但移除了第一层patch嵌入层——因为输入已经是压缩后的token。通过全局注意力整合这些压缩后的token,提炼图像的整体语义信息,例如文档布局、文本逻辑关系,为解码器提供结构化的视觉知识。
多分辨率支持
在Base/Large模式下,通过padding保留宽高比,有效token数按公式计算,避免无效token浪费。



有效token数计算公式:
MoE解码器
解码器采用DeepSeek3B-MoE,这是一个3B参数的MoE模型,包含64个路由专家和2个共享专家。推理时仅激活6个路由专家和2个共享专家,实际激活参数约570M(仅为3B模型的19%)。这样做的好处十分明显:既保留了3B模型的文本生成能力,又将推理速度提升至“500M小模型”级别,非常适合大规模部署。
数据
数据方面分为四类,每类都有明确的定位。
OCR 1.0数据
这部分与Vary、GOT-OCR的数据构建思路类似,用于训练模型识别传统OCR场景(文档、自然场景文本)。
- 文档数据:30M页多语言PDF(100种语言,其中中英文占25M页),包含粗标注(使用fitz工具提取文本)和细标注(2M页中英文,用PP-DocLayout和MinerU2.0标注布局+文本,帮助模型理解排版)。
- 自然场景数据:20M页图像(LAION+Wukong数据集,用PaddleOCR标注,支持中英文场景文本识别)。
- Word数据:3M页,不含布局干扰,专门用于优化公式和HTML表格的识别。

OCR 2.0数据
这部分的目标是支持图表、化学公式、几何图形等结构化解析场景。
- 图表数据:10M张(线图、柱状图等),标注为HTML表格(选择HTML而非字典格式,可以节省token)。
- 化学公式:5M对图像-文本(从SMILES格式数据源用RDKit渲染出图像)。
- 平面几何:1M张(通过Slow Perception方法生成,标注线段和端点坐标,支持几何结构重建)。

通用视觉数据
为避免模型只擅长OCR场景而丢失通用视觉能力(如图像描述、目标检测),这部分数据参考DeepSeek-VL2,生成图像描述、目标检测、视觉定位等任务数据,占总数据量的20%。
纯文本数据
目的是提升解码器的文本流畅度,防止“视觉-文本”映射导致语言能力退化。使用了10%的内部纯文本数据,统一处理成8192 token的长度(与模型序列长度一致)。
训练流程
训练分两阶段,先优化编码器质量,再联合训练端到端模型。
阶段1:独立训练DeepEncoder
与Vary类似,先让编码器学会“高分辨率输入→压缩视觉token”的映射,保证token质量。训练数据包括上述所有OCR 1.0和2.0数据,以及从LAION数据集中抽取的1亿条通用数据。
阶段2:训练端到端DeepSeek-OCR
联合优化编码器和解码器的映射关系,提升OCR精度与泛化性。采用流水线并行(PP=4),DeepEncoder占2段(SAM和压缩器冻结,CLIP解冻),解码器占2段(12层MoE分成6层/段)。
此外,还有一个Gundam-M模式,专门针对超高清文档(如报纸)进行适配微调。在预训练好的DeepSeek-OCR基础上,使用6M采样数据继续训练该模式(1024×1024局部+1280×1280全局)。注意,此模式单独训练,不与其他模式混合,以避免拖慢速度。
实验



实验结果验证了架构的有效性。相比现有VLMs,DeepSeek-OCR在多个文档解析任务上表现出显著的内存降低和处理能力提升,尤其在高分辨率场景下,优势更为突出。
