传统文档解析的效率瓶颈主要源于“串行等待”机制——尽管正文、公式、表格之间并无依赖关系,却仍需按顺序逐字生成。这种流水线式处理方式并非最优方案。更高效的思路类似于团队协作:先完成整体布局规划,再由不同成员并行处理各自任务,最后汇总结果。
基于这一思路,PaddleOCR 团队推出了 HPD-Parsing(层级并行文档解析技术)。其核心机制为:主线布局分支负责统一理解页面结构,动态将不同区域分发至多个内容分支并行解析;同时结合渐进式多 token 预测,进一步减少各分支解码步骤,实现多层级高度并行。

测试结果非常直观:HPD-Parsing 使1B参数基线模型的 Token 吞吐量提升至3倍以上。在单张 NVIDIA A800 GPU 上,OmniDocBench v1.6 评测集的 TPS(每秒 Token 生成量)达到 4,752.1,页吞吐(PPS)为 2.68,解析精度保持行业第一梯队,效率则遥遥领先。
项目代码与模型权重已开源至 GitHub 和 HuggingFace,用户可直接下载使用。
GitHub:https://github.com/PaddlePaddle/PaddleOCR
HuggingFace:https://huggingface.co/PaddlePaddle/HPD-Parsing
ArXiv 论文地址:https://arxiv.org/abs/2607.18839
效果速览
1、层级并行解析机制
HPD-Parsing 将传统单一解码序列重构为层级并行生成过程。主布局分支首先识别区域类别、位置与阅读顺序,随后动态创建内容分支,并行生成具体内容。
2、大幅拉升基线吞吐,解析效率新 SOTA
OmniDocBench v1.6 评测集 512 并发测试:传统自回归基线的 Token 吞吐为 1,554.8,页吞吐为 1.02;引入 HPD 后,分别提升至 4,752.1 和 2.68,在众多模型中领先。
3、解析效率优势随文档长度显著提升
按输出序列长度等间隔划分测试集,结果显示:随着文档长度增加,HPD-Parsing 相对于自回归模型的优势持续扩大——解码步数最高压缩 18.04 倍,批量请求吞吐最高提升 3.67 倍,单并发推理时延最高下降 5.8 倍。
这并非固定比例提升,而是从解码机制上缓解了“文档越长、等待越久”的结构性瓶颈。页面越复杂,可并行解析的区域越多,效率优势越明显。
4、解析精度保持行业第一梯队
在扫描场景下,OmniDocBench v1.6 指标达 94.91%,文本识别、公式、表格与阅读顺序等关键能力均保持极具竞争力的表现。
是什么在拖垮解析效率:真正的瓶颈不在“看”,而在“写”
对一个经典1B参数规模的统一式自回归模型进行耗时统计发现:视觉编码时间相对稳定,而解码耗时随输出长度快速增长。尤其在长文档场景中,解码时间可达视觉编码时间的近500倍。这意味着,模型的主要瓶颈并非“看完整张图片”,而是“逐 token 写出结果”。更形象地说:文档模型虽能快速浏览整页,却仍需逐个字符地“抄写”。深入分析可知:页面结构确实需要全局理解——如标题层级、多栏布局、区域位置与阅读顺序;但某个文本段落、公式或表格的具体内容解析,通常仅依赖对应区域图像及必要上下文,无需等待其他区域全部生成完毕。因此,文档需要整体理解,却无需整体串行生成。
因此,文档需要整体理解,却不需要整体串行生成。
HPD-Parsing:让文档解析像团队抄书一样高效协作
第一层并行:全局布局协调,局部并行解析
HPD-Parsing 将传统单一解码序列重构为层级并行的生成过程。主布局分支负责识别页面中的区域类别、位置与阅读顺序;当某个区域的边界和类型确定后,模型动态创建相应的内容分支,并行生成该区域的正文、公式或表格内容。不同于传统 Pipeline 通过多个独立模块分阶段完成版面分析与内容解析,HPD-Parsing 将区域级并行直接融入统一模型的解码过程。各内容分支共享整页视觉上下文,主布局分支持续维护区域关系与阅读顺序,并依据全局布局结构组织最终输出。模型无需割裂页面上下文,即可将不同区域的内容生成转化为并发执行。换言之,HPD-Parsing 并非先将页面拆分为独立的局部任务,而是在全局统一协调下并行生成不同区域的内容。
并且,分工不等于重复工作! HPD-Parsing 采用共享前缀 KV Cache 复用机制:新分支可直接复用已计算的视觉信息和布局前缀,无需重新编码整页图像,也无需重复执行完整的 Prefill 过程。
第二层并行:每个分支一次预测多个 token
基于布局理解的动态分支解码,使得不同文档区域可以并行生成,但每个分支内部仍保留逐 token 解码的串行路径。为减少主布局分支与各内容分支的解码步数,HPD-Parsing 进一步集成了 PaddleOCR 团队在 ECCV 2026 中提出的 P-MTP(渐进式多 Token 预测)技术。P-MTP 能够在一次解码迭代中预测并验证多个后续 token,并将验证通过的 token 直接纳入输出。HPD-Parsing 平均每个解码步骤可接收 6.6 个 token,使布局分支与内容分支能够以更少的解码步数完成生成,无需逐步推进。P-MTP 的模型结构、渐进式训练方式与推理验证机制,可参考此前专题介绍。
两级并行,同时缩短区域间等待与区域内解码
由此,HPD-Parsing 形成了两个相互补充的并行维度:
- 分支间并行:不同文档区域同时解码;
- 分支内并行:每条分支一次推进多个 token。
前者减少区域之间的相互等待,后者减少单个区域内部的解码步数。二者协同作用,使整页内容不再沿着一条冗长的序列逐步生成,而是能够在不同区域之间并行展开,并在每个区域内部更快向前推进,从区域间和区域内两个层面共同缩短整体解析过程。
让模型分阶段快速适配 HPD 机制:少量数据实现解码范式迁移
HPD-Parsing 构建了一套标准化的数据生产引擎。该引擎首先对原始文档进行特征提取、聚类与代表性采样,以扩大数据覆盖范围并减少重复样本;随后结合 PaddleOCR-VL-1.5、MinerU-2.5 Pro 等模型生成伪标签,并依据中间阶段模型与伪标签之间的解析差异,将样本划分为简单、中等和困难三个等级。对于困难样本,引入更强的视觉语言模型进行多轮检查、生成与纠正;最后从难度等级、文档类型以及文本、表格、公式和复杂版式等属性维度进行分布平衡,形成兼具多样性、可靠性与针对性的训练数据。
基于这一数据引擎,进一步构建了三阶段训练数据,用于支撑分阶段的 HPD 机制适配,使模型从传统全页生成逐步过渡到层级并行解码:
第一阶段:模型首先基于 280 万条全页样本进行训练,建立通用文档解析能力,并同步初始化 P-MTP 的多 token 预测能力。
第二阶段:在已有解析能力的基础上,使用十万级别难度分布均衡的分支训练样本,完成解码范式迁移。
第三阶段:进一步选取百级别代表性难例,通过强化训练进行针对性优化。
HPD-Parsing 通过三阶段训练逐步完成能力初始化、解码范式迁移与难例强化,并配合自动化难度感知数据构建,持续发现和补强模型的薄弱环节。布局与内容监督的分解,使不同解析能力能够获得更有针对性的优化,而统一模型框架仍保留了对整页上下文与页面结构的整体建模能力。
结语
HPD-Parsing 将文档解析机制从“一条序列从头写到尾”转变为“全局协调、局部并行”的模式,在有限的适配数据下,实现了精度可靠且摆脱了完整页面串行生成的约束。值得说明的是,这种解析机制的革新与视觉 Token 压缩、注意力交互长度压缩等加速手段并不冲突,反而可以相互协同,实现更强的推理效率。当然,其意义不仅在于更高的 TPS 数值,更在于提供了一种全新的解码方式:页面结构需要全局协调,而区域内容则可以局部并行。未来,这种结构化并行的思路有望进一步扩展到其他具有明确层级结构的生成任务中。
FAQ
Q: HPD-Parsing 与 PaddleOCR-VL 系列有何关联?
A: HPD-Parsing 是 PaddleOCR 团队面向文档解析推理加速提出的最新技术研究成果。建议应用场景聚焦于扫描文档场景,且对推理效率有强需求的用户可部署体验。对于解析效果有强需求的用户,我们仍建议优先选择 PaddleOCR-VL 系列。
