先平复一下激动的心情,分享一个值得关注的消息——7月24日,阿里云低调开源了其文档解析模型OvisOCR2。该模型以96.58的综合得分,重新刷新了OmniDocBench v1.6排行榜。更重要的是,它成为首个端到端模型超越流水线方法并登顶该榜单的模型。官方称其为“技术路线的重要突破”,从行业视角来看,这并非虚言。

端到端模型首次超越流水线方法
很多人可能不太了解文档解析在AI落地中的关键作用。简而言之,它是大模型落地的关键基础设施——企业知识库、RAG检索、智能问答等场景,都需要将PDF、扫描件等非结构化文档转化为结构化文本。如果这一步做不好,后续的一切都无从谈起。
过去这个领域的主导力量是“流水线方法”。具体来说,它由版面分析模型和内容识别模型两部分组成:前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后再拼接输出。这套方法虽然成熟,但痛点也很明显——维护成本高、误差累积、部署复杂,属于典型的“三个和尚抬水喝”模式。
OvisOCR2采用端到端技术路线:输入一张文档图像,模型在一次生成中直接输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格及视觉区域。过去需要多个模型协作完成的工作,现在一个模型即可一步到位。在OmniDocBench v1.6上以96.58分登顶,这是第一次端到端模型用硬实力证明自己能够超越流水线方法。
小参数大能力,0.8B实现SOTA
令人惊讶的是,OvisOCR2的基座是Qwen3.5-0.8B——一个不到1B参数的紧凑模型。小参数究竟能有多大能量?其背后是团队构建的数据引擎体系:真实文档与合成文档互补,其中合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合了监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式训练,将紧凑模型的潜力释放到了极致。
项目已开源发布,无缝融入千问生态
OvisOCR2采用Apache 2.0许可证开源,兼容vLLM等主流推理框架,与Qwen3.5推理生态无缝衔接。对于开发者而言,这意味着无需额外适配即可直接集成,省去了很多常规开源项目所需的“适配成本”。
模型获取方式:
- Hugging Face 平台
- 魔搭社区
- 技术报告文档
