10月17日,HuggingFace平台发布最新动态,百度昨日推出的自研多模态文档解析模型PaddleOCR-VL在短短20小时内便登顶HuggingFace全球热门榜首。
据了解,该模型核心参数仅0.9B,具备轻量高效特性,能够以极低计算成本精准识别文本、手写汉字、表格、公式、图表等复杂元素,并支持109种语言。在权威榜单OmniBenchDoc V1.5中,其以92.6分夺得综合性能全球第一,四大核心能力全线突破SOTA,超越GPT-4o等主流模型,刷新了OCR-VL模型的性能纪录。
作为文心4.5的衍生模型,PaddleOCR-VL深度融合了NaViT动态分辨率视觉编码器与ERNIE-4.5-0.3B语言模型,实现了精度与效率的双重突破。

