近年来,评测领域迎来一项重要进展——上海人工智能实验室 OpenDataLab 团队正式发布了名为 ScienceMetaBench 的评测基准,旨在全面评估科学文献元数据的提取能力。简单来说,该基准用于衡量各类模型从PDF文件中准确抽取标题、作者、摘要等关键信息的性能。
该基准的初心十分务实:为学术界和工业界提供一把公平、可复现的“标尺”,使不同元数据提取方法能够进行横向对比,避免各自为战。当前,市面上已有的评测标准良莠不齐,评估结果难以直接对齐。
ScienceMetaBench 的评测范围涵盖三类常见科学文档:学术论文(Paper)、教科书(Textbook)和电子书(Ebook)。此外,团队特别强化了对中英文双语场景的支持——从文本识别、字段解析到语义对齐,均实现了语种自适应,确保提取结果与原文语言保持一致。这一特性对处理以中文文献为主的应用场景尤为重要。
下图呈现了一个从学术论文PDF首页成功提取元数据字段的示例,使读者能够直观了解提取效果:

从论文首页需要精准提取的核心字段包括:文件级唯一哈希值(SHA256)、国际数字对象标识符(DOI)、文献标题(保留原始大小写和标点)、作者列表(统一使用英文逗号分隔)、关键词集合、完整摘要文本,以及标准化出版年份(仅四位数)。这些字段虽看似基础,但从不同排版、不同语言的PDF中准确抓取却面临巨大挑战。
为提升样本多样性与现实鲁棒性,研究团队采用多源异构PDF数据采集策略,并引入K-Means图像聚类方法对页面布局进行无监督分组。如此一来,从紧凑的单栏布局到复杂的多栏布局,再到包含图表、公式、多语言混排的“硬骨头”案例,均能在评测中实现有效覆盖。标注流程采用“大模型预标注 + 领域专家人工校验”的协同模式,并严格对标已有权威基准OmniDocBench,确保规范性与评测维度的前沿性。
综上,ScienceMetaBench 基准的推出为元数据提取领域提供了一个更加规范的参考标准,未来研究者可基于该基准进行更精细的性能优化与横向对比。
