首页 游戏 软件 资讯 排行榜 专题
首页
科技数码
ScienceMetaBench开源:评测元数据提取的科学文献基准

ScienceMetaBench开源:评测元数据提取的科学文献基准

热心网友
46
转载
2026-01-23

由上海人工智能实验室 OpenDataLab 团队正式推出的 ScienceMetaBench 科学文献元数据提取评测基准,致力于构建一个公平且统一的评估体系。该基准旨在为学术界与工业界提供可复现、可对比的衡量标准,从而推动元数据提取技术的持续进步。

数据集地址:https://www.php.cn/link/918d2d39616621eedbe76248d1e3abcb
测评工具代码:https://www.php.cn/link/2ab507032a57dc82c268ea84eeecab35

据了解,ScienceMetaBench 专注于评估从科学文献 PDF 中精准识别并抽取结构化元信息的能力,其覆盖了学术论文、教科书及电子书三大主流文档类型。在构建过程中,团队特别强化了对中英双语场景的支持,从文本识别、字段解析到语义对齐均实现了语种自适应,确保提取出的元数据结果与原文语言高度契合。

下图展示了从学术论文 PDF 首页中成功抽取出的元数据字段实例:

ScienceMetaBench 开源:科学文献元数据提取评测基准

需要从论文首页准确提取以下核心字段:{

"sha256": "8d3e...f3a", // 文件级唯一哈希值,支撑数据溯源与版本管理 "doi": "10.1186/s41038-017-0090-z", // 国际数字对象标识符 "title": "Children are not little adults...", // 文献标题(保留原始大小写与标点) "author": "Tina L. Palmieri, ...", // 作者列表,统一采用英文逗号分隔格式 "keyword": "Blood transfusion, Pediatric", // 关键词集合,同样以英文逗号分隔 "abstract": "Blood transfusion in burns larger than...", // 完整摘要文本(不含冗余符号或页眉页脚) "pub_time": "2017" // 标准化出版年份(仅保留四位数字) }

为了增强样本的多样性与现实挑战性,研究团队融合了多源异构PDF数据采集策略,并引入 K-Means 图像聚类方法对页面布局进行无监督分组,从而有效涵盖了从紧凑单栏到复杂多栏、包含图表/公式/多语言混排等典型困难案例。标注流程采用“大模型预标注 + 领域专家人工校验”的协同范式,并严格对标 OmniDocBench(MinerU 测评所采用的权威基准),确保标注的规范性、字段完整性与测评维度的前沿性。

源码地址:点击下载

来源:https://www.php.cn/faq/2023620.html?uid=1246273
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

Cursor AI代码编辑器:智能编程工具的功能与使用指南
AI教程
Cursor AI代码编辑器:智能编程工具的功能与使用指南

在追求极致效率的现代软件开发中,一款名为Cursor的AI代码编辑器正引领着开发范式的变革。它被定义为“面向未来的IDE”,其核心理念清晰而有力:将人工智能深度无缝地集成到编码工作流的每一个步骤,为开发者创造一种前所未有的“AI结对编程”体验。 Cursor sh应用场景 那么,这款AI驱动的编辑器

热心网友
05.23
美图WHEE-WHEE AI视觉创作工具使用指南与功能详解
AI教程
美图WHEE-WHEE AI视觉创作工具使用指南与功能详解

在众多AI图像生成工具中,WHEE凭借其精准的产品定位与持续的功能迭代,正成为越来越多设计师和内容创作者的首选工具。它专注于打造高品质的AI视觉素材生成器,核心使命就是帮助用户快速、高效地获得可直接使用的优质图片素材。 那么,这款AI绘图工具究竟有哪些核心优势?下面我们从其关键特性与功能设计进行深入

热心网友
05.23
NightCafe Creator AI艺术生成器:手机创作数字绘画
AI教程
NightCafe Creator AI艺术生成器:手机创作数字绘画

在AI绘画工具不断涌现的当下,一款名为NightCafe Creator的应用以其全面的AI艺术生成能力脱颖而出。它不仅是一个简单的图片处理工具,更是一个融合了多种前沿人工智能技术的创意平台,帮助用户轻松实现从构思到成品的艺术创作。 NightCafe Creator是什么? NightCafe C

热心网友
05.23
加密市场恐慌蔓延 比特币以太坊为何领跌山寨币
web3.0
加密市场恐慌蔓延 比特币以太坊为何领跌山寨币

近期加密货币市场受到宏观经济不确定性及流动性紧缩影响,比特币(BTC)、以太坊(ETH)以及多种山寨币出现明显下行走势,市场情绪趋于谨慎。 比特币近期走势分析 比特币的价格近期表现如何?简单来说,它跌破了几个市场公认的关键支撑位,而且伴随交易量的放大。这种放量下跌的信号,往往意味着多空分歧加剧。无论

热心网友
05.23
蔡司6月2日发布新品镜头技术迎来重大突破
科技数码
蔡司6月2日发布新品镜头技术迎来重大突破

蔡司宣布将于6月2日发布一款新镜头,并称其为镜头技术的重大突破,标志着全新纪元的开启。官方仅公布了产品剪影,但措辞暗示其可能带来根本性的技术升级,例如全新光学结构、先进镀膜或对焦系统改进。具体细节需待发布日揭晓。

热心网友
05.23