7月17日,在2026世界人工智能大会上,由中国科学院文献情报中心牵头建设的“敖仓·科技语料库”正式发布亮相。这一国家级科技语料基础设施的推出,标志着我国在支撑人工智能高质量发展的新型基础设施方面,终于迈出了关键性的一步。
高质量科技语料如今已成为驱动科研范式变革的战略性稀缺资源。它并非简单的数据堆砌,而是通过对多模态科学数据和科技文献进行深度加工、关联融合,形成高知识密度的“智能就绪”数据——通俗地说,它直接决定了AI能够为科研带来多大助力。中国科学院文献情报中心主任曲建升指出,中科院本身拥有国内最大的科学数据产出与储备体系、最全的科技文献保障体系,加上跨学科的专业化加工能力,为国家级语料库的建设奠定了扎实基础。
目前,“敖仓”的数据来源非常可观:超过320PB的科学数据、1.5亿篇科技论文、1.2亿件发明专利、500万本科技图书,涵盖文本、图像、公式、化学式等多种形态。整个语料库采用“1+7+N”总分库模式——一个全学科数据知识融合的国家级总库,七个专业化深度提炼的领域分库,再加上N个场景化关联的应用子库,覆盖数学物理、化学化工、天文空间等多个学科,形成了一套完整的科技语料供给体系。
除了科研场景,该语料库还瞄准了商业航天、低空经济、智能制造、生物医药等热门领域,提供语料加工服务。下一步,它计划支撑的行业应用包括元器件选型、超微病理诊断、高速列车外形设计等,至少覆盖上百个场景。
“敖仓·科技语料库”将坚持“共建、共享、共用”的原则,持续强化高质量语料加工能力,培育科技语料生态,为国内乃至全球的科技创新贡献力量。
