目前,大语言模型主要依赖文本、代码等经过二次加工的信息进行训练,难以直接处理光谱、地震波等产业与科研领域中的原始科学数据。而科学基础模型能够融合文本、代码以及各类科学观测数据,其产业价值更多体现在赋能高端制造、基础科研、地球科学等硬核领域。

7月17日,2026世界人工智能大会(WAIC)在上海举行。在当天下午的主论坛中,中国工程院院士王坚提出了一个发人深省的问题:当前AI虽然能够阅读论文、编写代码,但能否真正理解那些未经处理的原始科学数据?答案显然是否定的,而这正是未来亟待突破的关键方向。
01 当前AI赋能实践多数停留文本层面
“基础模型”这一专业术语由斯坦福大学学者于2021年正式提出,如今已成为AI领域的核心概念。大众常说的“大模型”,更准确的叫法是大语言模型,其本质是依托文本数据构建而成。但问题在于,人类处理文本的历史远比人工智能悠久。古代中文、古拉丁文均无标点和词语分隔,古人阅读时必须出声断句才能理解文意。王坚打了个比方:给文本添加空格、标点,这套逻辑与如今大模型的底层原理高度相通。大语言模型不过是将人类处理文本的能力推向了新的高度,而Tokenization则是支撑这一切的关键技术环节。
除了文本,计算机代码是另一类特殊的文本数据。有趣的是,代码与自然语言的差异甚至比不同语种的人类语言之间的差异还要大。这直观地印证了,数据类型对AI能力的塑造具有决定性作用。然而现实中,绝大多数AI赋能科研的实践仍停留在“读论文、看代码”的层面,真正能触及论文背后那些核心原始科学数据的案例寥寥无几。
王坚用一个地学领域的例子,点破了当前文本大模型的局限性:超过70%的地球科学信息其实并不在论文的文字里,而是隐藏在光谱、地震波、声波等观测数据中。行业里常说“一张图胜过千言万语”,但一段光谱数据的信息密度远超千万张图像。这意味着,AI对基础科学的解读目前还只是通过论文文字间接推导客观规律,距离直接“读懂”原始观测数据还有巨大的发展空间。
正是基于这一判断,之江实验室提出了科学基础模型的研发方向。该项目代号“021”,其核心定位与行业常见的垂直领域专用模型截然不同:它不以论文文本为训练基底,而是将原始科学数据作为核心训练素材,让科学数据在模型体系中占据主导地位。
02 科学基础模型对前沿基础科学具有巨大的赋能价值
以地质研究为例,研究对象——那些古老的岩石和地层——不会主动“说话”。研究的核心目标是还原地球数十亿年的演化历程,厘清生命的演化脉络。地球诞生于38亿年前,恐龙和人类的演化时间尺度均为百万年级别。传统的地质测年手段精度有限,存在天然瓶颈。更麻烦的是,化石研究存在“信息缺失效应”:生物化石的形成具有随机性,某个物种化石最晚出现的地层年代并不等同于其真实的灭绝时间。这极大地制约了地质时间轴的构建精度。
针对这一难题,之江实验室联合南京大学沈院士团队打造了地球科学专用模型GeoGPT。据王坚透露,在第五届国际地层学大会上,中国面向全球发布了首个地层学AI大模型及智能全球地层剖面对比系统等新工具。这意味着,地球46亿年的演化历史将首次拥有一个全球共享的数据库。这项技术能将地质时间的解析精度从百万年级别直接提升到一万年级别,实现多个数量级的飞跃。该成果近期已入选联合国“科学促进可持续发展十年(2024—2033)”第三批认可计划清单,这本身就是一个有力的证明:AI基础模型对前沿基础科学的赋能价值是实实在在的。
在演讲最后,王坚总结说,AI将成为和数学同等重要的底层基础学科。科学基础模型的出现,标志着人工智能发展迎来一个关键转折点——AI不再只是某个单一领域的工具,而是如同数学一样,成为支撑全学科发展的底层基础。
