如果说大语言模型为人工智能开启了一个全新的时代,那么AI的下一轮变革究竟将由什么驱动?中国工程院院士、之江实验室主任、阿里云创始人王坚给出的答案,明确指向了“科学数据”。在他看来,人工智能正处于一个关键的历史转折点:未来推动AI持续进化的核心,已不再只是算力提升或算法叠加,而是让科学数据真正成为基础模型的“原住民”,进而推动AI从“理解文本”走向“驱动科学发现”的新阶段。

如今大家熟知的LLM,也就是大语言模型,本质上是基于海量文本数据训练而成的基础模型。王坚院士提出了一个很有启发性的视角:人类对文本的处理方式其实由来已久。比如中国古文和古拉丁文在最初都没有标点、没有空格,后来人们逐步为其加入标点和分隔,这一过程在本质上与今天大语言模型核心的Tokenize(分词)逻辑非常相似。可以说,大语言模型把人类对文本数据的理解、组织与利用能力,提升到了前所未有的新高度。
但问题也非常明显,科学研究中的大量关键信息并不是以文本形式存在的。如果AI的能力边界始终停留在分析人类写出的论文、报告和代码上,它就很难真正触达科学问题的本质。王坚以地球科学为例指出:超过70%的地学关键信息,来自光谱、地震波等原始物理数据,而不是学术论文中的文字描述。他形象地比喻说:“一张图胜过千言万语,而一段光谱可能胜过千万张图。”
因此,未来的基础模型应当直接面向科学数据,实现文本、代码与科学数据的统一建模。只有这样,人工智能基础模型才能真正实现跨模态理解,并为科学研究带来实质性的突破。
一个近期的案例很能说明这一点:一位年仅18岁的高中生,借助一颗原本用于监测小行星的退役卫星留下的数据,竟然发现了近150万个此前从未被识别的太空天体。这项研究成果最终以单作者论文的形式,发表在顶级天文学术期刊上。王坚强调:“科学突破不仅来自新的实验,也可能来自对已有数据的重新挖掘。”从旧数据中发现新问题、获得新发现,这正是科学进步和科学革命的重要逻辑。面对海量且持续增长的科学数据,人类当前的认知深度和利用效率仍然远远不够。
随着科学基础模型不断发展,人工智能正在从单纯的计算机科学分支,逐步演变为支撑各类科学研究的重要基础设施。王坚的判断也颇具前瞻性:“人工智能将变得像数学一样基础,它不再只是一个独立的垂直技术领域。未来50年里,人工智能一定会像数学在人类科学发展历史上所发挥的作用一样,对科学研究产生深远而持久的影响。”
