近日,医药研发与AI制药领域传来一则重磅进展。国家超级计算天津中心与清华大学智能产业研究院联合团队,正式发布了名为GalaxyVS的人工智能虚拟筛选平台。这个平台的推出,极有可能重塑新药发现与药物研发早期筛选的整体规则。
简单理解,GalaxyVS把过去往往需要数月甚至数年才能完成的药物早期筛选流程,压缩到了数十秒以内。其核心能力在于,可对近千亿规模的可合成化合物空间进行秒级虚拟筛选。众所周知,创新药研发长期面临著名的“双十”难题:研发周期通常超过十年,投入成本往往超过十亿美元。而在整个新药研发流程中,最耗时、最消耗资源的关键环节之一,就是从海量化合物中像大海捞针一样筛选出能够与特定靶点蛋白有效结合的活性分子。
传统实验筛选不仅成本高、效率低,而且研发周期非常漫长。即便是常见的计算机虚拟筛选,也就是分子对接技术,虽然在速度上有所提升,但面对如今普遍达到千亿级、万亿级的化合物库时,其计算效率与预测准确性也逐渐触及上限。无论是算法设计、算力支撑、数据存储,还是工程化落地能力,都面临明显瓶颈。
那么,GalaxyVS究竟是如何实现技术突破的?关键就在于底层思路的升级与转变。
该平台的核心算法,来源于清华大学团队此前发表于《科学》杂志的DrugCLIP模型。它的创新之处在于,不再采用蛋白质与小分子之间繁琐的“一对一”分子对接模拟方式,而是将双方的关键特征,例如蛋白口袋结构、分子化学结构等,统一映射到同一个高维向量空间中。这样一来,原本复杂的生物分子匹配问题,就被转化为可在超级计算机上大规模并行执行的向量快速检索问题。这相当于把传统的“逐个配对”升级为“海量数据智能匹配”,从根本上突破了传统虚拟筛选方法的限制。
当然,仅有先进算法还远远不够,还需要足够强大的算力“引擎”提供支撑。GalaxyVS背后的核心动力,正是新一代天河超级计算机。团队依托国产YH-Torch智能计算框架,对模型进行了深度异构算力适配与系统优化,减少了对国外传统技术栈的依赖,也让近千亿分子编码与超大规模筛选从理论构想真正落地为稳定运行的超级工程。
在具体执行层面,系统还引入了磁盘原生图索引框架,并结合定制化内存预加载机制。这一整套技术方案,有效解决了超大规模数据检索过程中常见的存储与调度瓶颈问题,从而保证整个AI虚拟筛选流程具备极高吞吐能力与稳定性。
从实际测试结果来看,GalaxyVS的性能表现十分惊人。系统调度了上千个DSP节点,高效完成了覆盖全模式生物物种的大约400万个靶点口袋编码。随后,又在两万多个计算节点上开展超大规模分子检索。最终结果显示:单次针对千亿分子库的检索,耗时仅为数十秒;平均计算下来,筛选一个靶点口袋所需时间不到1秒。系统日吞吐量约达到16万亿次分子对接,这一效率相比当前国际最先进的超算纪录,高出了整整六个数量级——注意,不是六倍,而是六个数量级。

从未来发展来看,GalaxyVS的价值绝不只是“更快的药物筛选工具”。它还有望支持构建跨物种蛋白-配体相互作用图谱,推动建设大规模开放数据集,并进一步成长为AI驱动药物发现的重要底层基础设施。更深层次的意义在于,它正在推动整个新药研发范式加速转型:从依赖经验判断和反复试错的“手工作坊”,迈向以数据和算力驱动的“智能工厂”;从局部、碎片化的筛选方式,走向全局化、系统化的探索路径;从依赖单一模型工具,升级为多技术协同作战的系统工程。
这或许意味着,人类距离以更快速度、更低成本找到攻克疾病的新药,又向前迈进了一大步。
