从短期来看,大模型正在重塑每个行业、每个应用,编程范式也随之发生了前所未有的变化。而把目光放得更长远一些,大模型驱动的计算架构本身也正在经历深刻的演化。未来的路究竟会通向何方?微软亚洲研究院副院长杨懋博士在这篇文章中,深入计算机系统的底层逻辑,为我们剖析了更大规模、更分布式、更智能化的演进方向。
杨懋博士指出:“大模型的不断涌现,以及下一代人工智能需求的迅速增长,正倒逼我们加速革新传统的计算机系统。与此同时,构建在大规模高性能计算机系统之上的现代AI技术,也为未来计算机系统的研究打开了无限的可能性。创新超级计算机系统、重塑云计算、重构分布式系统,将是实现计算机系统自我革新的三个重要方向。”
在计算机科学的众多细分领域中,系统研究恐怕是最具“古典”与“摩登”双重气质的方向了。说它古典,是因为计算机系统的雏形可以追溯到古代的算盘、算筹乃至数据表,其发展历史远早于软硬件、云计算、人工智能这些热潮。而摩登的一面,则在于大数据、云计算等现代技术反过来又推动着计算机系统不断进化。传统的分布式系统理论、编译优化、异构计算等研究成果,在今天的大模型时代正大放异彩。同时,以大规模GPU集群为代表的高性能计算机系统,也为人工智能的质变提供了最坚实的底座。
然而,随着AI技术迭代的速度越来越快,传统计算机系统面临的挑战也愈发清晰:当前的GPU集群在规模和效率上,已经难以承载新一代AI模型的训练与服务;而现有的云计算和移动计算平台,也需要从服务传统计算任务,向服务智能应用转变。
面对这一系列挑战,需要看到的是,构建在大规模高性能系统之上的现代AI技术,正在为计算机系统的研究带来前所未有的机遇。计算机系统的革新,势必要从以下三个方向展开:
创新超大规模计算机系统,以支撑未来AI的发展;
重构云计算这一重要的IT基础平台;
设计前沿的分布式系统,以适应更广泛的分布式智能需求。
01. 大规模和更高效的计算机系统是下一代AI发展的基石
强化学习的奠基人之一 Rich Sutton 曾说过一句话,点出了关键:从过去70年的人工智能研究中,总结出的最重要经验就是——最大化利用计算能力,是最有效、也最有优势的方法。从长远来看,唯一重要的事情,就是利用好算力。超级计算机系统作为当下最强劲的算力引擎,自然是现代AI成功的重要基石。但问题在于,在基于超级计算机系统构建大规模GPU集群时,系统的可靠性、通信效率和总体性能优化,成了制约大模型训练性能上限的关键瓶颈。因此,我们需要创造一个更高性能、更高效率的基础架构,才能为下一代AI的发展铺路。
过去五年里,从体系结构、网络通信、编译优化到上层系统软件,我们看到了不少创新研究,为AI基础架构的演化提供了有力支撑。比如,能够跨多个翻跟斗执行集体通信算法的微软集体通信库 MSCCL,以及有助于开发大规模深度神经网络模型的高性能 MoE 库 Tutel。这些成果,为大语言模型训练及推理等各种AI任务提供了高效的支持。
值得注意的是,超级计算机系统不能只依赖传统方法来实现革新,而是要学会利用 AI 来实现创新和演进。这正是微软亚洲研究院正在探索的方向。团队认为,AI的新能力将为解决传统系统问题提供全新视角——包括更智能、更高效地优化复杂系统性能,更快速、更智能地进行问题诊断,以及更便捷的部署和管理。AI与系统的结合,将为计算系统的设计带来全新范式。从芯片设计、体系结构创新、编译优化到分布式系统设计,AI完全可以成为系统研究者的智能助手,甚至承担大部分工作。
在AI的协助下,系统研究者可以将更多精力投入到更大规模系统的整体设计、关键模块和接口的抽象,以及系统整体的演进路径上。举个例子,在编译系统的设计上,团队推出了 Welder、Grinder 等编译器,这些工具更专注于模型结构、编译系统和底层硬件之间的关系与抽象,而更多具体的编译优化搜索算法和实现,则可以交由AI辅助完成。这些新的研究范式,才是构建更大规模和更高效AI基础架构的真正基石。

基于统一切块(tile)抽象的四个核心 AI 编译技术
02. 以智能化为内核,重塑云计算系统
“操作系统管理着计算机的资源和进程,以及所有的硬件和软件。它让用户可以在不需要了解计算机语言的情况下与计算机进行交互。”这是我们对计算机系统最初的理解。但如今,以GPU、高带宽存储器、高速互联网络为代表的分离式服务器架构,正逐渐取代传统的以CPU为中心的服务器;AI Agent和大模型成为云计算平台的主流服务;深度学习算法也在逐步替代传统核心算法。云计算——这个始于本世纪初最重要的IT基础系统,到了必须重塑自己的时刻。传统云计算领域的研究方向,如虚拟机、微服务、计算存储分离、弹性计算等,在AI时代都需要被重新定义和发展。
- 虚拟化技术需要在分离式架构的背景下重新设计;
- 微服务及其相关模块需要为AI Agent和大语言模型构建高效且可靠的服务平台;
- 数据隐私和安全,必须成为云计算系统创新的核心要素。
所有这些变革,最终都要服务于云计算系统的智能化(Cloud + AI)。
一方面,大规模异构计算系统在云端的普及,为传统大规模系统提供了全新的计算平台;另一方面,深度学习特别是大模型的发展,也为传统大规模系统的内在算法设计和实现提供了崭新的思路。以搜索系统为例,团队基于异构计算系统和深度学习方法,从Web Scale的矢量搜索系统 SPANN,到最新的 Neural Index 索引系统 MEVI,这些创新不仅极大提升了搜索和广告系统的性能,也为未来信息检索系统提供了新的范式。类似的创新,也同样发生在数据库系统、科学计算系统等领域。
云计算系统不仅为AI的发展提供了保障,其自身以及构建其上的大规模系统服务,也将受益于AI技术,实现持续演进。未来的云计算平台,必将成为新一代AI基础架构的关键组成部分。
03. 分布式系统将是分布式智能的关键基础设施
“人类的智能不单存在于头脑中,还广泛分布在整个物理世界、社会活动和符号体系中——这就是‘分布式智能’。”美国认知科学家 Roy Pea 在1993年的一篇论文中提出了这个观点,为我们理解AI系统与社会、环境之间的相互作用提供了全新的视角。
目前,大模型的技术链条——从训练到推理——都严重依赖于云计算中心。但可以确定的是,智能广泛存在于分布式环境中,未来的智能计算也必然存在于任意的分布式环境中。人类与物理世界的交互、基于符号系统的交流,这些都是智力活动的体现。未来,这些智力活动应该能被大模型更好地感知和学习,人们也可以在任意终端更实时地获取AI模型的能力。这种泛在的相互感知和不断演进的能力,将成为未来分布式系统研究的重点之一。
那么,如何支持智能技术在更分布式的场景下发展?这需要我们在由云端、边缘端和设备组成的广泛计算平台中,更好地进行AI计算。除了传统的模型稀疏化、压缩等优化推理性能的技术外,更关键的是要克服大模型在边缘端运行时遇到的挑战,比如实时性和可靠性等基础问题。为此,团队推出了 PIT、MoFQ 等多种移动端模型量化、稀疏化以及运行时优化的技术。
另外,对于边缘计算平台和设备,硬件和推理算法的创新也至关重要。这将从根本上革新端侧的推理方式,比如利用基于查找表等全新的计算范式来提升推理效率,包括 LUT-NN 等技术。团队还与多个不同的机器学习团队紧密合作,使学习算法可以更好地从任意信号中捕捉智能。除了传统的多模态模型,也在寻找更简洁、更内在一致的模型结构和学习算法,使其能够从任意信号中进行学习。更优的模型结构和算法,应当是更稀疏、更高效、具有良好的可扩展性,并能有效支持自学习和实时更新。
未来,智能将融入广泛的分布式环境中。而创新的分布式系统,正是分布式智能的关键基础设施,也是人类社会获得更实时、更可靠的人工智能交互能力的前提。
04. 未来的计算机系统将自我进化
未来的计算机系统研究,是一个持续自我革新的过程。这不仅意味着计算机系统需要不断进化,以满足未来AI发展的需求,更意味着计算机系统本身将变得更加智能化,并具备自我演化的能力。
过去几年的变革与创新,已经让我们窥见了些许未来的样貌。然而,从基础架构、云计算平台到分布式智能化,AI时代的计算机系统研究领域,还有太多新的可能性等待我们去探索。坚信那些更加智能、更强大的助手和工具,一定会在未来的研究道路上,带来那些尚未被发现,却又足以令人兴奋的惊喜。
作者简介
杨懋博士现任微软亚洲研究院副院长,领导微软亚洲研究院在计算机系统和网络领域的研究工作。于2006年加入微软亚洲研究院,主要从事分布式系统、搜索引擎系统和深度学习系统的研究、设计与实现。同时领导团队在计算机系统、计算机安全、计算机网络、异构计算、边缘计算和系统算法等方向进行关键技术研究。团队及个人在 OSDI、SOSP、NSDI、SIGCOMM、ATC 等计算机系统和网络的顶级会议上持续发表多篇论文。团队在研究的同时还注重与实际计算机和网络系统的演进结合,与 Azure 云计算、Bing 搜索引擎系统、Windows 操作系统、SQL Server 数据库系统以及多个开源社区密切合作。杨博士同时还是中国科学技术大学博士生导师,拥有北京大学计算机体系结构专业博士学位以及哈尔滨工业大学硕士和学士学位。
