阿里CEO吴泳铭揭示AI发展三阶段:从智能涌现到超越人类,阿里云如何布局未来十年?
核心内容:
1. AI发展的三阶段演进路线:智能涌现、自主行动、自我迭代
2. 阿里云的两大战略路径:开源AI平台与超级AI云建设
3. 阿里巴巴3800亿AI基建计划与2032年能耗规划
AI未来发展的路径将如何演变?硅基生物是否可能取代碳基生物?超级人工智能是否会带来毁灭性后果?自AI技术步入研发阶段以来,感性与理性的探讨便从未间断。争论本身就是技术进步的另一面。而在今年的云栖大会上,阿里巴巴集团CEO、阿里云智能集团董事长兼CEO吴泳铭给出了系统性的解答。
9月24日,在杭州举办的云栖大会上,吴泳铭发表了主旨演讲。他的核心判断是:实现通用人工智能(AGI)已是确定性事件,但这仅仅是起点——终极目标是发展出能够自我迭代、全面超越人类的超级人工智能(ASI)。他首次系统性地阐述了通往ASI的三阶段演进路线:
第一阶段:“智能涌现”——学习人类
过去几十年的互联网发展,已将人类历史上几乎所有的知识都数字化。大模型基于这些语言文字的“知识全集”,通过理解世界的知识集合,具备了泛化智能能力,由此涌现出通用对话能力,可以理解人类意图、解答问题,并逐步发展出多步推理能力。如今的AI已逼近人类各学科测试的顶级水平,例如国际数学奥赛金牌。这是过去几年发展的主线,AI逐渐具备了进入真实世界、解决真实问题并创造实际价值的能力。
第二阶段:“自主行动”——辅助人类
在这一阶段,AI不再局限于语言交流,而是具备了在真实世界中行动的能力。AI可以在人类设定的目标下拆解复杂任务,使用并制作工具,自主完成与数字世界和物理世界的交互。这正是我们当前所处的阶段。
实现这一跨越的关键,首先是大模型具备Tool Use能力,能够连接所有数字化工具来执行真实任务。人类加速进化的起点是创造和使用工具,如今大模型也具备了这种能力。通过Tool Use,AI可以像人类一样调用外部软件、接口和物理设备,快速渗透到物流、制造、软件、商业、生物医疗、金融、科研等几乎所有行业。
其次,大模型Coding能力的提升,帮助人类解决更复杂的问题,并将更多场景数字化。当前的Agent还处于早期阶段,主要解决标准化和短周期任务。要让Agent解决更复杂、更长周期的任务,最关键的就是大模型的Coding能力——Agent可以自主编写代码,理论上就能解决无限复杂的问题,像工程师团队一样理解复杂需求并自主完成编码、测试。发展大模型Coding能力是通往AGI的必经之路。
未来,自然语言将成为AI时代的源代码,任何人用自然语言就能创造自己的Agent。你只需输入母语,告诉AI你的需求,AI就能自动编写逻辑、调用工具、搭建系统,完成数字世界中的几乎所有工作,并通过数字化接口操作所有物理设备。或许未来会有超过全球人口数量的Agent和机器人与人类一起工作,对真实世界产生巨大影响。这一过程也将让AI连接真实世界中的绝大部分场景和数据,为下一步进化创造有利条件。
第三阶段:“自我迭代”——超越人类
这一阶段包含两个关键要素:
第一,AI连接真实世界的全量原始数据。
目前AI进步最快的领域是内容创作、数学和Coding。这些领域的知识100%由人类定义和创造,AI可以完全理解原始数据。但对于更广泛的物理世界,今天的AI更多接触到的是人类归纳之后的知识,缺乏与物理世界直接交互的原始数据。这些信息存在局限性。AI要实现超越人类的突破,就需要直接从物理世界获取更全面、更原始的数据。
举个简单的例子:一家汽车公司的CEO若要迭代明年的产品,大概率会通过多次用户调研或内部讨论来决定下一款汽车的功能和优势。现在AI做这件事难度很大,因为它获得的数据都是调研得来的二手数据。如果有一天AI能连接这款汽车的全部资料和数据,它创造出的下一代产品会远远超过人类通过无数次头脑风暴得出的结果。这只是一个例子,更复杂的物理世界远不是通过人类知识归纳就能让AI理解的。
因此,AI需要像自动驾驶领域那样,从端到端的训练方法中直接学习原始数据。新一代自动驾驶就是从车载摄像头原始数据中学习的,而不是依赖Rule-based规则。即便相对简单的自动驾驶问题,仅依靠人类归纳的规则也无法解决,更何况整个复杂物理世界。只有让AI与真实世界持续互动,获取更全面、更真实、更实时的数据,才能更好地理解和模拟世界,发现超越人类认知的深层规律。
第二,Self-learning自主学习。
随着AI渗透更多物理世界场景,理解更多原始数据,AI模型和Agent能力会越来越强,有机会为自己模型的升级迭代搭建训练基础架构、优化数据流程和升级模型架构,从而实现Self-learning。这将是AI发展的关键转折点。未来的模型通过与真实世界的持续交互,获取新数据并接收实时反馈,借助强化学习与持续学习机制,自主优化、修正偏差、实现自我迭代。每一次交互都是一次微调,每一次反馈都是一次参数优化。当经过无数次场景执行和结果反馈的循环,AI将自我迭代出超越人类的智能能力——一个早期的超级人工智能ASI便会成型。
一旦跨过某个奇点,人类社会就像按下了加速键,科技进步的速度将超越我们的想象,新的生产力爆发将推动人类社会进入崭新的阶段。
两个战略判断:阿里云布局未来十年
判断一:大模型是下一代的操作系统。
大模型代表的技术平台将替代现在的操作系统地位,成为下一代操作系统。未来几乎所有连接真实世界的工具接口都将与大模型连接,所有用户需求和行业应用将通过大模型相关工具执行任务。自然语言是AI时代的编程语言,Agent是新的软件,Context是新的Memory。大模型通过MCP接口连接各类Tools和Agent,类似PC时代的总线接口;Agent之间通过A2A协议完成多Agent协作,类似软件间的API接口。大模型将吞噬软件,允许任何人用自然语言创造无限多的应用。未来几乎所有与计算世界打交道的软件,可能都是由大模型产生的Agent,而不是现在的商业软件。潜在的开发者将从几千万扩大到数亿规模。
模型部署方式也会多样化,它将运行在所有设备上。当前主流的调用模型API的方式还非常原始,类似大型主机时代的分时复用——每个人只有一个终端连接大型主机。这种方式无法解决数据持久化、缺乏长期记忆、实时性不足、隐私无法保护、可塑性不够等问题。未来模型将运行在所有计算设备中,具备可持久记忆、端云联动的运行状态,甚至可以随时更新参数、自我迭代,就像今天的操作系统运行在各种环境中。
基于这个判断,阿里云的战略选择是:通义千问走开源开放路线,打造AI时代的Android。在LLM时代,开源模型创造的价值和渗透场景会远大于闭源模型。坚定开源,就是为了全力支持开发者生态,与全球开发者一同探索AI应用的无限可能。
判断二:超级AI云是下一代的计算机。
大模型运行于AI Cloud之上,这个操作系统可以满足任何人的需求。每个人都将拥有几十甚至上百个Agent,24小时不间断工作和协同,这需要海量的计算资源。数据中心内的计算范式也在发生革命性改变,从以CPU为核心的传统计算加速转变为以GPU为核心的AI计算。新的AI计算范式需要更密集的算力、更高效的网络、更大的集群规模。这一切都需要充足的能源、全栈的技术、数百万计的GPU和CPU协同运作,24小时处理全球各地的需求。只有超级AI云才能承载这样的海量需求。未来,全世界可能只会有5-6个超级云计算平台。
在这个新时代,AI将替代能源的地位,成为最重要的商品,驱动千行百业每天的工作。绝大部分AI能力将以Token的形式在云计算网络上产生和输送——Token就是未来的电。阿里云的定位是全栈人工智能服务商,提供世界领先的智能能力和遍布全球的AI云计算网络,向全球提供开发者生态友好的AI服务。
具体而言,阿里云拥有全球领先的大模型通义千问,已开源300多款模型,覆盖全模态、全尺寸,是最受全球开发者欢迎的开源模型。截至目前,通义千问全球下载量超6亿次,衍生模型超17万个,是全球第一的开源模型矩阵。同时,阿里云提供一站式模型服务平台百炼,支持模型定制化以及Agent快速开发,并提供AgentBay这样的Agent运行环境、灵码/Qoder等一系列开发者套件。
在基础设施层面,阿里云运营着中国第一、全球领先的AI基础设施和云计算网络,是全球少数能做到软硬件垂直整合的超级AI云计算平台之一。自研的核心存储系统、网络架构、计算芯片构成了大型计算集群最坚实的底座。阿里云正在全力打造一台全新的AI超级计算机,在基础架构设计和模型架构上协同创新,确保在阿里云上调用和训练大模型时达到最高效率。
行业发展的速度远超预期,对AI基础设施的需求也远超预期。阿里云正在积极推进三年3800亿的AI基础设施建设计划,并会持续追加投入。从远期来看,为了迎接ASI时代的到来,对比2022年这个GenAI元年,2032年阿里云全球数据中心的能耗规模将提升10倍。这样的饱和式投入,是为了推动AI行业发展,迎接ASI时代的到来。
人机协同的未来:从Vibe Coding到Vibe Working
超级人工智能到来后,人类和AI将如何协作?吴泳铭对未来充满乐观。程序员可能已经感受到:通过一个指令,用Coding工具让AI运行12小时就能创造出一个需要的系统——这已经让我们看到了未来人和AI协同的早期雏形。从Vibe Coding到Vibe Working,未来每个家庭、工厂、公司都会有众多Agent和机器人24小时服务。也许未来每个人都需要使用100张GPU芯片为我们工作。
正如电曾放大了人类物理力量的杠杆,ASI将指数级放大人类的智力杠杆。过去我们消耗10小时的时间获得10小时的结果;未来,AI可以让我们10小时的产出乘以十倍、百倍的杠杆。回顾历史,每次技术革命解锁更多生产力之后,都会创造出更多的新需求。人将变得比历史上任何时候都强大。
