本文图片源于“Agentic AI 重塑算力架构:从 GPU-Centric 到 CPU-GPU 协同(阿里云)”。需要看到的是,AI 正在从深度学习阶段加速迈向 Agentic AI(智能体 AI)时代,与之同步发生变化的,是底层算力架构与系统设计的全面升级。阿里云在最新技术分享中明确强调:智能并不是简单运行在 GPU 之上的单一负载,而是建立在 CPU、GPU、多级内存与高速互联架构协同配合之上的系统级能力。
一、范式迁移:从“训练为王”到“推理+协同”
AI 的发展大致经历了三个清晰阶段:
传统机器学习(1990s-2012):以 CPU 为核心,数据集规模较小,并行度有限,主要依赖人工特征工程完成建模。
深度学习时代(2012-2025):进入以 GPU 为中心的阶段,具备海量并行计算能力,面向 TB 级数据集,依靠自动特征学习,Transformer 成为主流架构。
Agentic AI时代(2025至今):进一步转向CPU-GPU协同。智能体不仅要完成推理,还需要具备任务规划、工具调用、动态记忆管理以及多轮长程执行能力。
这一变化的核心驱动力在于“将人的因素从任务流中移出”。当更多流程由 Agent 自主完成后,CPU 利用率会显著上升,因为 Agent 的任务编排、记忆读写、工具执行与状态维护等关键环节,都高度依赖 CPU。
二、记忆管理:CPU承担的四类核心负载
Agentic AI 带来了更复杂的记忆系统,而这些记忆的检索、拼装、更新与淘汰,基本都由 CPU 主导完成:
这类操作通常高频、细碎且伴随大量状态切换,天然更适合 CPU 处理,而不适合依赖大规模并行的 GPU 架构。因此,在智能体 AI 场景下,CPU 在记忆管理中的作用显著增强。
三、调度挑战:有状态与无状态Agent混布
Agent 架构通常呈现出明显的主-从模式:
Master Agent:具备状态、生命周期长(小时/天),支持超长上下文(>100K tokens),负责任务拆解、流程协调与结果汇总,并依赖结构化记忆与反思性记忆。
Sub Agent:通常无状态、生命周期短(秒/分),专注单一原子任务,上下文极小,执行完成后即可销毁。
当两类 Agent 在同一系统中混合部署时,容易引发Cache thrashing和TLB thrashing。这意味着调度器必须能够感知 Agent 的生命周期、状态特征与上下文亲和性,而这正是传统 GPU-centric 架构过去很少面对的新型调度难题。
四、CPU超卖:利用空闲窗口提升整体吞吐
Agent 工作负载通常存在两类典型的 CPU 空闲窗口:
宏观闲置:例如定时任务触发前,或等待人工输入、外部系统响应的阶段。
微观闲置:例如每次 LLM 调用后,等待 200ms~2s 模型返回结果的间隙。
通过vCPU超卖(4~5倍),结合统计复用与时间片轮转机制,可以显著提升 CPU 利用率,同时缓解 GPU 集群在推理场景下的吞吐压力。需要注意的是,超卖的关键限制因素更多在于内存容量,而不是 CPU 核心数量本身。
五、GPU推理优化:三招减少CPU等待时间
为了减少 CPU 在等待 LLM 响应时的空转,PDF 提出了三类重要的并行优化方向:
Continuous Batching:将固定 micro-batch 改为滚动式调度槽,已完成请求立即释放资源,新请求可在中途插入,从而减少批处理边界带来的等待时间。
Prefill-Decode / Attn-FFN分离:针对 Prefill(偏计算)与 Decode(偏存储)、Attention(偏存储)与 FFN(偏计算)的不同资源特征,采用分池与流水化执行方式,提升整体推理效率。
KV Cache增强:
利用vLLM PagedAttention、SGLang RadixAttention(树结构前缀共享)以及EPIC位置无关缓存,进一步提升缓存命中率。
KV量化(FP16→4-bit/2-bit)可使体积缩小约 75%。
KV压缩(如 DeepSeek V4 的 CSA/HCA)可实现约 10 倍压缩比。
这三类优化协同配合后,能够明显缩短 GPU 推理延迟,并进一步减少 CPU 的等待与空转时间。
六、Engram理念:将静态知识从LLM解码中剥离
PDF 引入了“Engram”这一理念——由 CPU 先查询静态知识库,再让 LLM 在这些知识基础上进行推理,而不是让模型从内部逐字解码全部事实信息。这样可以显著降低 GPU 的解码负担,使 CPU 负责知识检索与前处理,GPU 则更专注于高价值的推理计算。
七、硬件底座:阿里云磐久UMX与1:1算力配比
为了支撑上述 CPU-GPU 协同架构,阿里云推出了磐久UMX超节点。该方案借助高带宽 Scale-Up 互连技术,可将内存池与存储池以纳秒级低延迟统一接入算力节点,从而有效突破“存储墙”限制。在其全栈异构设计中,CPU与GPU数量之比接近1:1,这也清晰表明,在 Agentic AI 时代,CPU 绝不是边缘配角,而是关键算力组成部分。
总结
Agentic AI 正在推动算力架构从“GPU-centric”的单点加速模式,升级为“CPU-GPU协同”的系统化共生模式。CPU 负责记忆管理、任务编排、知识检索与资源调度,GPU 则聚焦高密度推理计算。二者通过高速互连、vCPU 超卖、缓存优化等机制实现紧密协同,最终让智能体现为系统级协作的结果,而不再是单一芯片的独立表演。这样的架构转向不仅会影响未来的硬件采购、集群部署与算力设计,也将持续重塑 AI 应用的全栈软件体系。
