引领智能体 AI 创新,在端侧构建个人 AI 未来
各位现场的朋友、嘉宾,上午好。今天想和大家深入聊聊一个正在发生的趋势:智能体AI的创新,以及它如何将个人AI的未来,牢牢锚定在我们的终端设备上。
要理解这个未来,不妨先回望一下AI在行业应用的演进路径。第一个阶段,我们称之为“感知AI”。这个阶段并不陌生,它专注于处理多媒体信号——比如理解语音、识别图像、进行智能降噪。这类技术早已在众多终端侧平台商业化落地,手机上的计算摄影就是个绝佳的例子,其背后正是感知AI在发挥作用。
紧接着,我们进入了“生成式AI”阶段。其核心在于,基于海量数据预训练后,AI能在有监督的情况下解决具体问题。OpenAI的ChatGPT、各类文生图模型,都是这一阶段的典型代表。而第三个阶段,就是眼下备受瞩目的“智能体AI”。它与生成式AI有个关键区别:智能体AI能在几乎无监督的情况下,自主理解用户意图,进行行动和决策,帮我们处理更为复杂的任务。再往前看,第四个阶段将是“物理AI”,AI能够理解并依据真实物理世界的规律进行反馈。目前这仍是前沿探索,如果关注过今年巴塞罗那的MWC大会,就能看到行业内大量的相关进展。
目前,行业的焦点显然集中在第二和第三阶段。那么,生成式AI在端侧的发展呈现出了哪些趋势?一个明显的信号是:能在端侧运行的生成式AI模型,其“智能”水平正在快速爬升。首先,终端设备能支持的模型参数量越来越大。手机上,我们已经能运行10亿到100亿参数级别的模型;PC上,这个数字达到了130亿到200亿;而在汽车这样的高性能场景下,甚至可以支持200亿到600亿参数量的模型。
即使在AR眼镜这类低功耗设备上,我们也实现了让10亿到40亿参数的模型完全在端侧运行。是的,与云端动辄千亿、万亿的参数量相比,端侧模型仍然“小巧”。但行业正通过各种技术全力推动这个上限——内存带宽的提升、量化位宽等模型压缩技术的优化,都意味着终端能承载的模型将越来越“丰满”。
从模型能力本身来看,有两个观察值得分享。第一,去年,具备真正推理能力的大模型已经成功部署到了端侧。第二,端侧模型所能处理的上下文长度也在显著增长。大约三年前,这个长度还普遍停留在1k-2k;两年前,扩展到了2k-4k;到了去年,在与合作伙伴的探索中,许多场景已经能支持4k-8k。在一些特定场景下,甚至已经触及32k-128k的惊人长度。
然而,更长的上下文对端侧部署是一大挑战。上下文越长,对KV缓存的需求就越大,这不仅要求更大的内存容量,也对内存带宽提出了更高要求。与此同时,模态也在演进:端侧模型正从单一的“文生文”、“文生图”,迈向融合语音、文字、图像、视觉乃至传感器数据的“多模态”,甚至向“全模态”进发。去年9月的骁龙峰会上,高通就展示了与合作伙伴将50亿参数的全模态模型完整运行在端侧,用户通过自然语言即可无缝交互。
趋势很清晰,但将生成式AI部署在端侧,优势和挑战同样突出。最大的优势无疑是个性化与隐私。个人数据的产生和存储源头都在端侧,在源头直接进行推理不仅自然,更能高效保护用户隐私。此外,端侧AI具备更高的成本优势,且不依赖网络,让服务随时随地可用。
挑战也不容忽视。首当其冲的是端侧内存规模的限制。尽管有各种压缩技术,但物理内存的上限,本质上也为端侧AI的能力设置了天花板。其次,内存带宽的限制直接影响着大模型输出token的速度,进而关乎用户体验的流畅度。第三点,尤其是在手机这类高度集成的设备上,能效平衡至关重要。必须避免AI推理运行时引发设备过热触发温控限制。因此,如何在内存、带宽、性能与能效之间找到那个完美的平衡点,是整个行业持续攻坚的课题。

说完了生成式AI,让我们把目光转向更具能动性的智能体AI。其核心趋势,在于如何与用户实现深度适配。第一个显著趋势是,终端侧智能体致力于提供更低时延、更强个性化、且持续无感的用户体验。第二个趋势是专业化。早期人们希望一个通用模型解决所有问题,现在则趋向于通过专业化的智能体和多智能体协作框架来应对不同任务。第三个,或许是对用户体验改变最大的趋势:高度个性化。未来的终端侧智能体,将不再是简单的语音助手,而是能够深度理解用户意图、上下文和感知信息的,真正“懂你”的AI伙伴。
那么,这样一个智能体是由什么构成的呢?可以把它想象成一个持续运行的闭环系统。这个系统包含了感知、理解、推理等多个基础模块,还整合了记忆系统、工具系统乃至执行系统。这些模块协同工作,使得智能体能理解用户意图,处理输入信息,将复杂任务分解并独立完成。更重要的是,它能提供一种“持续感知、持续思考、持续行动”的无缝体验。
这无疑将改变我们与数字世界的交互范式。过去常说“AI是新的UI(用户界面)”,未来,用户或许不再需要来回切换不同的APP或功能,只需通过语音或文本与智能体自然交流。智能体理解意图后,会自主规划任务,结合端侧大模型或云端通用大模型的能力,赋能娱乐、生产力乃至各行各业的应用场景。
过去,个人AI体验以手机为中心,其他设备作为附属。未来,我们正迈向一个以AI和用户为中心的多终端协同时代。AI不再绑定于某一特定设备,个人AI或智能体理解用户意图后,可以由多个设备灵活协同来完成任务。设备只是AI的载体,个人AI体验注定朝着更持续、更无感的方向演进。从这个视角看,个人AI必然始于终端侧——因为终端离用户最近,拥有最即时、最全面的个人数据,能在第一时间感知到用户的意图、上下文和偏好。
当然,个人AI并非孤立运行。通过混合AI架构,它可以在终端侧、本地边缘、网络边缘和中央云之间协同工作。为了支撑这样的未来,高通此前已经发布了多款能提供充足算力的产品,例如第五代骁龙8至尊版移动平台、骁龙X2 Elite计算平台等,市场上已有众多搭载这些平台的终端设备。

值得一提的是,本次峰会期间颁布的MemoryS大奖中,高通公司荣获“年度 AI 生态杰出贡献奖”。这正得益于其将业务从智能手机扩展至个人AI与智能可穿戴设备、PC、汽车、边缘网络及工业物联网等广泛边缘领域,持续引领构建“边缘智能生态”,推动AI在万物互联终端上实现低延迟、高安全的本地化落地。
话题回到技术布局。在终端侧之外,数据中心同样是关键战场。在今年MWC上,高通发布了基于Qualcomm® AI200和AI250芯片的加速卡及机架系统。它们能以行业领先的总体拥有成本,为高速数据中心的大规模生成式AI推理提供卓越的机架级性能与内存容量。特别是AI250,其创新的内存架构,为AI工作负载的处理效率带来了跨时代的跃升。
最后,可以这样总结高通在AI领域的整体构想:从手机、耳机、PC到汽车、机器人,乃至下一代数据中心,我们正通过统一的AI架构和一致的技术路线,打造一个高性能、高能效的软硬件技术底座。这使得我们的AI能力,得以从单一产品或芯片,扩展为规模化、跨终端、跨场景的平台级能力,从而真正赋能个人AI的广阔未来。
以上就是今天的全部分享,感谢各位。
