机器学习(ML)与人工智能(AI)技术,常被统称为AI,是当前资本投入最为密集的科技领域之一。预计在未来数年内,AI技术与应用能力将广泛集成于边缘设备与自治系统之中,同时云服务与生成式AI的生态版图也在持续扩展。
然而,人工智能的全面普及也伴随着显著的发展挑战。从多个维度来看,支撑大语言模型(LLM)、自然语言处理、语音识别及强化学习等系统的深度神经网络(DNN)技术,本质上是在消耗海量存储、内存与计算资源,以换取构建高效AI能力的“快速路径”。
其核心逻辑在于:相较于早期依赖数学效率与模型优化的ML/AI开发方式,如今业界能够借助更大规模的训练数据集与更强大的算力,构建出更精准、更实用的AI模型。OpenAI曾发布一项研究分析,指出AI开发所使用的计算资源每3.4个月便翻一番,而摩尔定律在计算能力提升方面则约为每两年翻一番。这意味着,在某个关键时间节点上,计算能力的进步速度终将被当前AI训练与推理范式日益增长的需求所超越。
要在边缘设备上实现AI技术的有效落地并保持竞争力,必须在某些方面进行权衡,以满足边缘系统对尺寸、重量、成本及能耗的严格限制。常见策略之一是降低数字AI模型中数据的精度或分辨率。然而,降低分辨率对AI在能耗与复杂度方面的优化也存在固有极限。GPU之所以成为AI训练与推理任务中大型矩阵运算的主流选择,正是因为其在此类计算场景下比CPU更强大、更节能。
然而,在基于冯·诺依曼架构的数字计算体系中,处理速度始终面临一个物理上限——即著名的“冯·诺依曼瓶颈”,指处理速度受限于内存与处理单元之间的数据传输速率。
图1:传统冯·诺依曼架构如何受限于大规模数据迁移。来源:IBM
正是基于上述现实,IBM以及Mythic AI等AI技术公司,已将模拟AI视为边缘AI训练与推理的未来发展方向。业内消息指出,模拟AI技术可能比数字AI技术快数十倍乃至数百倍,且能效更高。这意味着,在能耗严格受限的边缘设备中,AI的处理能力有望实现质的飞跃。
图2:该图对比了2014年至2026年间当前及近期的数字AI与模拟AI硬件技术,以及各自的每瓦性能表现。来源:IBM
数字处理技术依赖于以离散值形式封装的数据,每个比特位存储在特定的晶体管或存储单元中。而模拟处理技术则能够利用存储在单个晶体管或存储单元中的连续信息。仅此特性,就使模拟技术能够在更小的物理空间内存储更多数据——当然,代价是引入了因随机错误注入而产生的数据可变性。
这种模拟存储的可变性,可能导致前向传播(推理)过程中的失配误差,以及反向传播(训练计算)过程中的计算误差。这两类误差显然都不理想,但可以通过数字与模拟电路相结合的方式进行校正,将误差控制在最小范围内,同时借助其他AI训练技术来减轻反向传播带来的误差影响。
对于人工神经网络(ANN)而言,如今这种可变性已经能够得到有效管理。回顾历史,模拟存储的可变性正是半个多世纪前数字计算技术最初取代模拟技术的原因——毕竟大多数计算系统对精度有着更高的要求。
模拟AI的独特优势
ANN模拟计算还具备其他显著优势。例如,乘法累加运算——这是ANN计算中最常用的操作——可以利用电动力学的物理定律来实现:通过欧姆定律完成乘法,通过基尔霍夫定律完成求和。这使得模拟计算机能够将输入视为数组进行并行处理,并执行完整的矩阵运算。相比使用CPU甚至GPU进行矩阵计算,这种方式通常更快、更高效。
图3:基于PyTorch、Caffe和TensorFlow等标准框架构建的AI工作流,可通过模拟矩阵处理器进行部署。
模拟计算技术的另一大亮点,在于能够利用不同的存储单元技术——例如相变材料(PCM)与数字闪存——将它们作为可变电阻(而非开关)来运行。这些模拟存储方法允许在相同位置完成计算与存储,且无需持续供电来维持数据。
这意味着,在模拟计算与存储架构中,不存在“冯·诺依曼瓶颈”。模拟数据存储本质上具有无源特性,随着时间的推移,其能耗远低于有源数字数据存储。以PCM为例,其工作原理是:材料的电导率取决于PCM存储单元内非晶态与晶态的比例。对于IBM的PCM技术而言,较低的编程电流会产生更低的电阻与更结晶化的结构,而较高的编程电流则生成更多非晶材料,对应更高的电阻。这正是PCM数据存储相对非易失的原因,也是ANN突触权重可以存储为单个PCM单元电导上限与下限之间连续统一体的原因——无需多个晶体管或其他数字存储单元上的多个比特位。
因此,模拟AI技术在能源与计算能力受限的边缘系统上,正成为一种极具吸引力的解决方案——它无需依赖大规模的云AI基础设施与互联网连接,即可带来深度神经网络的强大能力。这将催生反应更迅速、效率更高、能力更卓越的边缘AI,尤其适用于机器人、全自动驾驶、安全系统乃至认知无线电/通信等自主应用场景。
