在嵌入式AI领域,一项看似不可能的任务近日被成功实现:乌克兰开发者Slava S在乐鑫ESP32-S3开发板上,本地运行了参数量高达2890万的AI模型。要知道,这块开发板的内存资源极为有限——仅配备512KB的SRAM、8MB的PSRAM和16MB的闪存。此前,另一位开发者Dave Bennett在同一块板子上部署AI模型时,参数上限被卡在26万个。差距有多大?整整两个数量级,堪称嵌入式AI部署的一次重大突破。
那么,Slava S究竟是如何做到的?关键一招是采用了Google Gemma模型中的“Per-Layer Embeddings”(逐层嵌入)技术。模型经过4-bit量化压缩后,文件体积被缩减至14.9MB,而包含2500万个参数的嵌入表则直接存入16MB的闪存中。这样一来,模型每生成一个Token,只需从嵌入表中读取极少量数据,内存压力大幅降低,从而在资源受限的芯片上实现了大模型运行。

当然,需要说明的是:这块板子虽然能跑2890万个参数,但别指望它陪你聊天或写代码。Slava S本人也坦承,目前的应用场景更偏向于垂直领域——比如离线咖啡机。想象一下,一台搭载ESP32-S3的咖啡机,可以根据咖啡豆品种、研磨方式、水粉配比和水温,实时生成个性化的冲泡建议。这比依赖云端的方案更省心,也更有趣,充分体现了边缘计算在特定场景下的独特价值。

话说回来,这个突破的意义更多在于验证了“小芯片也能跑大模型”的可能性。当算力成本不再是唯一瓶颈,嵌入式AI的边界正在被重新定义,为更多低功耗、小体积的终端设备带来本地智能化的新可能。
