游乐游手机版
首页/AI热点日报/热点详情

PrismML将27B大模型塞进手机,引领AI从规模转向智能密度

类型:热点整理2026-07-24
AI领域的Scaling Law并未触及天花板,这一点在语言大模型、多模态模型以及物理AI模型上均有清晰印证——随着算力提升与规模扩大,模型性能仍在持续增长。然而,单纯依靠大规模算力在Scaling路径上高速推进,这一范式已逐渐缺乏新意。更关键的是,大尺寸模型并非适用于所有场景,尤其在物理AI领域,

AI领域的Scaling Law并未触及天花板,这一点在语言大模型、多模态模型以及物理AI模型上均有清晰印证——随着算力提升与规模扩大,模型性能仍在持续增长。然而,单纯依靠大规模算力在Scaling路径上高速推进,这一范式已逐渐缺乏新意。更关键的是,大尺寸模型并非适用于所有场景,尤其在物理AI领域,终端设备的算力、能耗与体积限制,构成了不可回避的硬性约束。

在此背景下,由加州理工学院教授创立的PrismML选择了一条截然不同的技术路线。与其继续堆砌算力与模型规模,他们更专注于提升模型的“智能密度”。

此前,该公司种子轮融资总额达到1625万美元,投资方包括Khosla Ventures与Cerberus Ventures。有报道指出,加州理工学院也参与了本轮融资,并与Google一同为PrismML提供算力支持。

加州理工教授开辟一条不同于传统Scaling Law的新路径

Babak Hassibi是PrismML的联合创始人兼首席执行官,同时担任加州理工学院电气工程、计算与数学科学教授。他的联合创始人还包括Sahin Lale、Omead Pooladzandi与Reza Sadri。

PrismML创始团队合照,来源:PrismML官方

Babak Hassibi长期深耕信息论、信号处理、控制、优化及机器学习领域。早在1990年代,他便参与提出了神经网络剪枝方法Optimal Brain Surgeon,通过二阶信息识别模型中的冗余参数。此外,他还曾联合创办自动驾驶感知公司Neural Propulsion Systems并担任首席技术官,积累了将算法、芯片与硬件系统全面打通的产业经验。

Sahin Lale是另一位联合创始人,兼任研究联席负责人。他在加州理工学院获得电气工程博士学位,长期研究动态系统、强化学习与自适应控制,随后在Neural Propulsion Systems从事算法研发工作。

Omead Pooladzandi同样是联合创始人兼研究联席负责人。他博士毕业于加州大学洛杉矶分校,研究重点聚焦于二阶优化、数据高效训练及模型泛化。

Reza Sadri是联合创始人兼战略副总裁。他长期从事数据库、高性能存储与机器学习基础设施,曾创办Levyx,也在Instacart负责过机器学习基础设施团队,随后进入加州理工学院负责AI Bootcamp项目,目前主要承担公司的系统工程、产品化与商业化工作。

增加AI模型的训练算力、参数量与训练数据,确实能够进一步提升模型性能,但随之而来的问题是,这些模型必须依赖庞大的数据中心基础设施才能完成部署。

这一局面形成了结构性制约:受限于延迟、硬件性能与隐私风险,最强大的模型被锁定在大型计算集群与专用基础设施中,而手机、笔记本、汽车、机器人、企业本地环境等端侧与边缘场景,实时且安全的AI体验始终难以真正落地。

PrismML试图解决的核心矛盾,正是让强大的AI模型在本地实现高效、安全且更快速的运行;同时,让数据中心用更少的资源提供更强的计算能力,从而摆脱失控的能源成本。

他们的目标,是开创一种全新的AI范式——模型能够适应多样化的硬件环境,并在单位算力与能耗下释放出最大智能潜力。

具体而言,PrismML通过尽量无损地压缩AI模型,大幅降低其内存、算力与能耗占用,从而让模型能力逐步摆脱对参数规模与基础设施持续扩张的依赖。

与那些以4-bit、8-bit精度做训练后量化的公司不同,PrismML并非只压缩部分权重,或依赖少量高精度层来维持模型能力,而是将Embedding、Attention、MLP及输出层等整个语言网络改造为二值或三值权重。

在二值模型中,每个权重仅表示正、负两种状态,每128个权重共享一个FP16缩放系数,实际平均占用约1.125 bit;三值模型则增加零状态,实际平均占用约1.71 bit,以稍大的体积换取更高的能力保留。

注:模型权重可理解为神经网络内部的“调节旋钮”。传统模型会精确记录每个旋钮的具体数值,二值只记录正、负方向,三值再增加零状态,从而用更少数据近似保存原有模型能力。

此外,他们还为这些权重开发了专用推理内核,运行时直接读取压缩格式,无需重新展开为FP16,从而同时减少模型体积、内存带宽与推理过程中的数据移动。

PrismML提出了一个评判模型的新概念——智能密度,用于衡量模型单位部署体积所能提供的能力大小。更进一步,他们希望提高模型在有限内存、功耗与部署空间下所能承载的有效智能。

Bonsai 27B与同参数规模其他模型的智能密度(每GB)对比,来源:PrismML官方

2026年3月,他们推出了全球首批具备商业可行性的1-bit大语言模型——1-bit Bonsai 8B。该模型在整个神经网络中采用了自研的1-bit设计:嵌入层、注意力层、多层感知机层以及语言模型头均为1-bit,是一个端到端的原生1-bit模型。

可在手机本地运行的1-bit Bonsai 8B,体积比其它同参数模型小10倍以上,性能却几乎持平,来源:PrismML官方

相比Llama3 8B,它体积缩小14倍,速度提升8倍,能效提高4-5倍,大小仅为1.15 GB,足以轻松“装入”一部iPhone 17 Pro。

它也能够在电脑上运行。根据PrismML自身数据,1-bit Bonsai 8B在搭载M4 Pro芯片的Mac电脑上,推理速度达到131 tokens/秒;使用RTX 4090显卡推理,速度可达368 tokens/秒;而在iPhone 17 Pro Max上,速度约为44 tokens/秒。

他们最新的模型是Bonsai 27B,基于Qwen3.6 27B打造,也是同等能力级别中首款可在手机上运行的模型。

用GeForce RTX 5090推理,Bonsai 27B的1-bit版本速度最高可达163 tokens/秒,三值版本可达134 tokens/秒。在搭载M5 Max芯片的Mac上,其1-bit版本速度最高为87 tokens/秒,三值版本为58 tokens/秒。

Bonsai 27B可通过MLX在苹果设备(Mac、iPhone、iPad)上原生运行,也可通过CUDA在NVIDIA GPU上运行。

Bonsai 27B的意义在于,27B尺寸的模型已经能够实现更复杂的工作,例如:多步推理、结构化工具调用、视觉任务,以及能够在漫长步骤中始终保持连贯的“计算机操作”智能体循环。

Bonsai 8B与Bonsai 27B的推出,解锁了一种全新的系统架构:混合部署。即把非极限与隐私敏感型任务路由给能力过硬的本地模型,同时将云端前沿模型保留给最困难的步骤。这将使智能体系统的单任务成本呈断崖式下降。

在应用层面,当高级模型变得足够小巧、快速且高效,足以在本地运行时,AI产品的设计空间将变得更加宽广。例如:全天候运行的端侧智能体、实时响应的机器人、安全可靠的企业级Copilot、离线智能,以及专为受限环境(如带宽、功耗或合规限制阻碍了高级模型落地的场景)打造的AI原生产品。

AI模型的下一轮进化,可能从追求规模转向提升“智能密度”

过去几年,AI模型沿着Scaling Law一路扩张:更多参数、更多数据、更大算力。它确实推动了能力的跃升,但也让模型越来越依赖数据中心、内存、带宽与电力。

如今,当AI进入企业系统、机器人、汽车与智能设备时,这条路径开始触及自己的边界。企业需要专有数据保持隐私,而物理AI的终端,无论是机器人、汽车还是手机/耳机,都必须在真实环境中持续感知、判断与行动。它们都要求智能能够在本地运行,而模型体积与能耗正成为新的硬性约束。

这意味着,AI模型的下一轮进化,很可能从追求绝对规模,转向提升“智能密度”:让每个bit、每GB内存与每单位能耗承载更多能力。模型的进步,也将从单纯扩大规模,走向对智能本身的压缩与重构。

我们或许正站在下一个十字路口。过去的问题是如何获得更多智能,接下来的问题则是如何让智能进入更多设备与场景。浓缩智能由此不再只是效率提升,它可能改变模型的演进方向,也重新定义AI产品的边界。未来的AI将分布在云端、边缘,以及两者之间的所有位置。

下一轮模型竞争,恐怕将由谁能以更小的资源代价,把更强的智能带入更广阔的现实世界来定义。

来源:https://36kr.com/p/3909417015022721

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。