7月14日,AI领域传来一则重磅消息:PrismML首席执行官巴博克·哈西(Babak Hassibi)在接受CNBC专访时表示,苹果公司正在积极评估其AI量化技术。尽管双方谈判仍处于早期阶段,但哈西透露会谈“进展顺利”,不过未披露具体合作细节。

行业分析师普遍猜测,谈判内容可能涉及技术授权,甚至不排除苹果直接收购PrismML的可能性。毕竟,能够将大模型压缩到如此极致,对苹果在移动端AI领域的布局而言,吸引力显而易见。
PrismML这家公司背景深厚——它是加州理工学院的衍生创业公司,其核心技术突破在于“原生1-bit模型压缩技术”。简而言之,模型权重仅保留{-1, +1}两个值,并配合分组缩放因子,这并非传统意义上的量化,而是从底层架构重新设计。官方宣称,该技术没有“高精度逃生通道”,能够在接近FP16模型精度的前提下,将模型体积压缩至全精度版本的约1/14,内存占用减少超过90%,推理速度最高提升8倍,能耗降低75%至80%。
今日,PrismML正式发布了Bonsai 27B模型,该模型基于Qwen 3.6 27B模型微调而成。最令人惊叹的是,在保留90%智能水平的前提下,它竟然能够在12GB内存的iPhone上原生运行。要知道,原始模型大小约为54GB,经过压缩后不足4GB——这意味着iPhone 15及后续机型,可以直接在本地运行一个完整的27B参数大模型。
当然,哈西也坦言,这种量化技术并非没有代价。与完整版模型相比,量化后的版本在事实推理、数学和编程任务上表现明显较弱。具体而言,3-bit量化版本保留了约95%的基准测试得分,而1-bit版本则保留了约90%。换句话说,为了在手机上运行大模型,在性能和精度上必须做出一定取舍。
