7月24日,一位开发者在其社交平台上公布了一项令人瞩目的成果:通过自主研发的优化技术,使得已退役多年的Tesla P100(16GB显存)显卡,在运行35B(350亿参数)大模型时,推理速度提升了高达88%!
说到这里,或许有人会疑惑:P100不是早就该被淘汰了吗?确实,它诞生于2016年,基于Pascal架构,16GB显存在当时堪称豪华,但如今运行现代大模型软件时,算力已明显捉襟见肘。简单来说,硬件基础尚存,但软件生态已将其远远抛在身后。

其实这位开发者的做法并不复杂:他复刻了GitHub上的ik-llama.cpp项目,针对Pascal和Volta两种老架构编写了定制化的计算内核。简而言之,就是将之前被浪费的算力重新激活——好比给一张老显卡换上了全新的“变速箱”。
效果如何?数据表明,在运行35B参数的MoE模型时,预填(Prefill)速度提升了88%,解码(Decode)速度也提高了30%。这绝非小修小补,而是实打实的性能飞跃。
关键还在于MoE(混合专家)架构的天然优势。每次推理时,只有部分专家网络被激活,并非所有参数同时参与运算。结合量化压缩技术,权重体积进一步缩减,使得单张P100的16GB显存恰好能够容纳整个模型。巧合的是,这种架构对老显卡反而格外友好。
兼容性方面,不仅P100,P40、V100甚至更早的型号均可使用,并且支持在同一台机器中混插不同架构的显卡协同工作。这意味着什么?意味着你手头闲置的老显卡,完全可以组成一支“杂牌军”来运行大模型。
不过,需要注意的是,这套方案目前尚未打包成一键安装工具。用户需从GitHub拉取源码自行编译——这对动手能力有一定要求。此外,Tesla P100是被动散热的计算卡,没有内置风扇,装机时还需额外解决散热问题,要么优化机箱风道,要么加装水冷系统。总之,并非开箱即用。

最后谈谈价格。在海外二手市场中,P100的价格已经非常低廉。对于那些愿意折腾命令行编译和硬件改装的用户来说,这确实是一条低成本在本地运行35B级大模型的可行路径。老卡不死,只是凋零——但P100这一波,显然是被“复活”了。
