蓝戟近日的一项测试,在AI硬件领域引发了不小的关注——他们使用英特尔Arc Pro B70 GPU运行DeepSeek R1模型,在吞吐量表现上,竟然超越了RTX 5090D和RTX 4090D,这一结果令人意外。
这并非虚构场景,而是基于真实测试环境得出的数据。测试采用四张显卡并行部署,参与对比的核心选手共有三款:英特尔Arc Pro B70 32GB、英伟达RTX 5090D 32GB以及RTX 4090D 24GB。评估标准也十分明确——基于DeepSeek R1-Distill Qwen 32B FP16模型,固定输入输出长度为128个tokens,并发数从1逐步提升至512,核心指标为token/s吞吐量。
从公布的数据来看,结果相当有意思。当并发数低于32时,RTX 5090D稳稳占据领先位置,RTX 4090D紧随其后,而Arc Pro B70的表现基本能与4090D打成平手。
但转折点出现在并发数提升之后——当并发数达到32和64时,Arc Pro B70开始追平甚至反超RTX 4090D。在并发128这个关键节点上,Arc Pro B70的token吞吐量比RTX 5090D高出8.6%,比RTX 4090D高出34.2%。
随着并发数继续攀升,这一优势还在持续扩大:并发256时,Arc Pro B70比RTX 5090D高出7.5%,比RTX 4090D高出48.7%;并发512时,差距依然维持在这一量级。


更直观的数据来自单卡峰值表现:英特尔Arc Pro B70 GPU的最终Tokens吞吐量达到了每秒2320.76个Token,在参测所有显卡中位列第一。

这组数据释放出的信号其实非常明确:在高并发的AI推理场景中,传统的“性能等级”判断方式可能需要重新审视。英伟达在单卡绝对算力上仍然占据优势,但英特尔Arc Pro B70在大规模并发任务下的吞吐表现,显然找到了自己的节奏。对于关注大模型推理部署效率的团队来说,这无疑是一个值得认真考虑的选择。
