一份来自英美两大人工智能安全机构的联合评测,将月之暗面最新模型Kimi K3的“另一面”公之于众。英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)携手,对该模型进行了一次攻击性网络任务能力评估,结论十分明确:在漏洞利用开发与模拟网络攻击方面,Kimi K3大幅落后于美国领先的前沿模型,但优于同样来自中国的智谱GLM-5.2,在开放权重模型阵营中仍树立了新的标杆。更值得关注的是,Kimi K3的安全防护机制几乎未能有效拦截漏洞利用的开发过程,模型在配合此类操作时几乎没有遇到实质性阻力。
这场“测试”的第一套试题,是卡内基梅隆大学开发的ExploitBench基准。该基准从2023年之后的Chrome V8引擎中提取了41个真实漏洞,沿着软件利用的推进过程逐项评分。结果差距显著:美国领先模型平均得分76.2%,Kimi K3仅为32.2%,而GLM-5.2则以24.4%位居其后。更关键的是等级分布——在41项任务中,Kimi K3未能触及最高级别的“任意代码执行”(ACE),而这正是最危险的利用等级,意味着攻击者可以完全掌控目标系统;相比之下,美国模型在41项任务中成功实现了20项ACE。需要补充说明的是,英美机构在测试美国闭权重模型时关闭了系统级安全防护,仅为了衡量其最大能力,而此类防护在公开版本中默认开启。

第二套试题名为“最后的幸存者”(TLO),模拟了一次横跨四个子网、约20台主机的企业网络攻击,整条路径包含32个步骤,研究机构指出人类专家大约需要20小时才能完成。目前全球仅有少数模型能够真正通关,迄今已有四个公开可用的闭源权重模型通过了这一测试,其中最强的模型在十次尝试中成功完成了六到七次。Kimi K3平均走到第17步便卡住,美国领先模型能推进到第28.5步,而GLM-5.2仅能到达第11步;值得注意的是,Kimi K3在十次尝试中曾有一次在1亿token的限制内跑通了整条攻击链,说明其具备一定能力,但表现不稳定、难以调动。研究机构做出判断:只要给予初始网络访问权限并下达指令,Kimi K3便能够自主攻破规模较小、防御薄弱且易受攻击的企业系统。需要提醒的是,TLO并未考虑主动防御措施,并非完全贴近现实场景,但就在本周,OpenAI模型试图自主入侵Hugging Face的事件刚刚被披露,对方虽然使用了开放权重模型,但最终成功阻挡了攻击。
将时间轴拉长来看,中国模型确实在追赶,但始终存在差距。CAISI采用Elo评分体系追踪了自2025年初以来中美模型的网络能力,两条趋势线均呈上升态势,但红色中国线与蓝色美国线之间始终存在间隔。Elo提升400分意味着解决任务的概率提升十倍——这一差距不可小觑。英国机构此前曾估算开源模型与美国系统的性能差距约为四到七个月,2025年初时估算为六到十个月,最新结果正好落在这条规律之内。AISI发出明确警告:开源模型日益增强的网络能力,构成了一种“持续且不可逆的滥用风险”,不容忽视。
最耐人寻味的亮点,出现在测试结果与蒸馏指控的交汇点上。美国科学顾问迈克尔·克拉齐奥斯近期曾公开指控月之暗面,称其将Anthropic的Fable模型最优输出作为训练数据,对Kimi K3进行“蒸馏”提质,并声称对方获得了受美国出口管制的英伟达GB300芯片。而通用基准成绩出色、网络安全得分却显著偏低的现象,恰好可以用这一说法解释:Kimi K3大概率主要吸收了Claude在通用知识、编程和智能体任务上的输出;Anthropic的安全分类器会专门阻断高级攻击性网络查询,因此这类样本在蒸馏数据集中的占比极低——模型得以在标准排行榜上与西方对手抗衡,却未能学到更深入的漏洞利用能力。AISI的评测从侧面支撑了这一解读:它关闭美国模型上的系统级防护,恰恰暴露出那些几乎无法通过公开接口触及、因而基本无法纳入蒸馏的网络能力。一张考卷,不仅衡量出分数,更揭示了水面下那层未被点破的渊源。
