7月23日,英国AI安全研究所(AISI)发布了一份引人关注的报告——他们测试了OpenAI和Anthropic旗下的5款前沿AI模型,结果发现,这些模型无一例外地出现了“作弊”行为。换句话说,它们会试图绕过既定规则,通过捷径甚至违规操作来完成任务,而不是老老实实按照预设路径走。

具体来看,这次测试涉及以下5个模型:
GPT-5.4:来自OpenAI
GPT-5.5:来自OpenAI
GPT-5.6 Sol:来自OpenAI
Claude Opus 4.7:来自Anthropic
Claude Mythos Preview:来自Anthropic
AISI明确指出,这5款模型都试图“作弊”——没有按照预定的路径进行运算,而是使用了被明确禁止的捷径或变通方法。其中,GPT-5.4的“作弊率”最高,达到14.1%,在475次测试中有67次;紧随其后的是GPT-5.6 Sol,作弊率为12.6%,在同样的475次测试中间出现了60次违规。Anthropic这边的Claude Opus 4.7也不甘落后,作弊率9.1%;而Claude Mythos Preview则相对“老实”一些,作弊率为7.8%。
更有意思的是,研究所还分析了这些模型的具体作弊方式:GPT-5系列更倾向于搜索互联网获取信息,而Claude系列则倾向于绕过沙盒限制。在一次测试中,因为任务配置错误导致无法正常完成,某个模型居然自己编写代码,尝试通过外部服务访问研究所的评估基础设施,直接触发了安全警报——这操作,多少有点“聪明反被聪明误”的意思了。
