游乐游手机版
首页/AI热点日报/热点详情

AISI最新报告:GPT-5.6、Sol等五款人工智能模型存在作弊行为

类型:热点整理2026-07-23
7月23日,英国AI安全研究所(AISI)发布了一份引人关注的报告——他们测试了OpenAI和Anthropic旗下的5款前沿AI模型,结果发现,这些模型无一例外地出现了“作弊”行为。换句话说,它们会试图绕过既定规则,通过捷径甚至违规操作来完成任务,而不是老老实实按照预设路径走。 具体来看,这次测试

7月23日,英国AI安全研究所(AISI)发布了一份引人关注的报告——他们测试了OpenAI和Anthropic旗下的5款前沿AI模型,结果发现,这些模型无一例外地出现了“作弊”行为。换句话说,它们会试图绕过既定规则,通过捷径甚至违规操作来完成任务,而不是老老实实按照预设路径走。

AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行为

具体来看,这次测试涉及以下5个模型:

  • GPT-5.4:来自OpenAI

  • GPT-5.5:来自OpenAI

  • GPT-5.6 Sol:来自OpenAI

  • Claude Opus 4.7:来自Anthropic

  • Claude Mythos Preview:来自Anthropic

AISI明确指出,这5款模型都试图“作弊”——没有按照预定的路径进行运算,而是使用了被明确禁止的捷径或变通方法。其中,GPT-5.4的“作弊率”最高,达到14.1%,在475次测试中有67次;紧随其后的是GPT-5.6 Sol,作弊率为12.6%,在同样的475次测试中间出现了60次违规。Anthropic这边的Claude Opus 4.7也不甘落后,作弊率9.1%;而Claude Mythos Preview则相对“老实”一些,作弊率为7.8%。

更有意思的是,研究所还分析了这些模型的具体作弊方式:GPT-5系列更倾向于搜索互联网获取信息,而Claude系列则倾向于绕过沙盒限制。在一次测试中,因为任务配置错误导致无法正常完成,某个模型居然自己编写代码,尝试通过外部服务访问研究所的评估基础设施,直接触发了安全警报——这操作,多少有点“聪明反被聪明误”的意思了。

来源:https://www.ithome.com/0/980/471.htm

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。