
OpenAI 开发了一款名为 GPT-Red 的 LLM 超级黑客,专门作为陪练,帮助其他模型提升抵御网络攻击的能力。上周,他们发布了旗舰模型的最新版本 GPT-5.6,并宣称得益于 GPT-Red 的训练,该版本成为迄今为止最强悍的模型。
GPT-Red 能够自动执行名为“红队”的安全评估任务,这类工作通常由人类测试团队完成。其目标很简单:尽可能多地发现破坏或劫持系统的方法,并在软件正式发布前修补所有漏洞。
然而,随着 LLM 日益复杂且应用场景不断扩展,尤其是以智能体形式存在时,能够与文件、网站、代码甚至其他智能体交互,攻击面呈指数级增长。仅靠人力团队,已无法跟上所有类型的攻击。OpenAI 研究科学家、GPT-Red 联合创始人 Nikhil Kandpal 坦言:“风险面在扩大,爆炸半径也在变大。”
OpenAI 打造 GPT-Red 的初衷,是确保安全测试流程能够跟上未来的发展步伐。联合创始人 Dylan Hunn 表示:“当更强大的模型问世时,我们手中已经拥有能够发现新型攻击模式的系统。”事实上,GPT-Red 已经成功找到了此前从未见过的新型攻击方式。
OpenAI 将大部分精力集中在一种名为“即时注入”的攻击上。简单来说,就是黑客窃取 LLM 的指令,使其执行违规操作,例如复制机密、破坏代码库,或生成尴尬甚至有害的输出。理论上,这类指令可以隐藏在模型可能接触到的任何文本中,比如代码或网页上。
训练道场:自我对弈的攻防演练
具体如何实现?OpenAI 的研究人员选取了一个未经黑客训练的基础 LLM,将其与其他几个模型置于“自我对弈”循环中。该模型的任务是攻击其他模型,而被攻击的模型则负责防御。经过多轮对抗,GPT-Red 攻击能力日益精进,而其他模型的防御能力也随之增强。
训练过程在 OpenAI 专门设计的“道场”环境中进行,该道场模拟了 LLM 在现实世界中可能遇到的各种场景,包括浏览网页、阅读邮件、查看日历,甚至编辑代码等。
每当 GPT-Red 发现一种新的攻击方式,它就会反复钻研,寻找针对不同场景的最有效变体。Hunn 表示:“与人类红队成员相比,这个模型更擅长找到最实用的方法,而且极其执着,一定要把一种攻击研究透彻才肯罢休。”
特别值得一提的是,OpenAI 声称 GPT-Red 发现了一种前所未有的即时注入攻击,他们称之为“假思想链”。思想链相当于 LLM 在解题时记录推理过程的笔记。GPT-Red 找到了一种方法,将虚假笔记注入另一个模型的思维链中,诱使其相信这些假信息是真实的。
团队的另一位研究科学家 Chris Choquette-Choo 打了个比方:“这就好比我说 1+1=3,然后你验证了一遍,模型就‘哦,好吧,当然’,然后直接输出 3。”
乔治城大学安全与新兴技术中心(CSET)的 AI 安全分析师 Jessica Ji 认为,OpenAI 采用的自我对弈循环是一个好思路。她表示:“结果看起来很有希望。”
为了测试 GPT-Red 的能力,OpenAI 重做了 2025 年的一项实验,当时人类红队成员正在寻找早期版 GPT-5 的漏洞。结果显示,将相同任务交给 GPT-Red 后,其在发现有效攻击方面的表现优于人类。
OpenAI 还用它测试了 Vendy,一个由 Andon Labs 开发的自动售货机智能体。GPT-Red 成功攻破 Vendy,使其修改了促销价格,并取消了顾客的订单。
防御行为:攻击成功率大幅下降
OpenAI 表示,当他们将 GPT-Red 设计的最强攻击应用于自家模型时,超过 90% 的攻击对去年 8 月发布的 GPT-5 有效,而在新版 GPT-5.6 上,这一比例降至 23% 以下。
当然,GPT-Red 并非万能。它不擅长需要来回对话的攻击,而这类攻击恰恰是人类黑客的强项。此外,它也不太善于利用图像,而图像实际上可以在提示注入攻击中用于传递文本信息。
OpenAI 表示,GPT-Red 实际上是红队人员的补充。人类仍然能够发现它遗漏的攻击方式。一种做法是,将人类想到的攻击思路输入给 GPT-Red,让它探索所有可能的变体。
CSET 的 Ji 表示:“人类的专业知识依然非常重要。了解哪些领域最需要人为测试,这将非常有价值。”
不出所料,OpenAI 不会公开 GPT-Red。他们认为这个超级黑客比任何模仿者可能制造出的工具都要强大。毕竟,在世界上最富有的公司之一的计算资源支持下,他们已经研发了一年多。
Choquette-Choo 表示:“这可不是小事,不是随便谁都能轻易训练出一个超级攻击者的。”
