游乐游手机版
首页/iphone/文章详情

GPT-Red:OpenAI的LLM超级黑客,旨在提升安全性

时间:2026-07-20 08:09
OpenAI开发的GPT-Red是一种自动执行红队安全评估的LLM超级黑客,通过自我对弈循环训练提升模型防御能力,成功发现“假思想链”等新型攻击,在发现有效攻击方面优于人类,但仍需与人类红队配合。
拳击手低视角打斗场景

OpenAI 开发了一款名为 GPT-Red 的 LLM 超级黑客,专门作为陪练,帮助其他模型提升抵御网络攻击的能力。上周,他们发布了旗舰模型的最新版本 GPT-5.6,并宣称得益于 GPT-Red 的训练,该版本成为迄今为止最强悍的模型。

GPT-Red 能够自动执行名为“红队”的安全评估任务,这类工作通常由人类测试团队完成。其目标很简单:尽可能多地发现破坏或劫持系统的方法,并在软件正式发布前修补所有漏洞。

然而,随着 LLM 日益复杂且应用场景不断扩展,尤其是以智能体形式存在时,能够与文件、网站、代码甚至其他智能体交互,攻击面呈指数级增长。仅靠人力团队,已无法跟上所有类型的攻击。OpenAI 研究科学家、GPT-Red 联合创始人 Nikhil Kandpal 坦言:“风险面在扩大,爆炸半径也在变大。”

OpenAI 打造 GPT-Red 的初衷,是确保安全测试流程能够跟上未来的发展步伐。联合创始人 Dylan Hunn 表示:“当更强大的模型问世时,我们手中已经拥有能够发现新型攻击模式的系统。”事实上,GPT-Red 已经成功找到了此前从未见过的新型攻击方式。

OpenAI 将大部分精力集中在一种名为“即时注入”的攻击上。简单来说,就是黑客窃取 LLM 的指令,使其执行违规操作,例如复制机密、破坏代码库,或生成尴尬甚至有害的输出。理论上,这类指令可以隐藏在模型可能接触到的任何文本中,比如代码或网页上。

训练道场:自我对弈的攻防演练

具体如何实现?OpenAI 的研究人员选取了一个未经黑客训练的基础 LLM,将其与其他几个模型置于“自我对弈”循环中。该模型的任务是攻击其他模型,而被攻击的模型则负责防御。经过多轮对抗,GPT-Red 攻击能力日益精进,而其他模型的防御能力也随之增强。

训练过程在 OpenAI 专门设计的“道场”环境中进行,该道场模拟了 LLM 在现实世界中可能遇到的各种场景,包括浏览网页、阅读邮件、查看日历,甚至编辑代码等。

每当 GPT-Red 发现一种新的攻击方式,它就会反复钻研,寻找针对不同场景的最有效变体。Hunn 表示:“与人类红队成员相比,这个模型更擅长找到最实用的方法,而且极其执着,一定要把一种攻击研究透彻才肯罢休。”

特别值得一提的是,OpenAI 声称 GPT-Red 发现了一种前所未有的即时注入攻击,他们称之为“假思想链”。思想链相当于 LLM 在解题时记录推理过程的笔记。GPT-Red 找到了一种方法,将虚假笔记注入另一个模型的思维链中,诱使其相信这些假信息是真实的。

团队的另一位研究科学家 Chris Choquette-Choo 打了个比方:“这就好比我说 1+1=3,然后你验证了一遍,模型就‘哦,好吧,当然’,然后直接输出 3。”

乔治城大学安全与新兴技术中心(CSET)的 AI 安全分析师 Jessica Ji 认为,OpenAI 采用的自我对弈循环是一个好思路。她表示:“结果看起来很有希望。”

为了测试 GPT-Red 的能力,OpenAI 重做了 2025 年的一项实验,当时人类红队成员正在寻找早期版 GPT-5 的漏洞。结果显示,将相同任务交给 GPT-Red 后,其在发现有效攻击方面的表现优于人类。

OpenAI 还用它测试了 Vendy,一个由 Andon Labs 开发的自动售货机智能体。GPT-Red 成功攻破 Vendy,使其修改了促销价格,并取消了顾客的订单。

防御行为:攻击成功率大幅下降

OpenAI 表示,当他们将 GPT-Red 设计的最强攻击应用于自家模型时,超过 90% 的攻击对去年 8 月发布的 GPT-5 有效,而在新版 GPT-5.6 上,这一比例降至 23% 以下。

当然,GPT-Red 并非万能。它不擅长需要来回对话的攻击,而这类攻击恰恰是人类黑客的强项。此外,它也不太善于利用图像,而图像实际上可以在提示注入攻击中用于传递文本信息。

OpenAI 表示,GPT-Red 实际上是红队人员的补充。人类仍然能够发现它遗漏的攻击方式。一种做法是,将人类想到的攻击思路输入给 GPT-Red,让它探索所有可能的变体。

CSET 的 Ji 表示:“人类的专业知识依然非常重要。了解哪些领域最需要人为测试,这将非常有价值。”

不出所料,OpenAI 不会公开 GPT-Red。他们认为这个超级黑客比任何模仿者可能制造出的工具都要强大。毕竟,在世界上最富有的公司之一的计算资源支持下,他们已经研发了一年多。

Choquette-Choo 表示:“这可不是小事,不是随便谁都能轻易训练出一个超级攻击者的。”

来源:https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/
上一篇iOS安装应用提示不兼容的解决方法 下一篇嘈杂环境下的语音突显功能通话优化方案
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
手把手教你iPhone手机登录Apple账户的详细图文步骤
iphone · 2026-07-21

手把手教你iPhone手机登录Apple账户的详细图文步骤

打开设置应用,点击顶部Apple账户。可选择借助附近运行iOS17或更高版本的设备登录,或手动输入邮箱或手机号及密码。若已开启双重认证,则需输入6位数字验证码。如果忘记密码,可访问重设页面进行重置。

iPhone12 Pro Max升级iOS17.2续航实测
iphone · 2026-07-21

iPhone12 Pro Max升级iOS17.2续航实测

经测试,iPhone12ProMax升级至iOS17 2后,刷抖音一小时掉电仅为7%,待机15小时息屏显示仅耗电5%。系统优化了后台应用管理、屏幕亮度及处理器性能,并改进了电源管理机制,从而显著降低功耗,续航表现提升非常明显,效果出色。

苹果与OpenAI闹僵,前首席设计师艾维恐难脱身
iphone · 2026-07-21

苹果与OpenAI闹僵,前首席设计师艾维恐难脱身

苹果起诉OpenAI时刻意回避前首席设计师乔纳森·艾维的名字,但进入证据开示环节后,OpenAI可能引用其证词,苹果将面临质询或信任破裂的尴尬局面。

iPhone接入互联网的WiFi和蜂窝网络设置方法
iphone · 2026-07-21

iPhone接入互联网的WiFi和蜂窝网络设置方法

iPhone连接网络按固定优先级:先尝试最近使用过的Wi-Fi,再显示可用列表供手动选择,最后使用蜂窝数据。5G机型可能优先用5G蜂窝,并提示切换回Wi-Fi的方法。若Wi-Fi无互联网,系统自动切至蜂窝网络,可能产生额外费用。

苹果推送iOS 26.6 Beta 5 新增恶意信息检测功能
iphone · 2026-07-21

苹果推送iOS 26.6 Beta 5 新增恶意信息检测功能

苹果推送iOS26 6Beta5,新增恶意信息检测功能,可智能识别潜在恶意信息并弹出提示,提供“暂不处理”“向苹果报告”等选项,进一步强化隐私安全。该版本仅优化安全与稳定性,无全新功能。