(来源:X)
OpenAI表示,近期出现了两项重要进展:其一,开发中的前沿模型在失控情况下攻击了外部第三方公司的数据库;其二,即将推出的Astra模型可能已经达到“关键网络安全能力”门槛。与此同时,公司内部研究也在持续快速推进。在这些背景下,OpenAI认为,在模型训练流程的各个阶段,都更有必要加强监控、对齐以及隔离防护等安全措施。
OpenAI首席科学家雅库布·帕乔茨基周二在记者会上表示:“我们确实预计这些模型的能力提升速度会比过去快得多,也正因为如此,我们才会更加重视并持续加强安全防护措施。”
OpenAI披露,为了满足既定安全标准,针对最新一批计划部署的模型,公司已暂停强化学习(RL)训练两周,以进一步提升研究环境的安全性,并扩大监控系统的覆盖范围。目前,公司最大规模前沿模型的强化学习训练仍然处于暂停状态。
在具体执行层面,OpenAI如今要求,凡是涉及Astra模型或更先进AI模型的工作负载,都必须采用最高等级的安全防护措施。因此,大量相关工作在完成迁移并达到新安全标准之前,都将维持暂停。
更值得关注的是监控系统的升级与扩展,其中引入了激活分类器(activation classifiers)。这类分类器会对每一个被采样的词元进行持续监测,并将潜在异常情况上报至自动化调查系统。
该系统的设计目标是,一旦检测到令人担忧的活动,能够在30分钟内发出预警。如果监控系统判断可能有人或模型突破了关键安全边界,就会触发最高优先级警报,并第一时间通知安全、安保和研究团队。
OpenAI介绍称,上述AI安全防护措施需要消耗相当可观的算力资源。
按照公司当前测算,监控系统带来的额外算力开销,大约相当于被监控推理算力的20%。不过在不同训练任务和模型评估场景中,这部分成本也会出现较大差异。
需要指出的是,这并不是OpenAI本月第一次表态将放缓先进大模型训练。
OpenAI曾在8月7日宣布,即将发布的Astra模型可能已经达到《准备框架》的网络安全能力关键阈值,因此将暂停所有未满足强化安全控制要求的Astra相关活动。
因此,最新公告中提到的“暂停两周”,至少应当从两周之前开始计算。
OpenAI早在2023年底就提出了一套评估标准——《准备框架》(Preparedness Framework)。那么,网络安全能力的“关键”阈值究竟意味着什么?它指的是AI模型在多个经过强化的现实关键系统中,能够自主识别并开发出不同严重程度的有效“零日漏洞”,且无需人工介入;或者说,仅凭一个宏观层面的预期目标,就能针对经过强化的目标构思并执行端到端的新型网络攻击策略。
OpenAI的最新公告,也引发了网友们对另一个热门问题的讨论:Astra模型究竟会在什么时候正式公开发布。
周一曾有消息爆料称,Astra最快可能在本周推出,该模型还将被集成到OpenAI专为编程场景打造的Codex平台中。考虑到Astra相较于GPT-5.6带来的显著进步,这一版本很可能不会以GPT-5.7命名,而是有望直接开启GPT-6时代。
然而,OpenAI周二再次强调“安全优先”,并宣布暂缓先进大模型扩展,这也让“即将推出的Astra模型”究竟何时落地变得更加扑朔迷离。
预测市场Polymarket的数据显示,随着OpenAI发布这份最新公告,Astra模型在8月内发布的概率已经降至13%,不过投资者依然对该模型在未来两个月内问世保持了相当高的信心。
