8月19日消息,据《时代》周刊(TIME)报道,OpenAI 首席执行官 Sam Altman 上周表示,当下确实是人工智能发展“放慢脚步”的合适时机。

他同时解释了 OpenAI 暂停开发其最强大、但尚未发布模型的原因与考量。
该公司周二宣布,将上线一系列新的 AI 安全措施,而这些举措也将直接放缓其未来的人工智能模型研发速度。
据公司高管透露,OpenAI 最近已暂停代号为“Astra”的下一代模型训练超过两周,其规模最大的前沿模型训练计划也将继续搁置,直到新的安全机制正式到位。
这是 OpenAI 首次采取类似行动。在这一罕见决定出台之际,OpenAI 一边积极筹备即将到来的 IPO,一边还在与主要竞争对手 Anthropic 展开激烈角逐。
与此同时,生成式人工智能技术的快速演进,也让行业领袖越来越担心自己是否还能有效控制这些先进 AI 系统。
此次放缓也促使 OpenAI 重新分配其两项最核心的资源——研究人才和算力资源。
奥特曼表示,一些他原本没想到会转向对齐研究(即让 AI 系统更好遵循人类意图)的研究人员,最近主动投入了这项工作。“我们已经调配了大量算力,不仅用于对齐研究,也投入到了这些新的监控系统中,”他说。
这些调整的直接背景,是 Hugging Face 平台发生的一起重大安全漏洞事件。Hugging Face 是广受欢迎的人工智能模型开发与托管平台。一个尚未发布的 OpenAI 系统突破了内部网络安全评估沙箱,并进一步侵入了 Hugging Face 的生产系统。OpenAI 研究人员花了大约一周时间才发现这一异常事件。
该公司首席科学家 Jakub Pachocki 承认了这次疏忽。他表示,OpenAI 其实已经构建了可用于检查模型运行计划的监控程序,但由于低估了相关程序的能力,在评估过程中并未将其应用到该系统上。“对于人工智能系统来说,你必须预料到会出现意料之外的情况,”他在采访中表示。
在 Hugging Face 事件发生后,OpenAI 立即冻结了部分研究项目,并在更严格的安全管控条件下分阶段恢复。
该公司周二表示,大量 Astra 相关工作负载目前仍处于暂停状态。OpenAI 还指出,Astra 的网络安全风险可能达到其“准备框架”(Preparedness Framework)中的“严重”(Critical)等级,这意味着安全措施需要在模型开发阶段就介入,而不是等到模型发布前才执行。至于新的安全流程会让 Astra 上线时间推迟多久,高管们目前尚未给出明确预估。
上周,奥特曼在接受《时代》周刊和《消息人士》独家采访时表示,这次放缓并不是因为某一个“决定性证据”,而是多项研究观察共同推动的结果。这些研究显示,随着人工智能能力提升速度超出研究人员预期,系统已经出现了“不同程度的错位”问题。
他强调,放慢 AI 训练和开发节奏,并不意味着某种灾难即将发生。“确保人工智能安全,”奥特曼表示,“比任何一家公司的增长势头都更重要。”
OpenAI 表示,公司正将安全监控能力扩展到强化学习的训练与评估环节。在这一阶段,高级 AI 模型会被赋予使用互联网、调用工具以及控制软件的能力。该方法会利用其他人工智能系统,对模型的内部推理过程和外部行为进行检查,以识别未经授权的访问、数据窃取,或试图绕过安全机制的行为。
据雅库布·帕乔基(Jakub Pachocki)在采访中透露,某些现有保护措施实际上已经超出了 OpenAI 当前“准备框架”(Preparedness Framework)的覆盖范围。该框架是 OpenAI 用于管理可能带来严重危害模型的公开规则手册。他还表示:“我们目前还无法给出明确时间表,但可以确定的是,我们必须对‘准备框架’进行升级和完善。”
OpenAI 表示,在修订这一框架的过程中,计划引入外部机构参与评估,并将在未来几天发布一份关于 Hugging Face 漏洞事件的详细事后分析报告。
OpenAI 此次主动放缓 AI 研发步伐的决定,也与 Anthropic 形成了鲜明对比。今年 2 月,《时代》杂志曾报道称,Anthropic 在无法提前确保足够安全措施的情况下,弱化了其“必要时停止训练模型”的承诺。Anthropic 联合创始人贾里德·卡普兰在接受《时代》采访时表示,如果竞争对手已经“遥遥领先”,那么单方面作出这样的承诺并没有现实意义。
与 OpenAI 一样,Anthropic 目前也在为预期中的 IPO 做准备。
彭博社近期报道显示,Anthropic 第二季度营收已超过 115 亿美元,使其截至 7 月底的年化营收突破 650 亿美元。相比之下,OpenAI 最新披露的年化营收接近 400 亿美元。OpenAI 放缓人工智能训练与增长节奏的决定,可能会进一步向竞争对手施压,迫使行业内其他公司也考虑采取类似的 AI 安全策略。
“我不喜欢这个行业里那种‘我们必须竞争’或者‘我们必须这样做,因为别人也会这样做’的心态,”奥特曼说,“我认为这是一种非常危险的动态。”
除了这次漏洞事件之外,OpenAI 目前尚未公开更多导致其放慢前沿模型训练速度的研究结果。公司管理层表示,支撑 Astra 风险分级判断的具体证据,可能要等到该模型技术报告发布后才会对外披露。
OpenAI 负责安全与对齐工作的 Mia Glaese 周二表示:“我们距离一切恢复正常还差得很远。”
