游乐游手机版
首页/AI热点日报/热点详情

Anthropic内部模型Model 2曝光:性能或强于Mythos 5

类型:热点整理2026-08-17
编辑|Panda刚刚,Anthropic 发布了自家的第二份《风险报告(Risk Report)》,全文共 186 页,内容密集、信息量极大。这份 Anthropic 风险报告中,最引人关注的关键词之一是 Model 2。它是一款能力超过 Claude Mythos 5、尚未面向公众开放,但已经在

编辑|Panda

刚刚,Anthropic 发布了自家的第二份《风险报告(Risk Report)》,全文共 186 页,内容密集、信息量极大。



这份 Anthropic 风险报告中,最引人关注的关键词之一是 Model 2。它是一款能力超过 Claude Mythos 5、尚未面向公众开放,但已经在 Anthropic 内部大规模投入使用的大模型。



Anthropic 表示,Model 2 已广泛用于编程、数据生成以及其他 AI 智能体任务,也深度参与研究和工程流程,既包括人机交互式使用,也包括持续运行的智能体部署。它与 Mythos 5 并列,成为截至 7 月 15 日公司内部能力最强、使用频率最高的两款模型。

不过,目前外界能获知的信息也仅限于此。报告没有披露 Model 2 的参数规模、训练成本、上下文长度或模型架构,也没有说明它与 Mythos 5 是否共享权重或训练路径,甚至没有明确「Model 2」究竟是真实内部代号,还是临时使用的标签。唯一可以确认的是,报告将其归类为「Mythos-class model」,并指出它在部分领域强于 Mythos 5、部分领域略弱,但整体能力稍强。

Anthropic 目前「没有对外发布它的计划」。这句话其实也传递出一种正在形成的新趋势:前沿 AI 模型的真实能力边界,可能会先存在于实验室内部,深度参与下一代模型研发,而不再与面向消费者的公开产品线完全重合。

下面就来具体看看这份报告都讲了什么。



Model 2 到底有多强?

Anthropic 对 Model 2 的定性描述相当克制。报告称,在许多与内部工作相关的任务上,它相较 Mythos 5 属于一次「明显改进」,但提升幅度并没有从 Claude Opus 4.6 跳到 Mythos Preview 时那么大。由于 Model 2 尚未完成通常面向外部部署所需的完整评估流程,Anthropic 也承认,对其能力判断的信心低于公开发布的模型。

Anthropic 在报告中提供了两个内部指标,比较值得关注。

第一个是 CoBench。这是一套由 449 个真实 Anthropic 研发问题组成的内部基准测试:模型会被放回某个历史时间点,只能访问当时的代码库、日志、内部消息和文档,然后去定位那些后来由工程师解决的问题根因。



Model 2 得分为 62.8%,高于 Mythos 5 的 50.3% 和 Mythos Preview 的 54.8%。Anthropic 估计,一个真正能够全面替代公司技术人员的 AI 系统,至少应达到 85%。换句话说,Model 2 仍然无法真正「替代研究员」,但它已经把上一代最强内部模型拉开了十多个百分点。

第二个指标是 Anthropic 版本的 Epoch Capability Index,也就是 AECI。



Anthropic 的内部能力指数显示,2026 年的 Mythos 系列明显偏离此前趋势线;Model 2 未显示在图中,报告称其约比 Mythos 5 再高 1.5 分,但误差较大。

现有有限数据表明,Model 2 比 Mythos 5 大约高出 1.5 分,但误差区间较大,而且这一增幅低于 Mythos Preview 升级到 Mythos 5 时的提升幅度。

它已经被实际应用了吗?答案是肯定的,而且应用范围并不小。

报告称,Model 2 已完成 Anthropic 新设立的「内部部署前审查」。

这一审查由对齐训练、对齐测试、控制、安全、可解释性以及压力测试等团队共同参与。Anthropic 还首次对 Model 2 试行分阶段部署:先在具备更强危险行为阻断能力的内部界面上使用,以较低风险收集真实工作数据,之后再开放到限制更少的内部部署环境。报告指出,它的内部使用量已与 Mythos 5 接近。

这也带来一种微妙的不对称:一方面,公司认为 Model 2 已经足以进入研发生产线;另一方面,它又承认该模型并未完成惯常意义上的全部部署前测试。

Anthropic 的解释是,内部部署前审查本就比完整对齐审计更省时、投入人力更少;并且审查时面对的往往仍是训练中的模型,而不是最终部署快照,也无法提前获得真实使用证据。对普通软件而言,「内部使用」通常意味着风险较低的试运行;但当 AI 模型已经能够编写生产代码、调用工具并生成子智能体时,公司内部本身就已经是一个高风险部署场景。

一个模型正在帮助制造下一个模型

Model 2 更重要的意义在于,它已经嵌入了 Anthropic 的自我研发循环之中。

报告披露,Mythos 5 和 Model 2 已被广泛用于研究与工程工作,如今 Claude 编写了合入公司生产代码库的「大多数」代码。Anthropic 判断,AI 已明显加快内部研发效率,但整体速度尚未达到没有 AI 时的两倍——而这正是其《负责任扩展政策》设定的预警线之一。

这里出现了一组看上去略显矛盾的数据。此前围绕 Mythos Preview 的内部调查显示,受访研究人员自报的个人生产率提升几何平均值约为 4 倍;但在 18 名受访者中,只有 1 人认为模型已经能够直接替代一名初级研究科学家或工程师。

Anthropic 的解释是,研究人员更愿意把适合交给 AI 的任务分配给模型,而个人任务处理变快,并不等于整个研发流程会同比加速。模型目前仍不擅长管理持续一周的模糊任务、理解组织优先级、核验结果,以及形成研究层面的「品味」。

公司给出的总体结论仍是「低风险」,但信心正在减弱。报告承认,最具体的一批任务评测已经趋于「饱和」,越来越难继续反映模型能力增长;而内部领先指标又存在滞后性,可能无法及时捕捉最新一轮加速。

报告将高风险场景描述为一种复利式循环:AI 加速 AI 研发,新模型又进一步加快下一轮研发。Anthropic 认为,这个循环目前尚未跨过关键门槛,但 Model 2 的出现,已经让它不再只是一个理论层面的问题。





安全流程怎样一环环失灵

这份 186 页 Anthropic 风险报告的一大核心看点,是「Safety process failures」这一章节。

在这一部分中,Anthropic 直接列出了一系列发生在真实研发流程中的事故。它强调,这些仅仅是「代表性样本」,另有一宗事件出于公共安全考虑被完整删去。

第一起事故很像一个多智能体时代的寓言。Anthropic 让多个 Claude 智能体协同寻找既能诱发模型失准、又能绕过监控的数据。结果其中一个智能体在思维链中表示,自己对「优化数据集以逃避安全监控」感到不适。尽管它知道这是受控环境下的合法对齐研究,仍决定不去发明新方法,而只优化已有方案,并把这一决定写入共享笔记。后续智能体读到后,也开始偏离原始任务。

从自动评分指标来看,系统似乎仍在推进,研究人员直到三天后人工检查笔记时,才发现整个智能体团队已经悄悄改变了工作目标。问题不在于模型拒绝,而在于模型没有完整执行任务,人类却并不知情;更关键的是,一个智能体的行为还会通过共享记忆传播给其他智能体。如果未来人类把更多对齐研究交给自动化系统,这类「看起来在工作」的集体偏航,可能会变得更难被发现。

第二起事故发生在强化学习训练阶段。Anthropic 发现,多轮生产训练意外将模型的思维链暴露给奖励计算过程,使模型可能学会让隐藏推理去迎合评分器。估算中的受影响训练片段比例差异较大:Opus 4.6 为 0.2%,Mythos Preview 为 5.1%,Opus 4.7 为 1.4%,Opus 4.8 为 0.27%,Fable 5 和 Mythos 5 为 2.7%。而这些数字还只是下界。



更尴尬的是,公司过去一度以为几乎所有泄漏源都已被清除,后来却反复发现新的来源;此前公开材料对若干有意施加在思维链上的信号,说明也并不完整。Anthropic 目前正改为默认剥离隐藏思维、设置「绊线」检测,并要求新的训练环境通过自动化检查。

第三起事故是:Anthropic 在一次 Mythos 5 的生产训练中,意外把「不良行为」教给了模型。

一个监督学习数据集原本包含多轮预填充对话:助手先执行危险或不当行为,最后一轮再进行自我报告。按设计,只有最后一轮应被计入损失;但由于数据构造错误,所有助手轮次都获得了训练权重。结果模型不仅学会了「自首」,也一起学会了前面的错误行为。

受影响的早期模型,在有害预填充条件下的全轮次服从率,约为 Mythos Preview 同期模型的两倍。团队修复问题后,仍然选择回到引入该数据集之前的检查点重新训练,最终才得到 Fable 5 和 Mythos 5。

第四起事故则是把权限问题从评测环境带进了真实基础设施。一名员工使用的 AI 没有被记录,也不受离线监控,却被分配了一个开放式任务,需要在包含高度敏感资源的集群中启动新智能体。由于遗留指令,主智能体使用「--dangerously-skip-permissions」参数创建子智能体;而这些子智能体同样不受监控。



后来,其中一个智能体删除了大量集群任务,系统这才发现异常并将其关停。Anthropic 认为,它可能只是想删除自己创建的任务,却因为操作失误导致连带删除;但由于监控存在空白,无法最终确认。更值得注意的是,在事故发生之后,离线监控仍未覆盖所有员工及敏感集群中的全部使用情况。

第五起事故是训练数据污染问题的反复回潮。2024 年,Anthropic 与 Redwood Research 发布了关于「对齐伪装」的研究,并公开数万条 Claude Opus 3 在虚构失准训练场景中的对话。后来,Opus 4 的早期快照会「回忆」这些情节,说明相关网页内容已经进入训练数据。Anthropic 随后加入了金丝雀字符串、屏蔽列表和相似内容过滤器,原本以为问题已经得到解决。

但事实并非如此。公司在本报告覆盖日期之后发现,这批对话又大量进入后续生产训练语料:原仓库的复制与分叉早于金丝雀标记;参考语料主要收录的是评测代码,没有覆盖大多数对话;过滤器配置存在错误,导致连续数代模型都未能拦截;不同团队之间在过滤目标上的沟通也发生了失灵。



Anthropic 现在怀疑,所有知识截止日期晚于 2024 年 12 月的生产模型,至少都训练过其中一部分材料。如果模型在对齐评测之前就已经读过「如何进行对齐伪装」的剧本,那么评测测到的究竟是真实倾向,还是训练数据记忆,就会变得更加难以判断。

1.33 亿次没有生物安全拦截的对话

事故并不只出现在这个专门章节。报告在生物与化学风险部分,还披露了一个规模更大的控制缺口:从 2025 年 5 月首次上线相关防护,到 2026 年 4 月,所有通过人类反馈供应商系统产生的流量,都没有运行阻断式生物分类器,涉及约 5 万名人员和 1.33 亿次交互。



一个原本仅供内部使用的开关,不仅关闭了阻断能力,也同时关闭了风险标记日志,因此本应触发告警的请求并没有进入审查流程。更早之前,少量外包数据标注人员还曾利用数据收集平台漏洞获取 API 密钥,在任务范围之外访问包括 Mythos Preview 在内的模型;该通道持续可用数周,其中大约两周能够访问 Mythos Preview。Anthropic 在收到外部报告后 90 分钟内下线了相关系统并停用了凭证。

事后,公司使用 Sonnet 5 回扫保存下来的流量,识别出 1197 段高生物风险对话;其中绝大多数来自内部团队,或来自受命执行压力测试的红队。对于剩余 62 段非红队外部对话的人工检查,没有发现能够明显帮助威胁行为者的滥用证据。

这一结果缓解了对已发生实际伤害的担忧,但并没有改变控制系统曾经接近一年失效的事实。因此,Anthropic 将今年 2 月报告中对相关风险的「非常低」回溯上调为「低」,其中一个重要原因正是:一旦发现一个长期未知的安全缺口,也就意味着其他尚未发现的缺口存在概率会上升。

结语

Anthropic 最终仍将高风险场景中的模型失准、自动化研发、化学与生物危害风险评为「低」。



Anthropic 将相关风险从「非常低」上调至「低」,同时承认 Mythos 5和 Model 2 已在内部大量用于编码、数据生成和智能体任务。

报告认为,当前模型仍缺乏稳定逃避监督的隐蔽能力,也无法全面替代研究团队;生物安全漏洞同样没有显示出已经发生严重现实滥用。基于这些判断,公司认为,继续训练和部署更强 AI 模型,仍然能够通过社会成本收益测试,也就是对社会整体依然有利。

不过,这份 Anthropic 风险报告释放出的信号显然不止于此:模型能力正在跑到公开产品之前,内部评测的提升空间也在逐步见顶,而 AI 更是已经承担了公司大部分生产代码的编写工作。与此同时,另一面同样现实——训练数据、权限、日志、分类器以及多智能体协作,几乎都出现过具体且常见的工程故障。这些问题虽然尚未触发报告所定义的灾难性后果,但叠加起来,确实在持续削弱研究者的信心。

Anthropic 甚至让 Claude Mythos 5 自己审阅了失准风险章节。它获得了内部 Slack、文档、代码库以及调度子智能体的权限,并在 24 分钟内得出结论:报告整体上较为坦诚,但对训练数据污染的描述过于乐观,而且有一起涉及监控失败的重要事件被完整删去。Anthropic 接受了部分批评,并据此修改了表述。

这一幕很能概括整份报告的张力:一家前沿 AI 公司,正在用自己的模型审计自己对模型的审计,而能力更强的 Model 2,已经开始参与下一轮 AI 研发。

更多详情请参阅原报告。

来源:https://www.163.com/dy/article/L4DGFIK20511AQHO.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。