Anthropic正式发布了Claude Opus 5,这款视觉语言模型在保持更低运行成本的同时,多项任务表现甚至超越了Claude Fable 5。以下是几个关键要点:



在推出Claude Fable 5之后,Anthropic旗下的Opus系列一度前景不明朗,仅作为高端模型的备选方案。如今,它以更强大的性能强势回归,成为一款适合日常使用、能力出众的主力模型。

最新消息
Anthropic正式发布Claude Opus 5,这是一款视觉语言模型,运行成本更低,在许多任务上的表现也优于Claude Fable 5。
输入/输出:输入支持文本和图片,最大可达100万token;输出为文本,最大128,000 token,处理速度52.8 token/秒
知识截止时间:2026年5月
特性:五档推理等级(low、medium、high、xhigh、max;默认high)、工具使用、从512 token起支持提示缓存、约为标准速度2.5倍的快速模式、无数据保留
性能:在Artificial Analysis的Intelligence Index中排名第一,获得61分;在ARC-AGI-3测试中也轻松领先,该测试衡量AI智能体在陌生交互环境中学习新规则的效率
可用性/价格:Claude Max订阅者默认模型(每月100-200美元),也是Claude Pro订阅者可用的最强模型(每月20美元);API价格为每100万输入/缓存输入/输出token $5/ $0.50/ $25;快速模式仅限Claude API,价格为每100万输入/缓存输入/输出token $10/ $1/ $50
未披露信息:参数量、架构、训练数据和训练方法
运作方式
关于Claude Opus 5的构建方式,Anthropic披露的信息相对有限,主要集中在训练和模型控制方面。
Anthropic使用公共和专有数据训练该模型,包括从公共网站收集的材料以及其他模型生成的数据,然后根据公司在一部宪章中定义的人类价值观进行微调。公司有意将网络安全相关任务排除在训练之外。
有趣的是,该模型在没有被明确要求的情况下,也更善于将任务委派给子智能体,并且具备更强的自我检查能力。开发者应避免沿用为早期模型编写的验证相关指令,因为这类指令会导致Claude Opus 5过度验证。
被标记为网络安全风险的交互会回退到Claude Opus 4.8,但这种情况的发生频率低于Claude Fable 5。一个探针会在每次请求时读取模型的内部激活状态,并将任何被标记的内容交给第二个模型,由其判断输入和输出。检查范围包括模型读取的一切内容,例如记忆、文件、搜索结果和连接的工具,其中任何一项都可能触发回退。Anthropic表示,像扫描源代码漏洞这类日常防御性工作,Claude Opus 5是允许执行的;但表面上属于进攻性的请求,例如生成漏洞利用代码或渗透攻击,则会触发回退。有关生物学、化学和生命科学的问题不会像Claude Fable 5那样回退,因为Anthropic认为Claude Opus 5在这些领域的风险更低。
性能测试
Claude Opus 5在许多基准测试中表现领先,且单次任务成本低于Claude Fable 5,但高于大多数其他模型。该模型优势最明显的测试,是在陌生环境中的学习能力测试。
在Artificial Analysis的Intelligence Index中,这一包含9项经济实用型任务评估的综合指标里,Claude Opus 5以max推理设置取得61分,略高于启用回退并使用max推理的Claude Fable 5(60分)、OpenAI的GPT-5.6 Sol以max推理设置的成绩(59分)以及其他所有模型。成本差距比能力差距更为显著:Claude Opus 5平均每项任务2.03美元,介于Claude Fable 5的每项任务2.75美元和GPT 5.6 Sol的每项任务1.54美元之间。Claude Opus 5的xhigh推理设置,在Artificial Analysis的Coding Agent Index上与GPT-5.6 Sol在max推理设置上并列第一(67分)。Claude Opus 5优于Claude Fable 5及所有其他模型的其他单项测试还包括GPTval-AA v2、AA-Briefcase(两者都衡量智能体式知识工作能力)以及MMMU-Pro(多模态推理能力)。
在ARC-AGI-3测试中,该测试将AI智能体放入它们从未玩过的游戏环境中,并评估它们学习规则的能力,Claude Opus 5以high推理设置取得了30.2%的成绩(运行成本2.07万美元),几乎是次优模型OpenAI的GPT-5.6 Sol在max推理设置上的成绩(7.8%,运行成本2.51万美元)的四倍。
Claude Opus 5以max推理设置在Terminal-Bench 3.0上名列前茅,该测试衡量模型完成业务工作流的能力,成功完成了43.5%的任务。它在Zapier的AutomationBench上也表现领先,该测试是Terminal-Bench的继任者,用于衡量AI智能体解决计算机自动化任务的能力,成功率为26.2%。
在CursorBench 3.2测试中,这是Cursor在其测试框架内对编程能力的评估,Claude Opus 5(70%,每项任务8.23美元)仅次于以max推理设置运行的Claude Fable 5(70.5%,每项任务17.32美元)。
新闻背后
7月22日,美国白宫科学顾问迈克尔·克拉齐奥斯表示,Moonshot AI通过蒸馏Claude Fable 5打造了Kimi K3——这款开源权重模型在Artificial Analysis的Intelligence Index中排名第四。美国财政部长斯科特·贝森特威胁将实施制裁。但专家指出,Claude Fable 5公开可用的时间仅有短短几周,根本不足以完成数据蒸馏、模型训练和发布。Laude Institute的研究员Braden Hancock公开表达了这一观点。
重要原因
Claude Opus 5解决了长期Claude用户对Fable 5的许多顾虑:例如,它对良性科学问题经常回退和拒答、无法包含在大多数订阅方案中、价格高昂,以及苛刻的30天数据保留政策。虽然在某些情况下Claude Fable 5仍然值得溢价:例如,Claude Opus 5更容易产生幻觉,事实回忆能力也更弱。而且目前的基准测试可能还没有完全捕捉两者之间的差异。但对大多数开发者的使用场景来说,这都是一次受欢迎的更新。
我们的思考
尽管新的Opus模型比Fable或Mythos更便宜,但仍然相当昂贵。其他实验室都在追求更快的速度和更低的成本,而Anthropic却朝着相反方向前进:打造更大、更慢、知识更丰富但也更昂贵的模型。该公司押注在网络安全、软件工程和文档生成等领域,客户会愿意支付溢价——在需要更快推理时,他们甚至可能愿意支付双倍费用。


