游乐游手机版
首页/AI热点日报/热点详情

Anthropic Opus 5发布 性能逼近Fable 5价格减半刷新ARC-AGI-3纪录

类型:热点整理2026-07-25
Anthropic发布ClaudeOpus5,性能接近Fable5但价格仅一半,刷新ARC-AGI-3纪录,得分约为第二名三倍。代码、科研测试达最高水平,具备自主解决问题能力。安全限制减少约85%,价格与Opus4 8持平。

7月25日,Anthropic正式发布了Opus系列的最新旗舰模型——Claude Opus 5。相比上一代Opus 4.8,性能有明显提升,但价格保持不变。这个策略很有意思:在AI模型价格战此起彼伏的当下,能维持原价同时提升性能,本身就是一个信号。

Anthropic Opus 5 发布:性能逼近 Fable 5 但价格砍半,刷新 ARC-AGI-3 纪录

Opus 5的定位非常明确——面向日常使用的高性能模型。按照Anthropic的说法,它在部分能力上已经接近更高规格的Claude Fable 5,但价格只有后者的一半左右。目前,Opus 5已经成为Claude Max服务的默认模型,同时也是Claude Pro用户能使用的最高能力模型。在多项代码、知识工作和科学研究测试中,它都达到了当前最高水平。

从性能提升来看,这次Opus 5的进步相当明显。在Frontier-Bench v0.1测试中,它不仅超越了其他模型,相比Opus 4.8,任务性能提升了一倍以上,而且每项任务的成本更低。这意味着什么?简单说,就是花更少的钱,做更多的事。

在CursorBench 3.2测试中,Opus 5在最高努力模式下的成绩,仅比Fable 5的峰值低0.5%,但单项任务成本约为后者的一半。这个差距可以说微乎其微,但成本优势却非常突出。更值得关注的是,在高、中高以及最高努力设置下,Opus 5在单位成本性能方面都超过了其他模型。换句话说,如果你追求性价比,Opus 5可能是目前最好的选择。

知识处理和问题解决能力方面,数据同样亮眼。在ARC-AGI 3测试中,Opus 5的得分约为第二名的3倍——这个成绩相当夸张,说明推理能力有了质的飞跃。在Zapier AutomationBench中,其通过率约为成本相近模型的1.5倍。OSWorld 2.0等其他评测中,也取得了较高成绩。

科研领域的提升,是这次发布的一个重点。相比Opus 4.8,Opus 5在结构生物学、有机化学、生物信息学等领域的表现都有明显进步。举个具体的例子:在有机化学任务中,比如根据光谱数据推断分子结构,Opus 5比Opus 4.8高出10.2个百分点;在预测蛋白质序列变化对功能影响的任务中,高出7.7个百分点。对科研人员来说,这些提升意味着更准确的分析和更高效的实验设计。

不过,更能体现模型能力的,其实是它在实际应用中的表现。Anthropic强调,Opus 5在验证自身结果和持续迭代修正方面能力更强。比如在一项测试中,模型需要根据机器零件图纸生成FreeCAD三维模型,但无法直接查看图纸内容。这种情况下,Opus 5编写了自己的计算机视觉流程,从原始像素中提取几何信息,并成功完成模型重建——这已经不是简单的“读懂指令”,而是主动解决问题的表现了。

另一个例子更有意思:Opus 5发现了一个开源软件包管理器中的实际漏洞,并且修复了社区补丁遗漏的问题。还有一位交易公司工程师,使用Opus 5在一次会话中构建了一个新交易所的数据接口,在缺少实时数据源验证的情况下,模型还创建了测试工具检查代码解析结果。这些案例说明,Opus 5已经具备了相当程度的自主性和实用性。

安全方面,Opus 5的策略做了调整。Anthropic表示,Opus 5的安全限制相比Fable 5更少,预计安全分类器触发次数会减少约85%。这意味着用户体验会更流畅,但也意味着模型在某些场景下的自由度更高。当然,对于高风险场景,限制依然存在。比如网络安全领域,模型可以帮助分析源代码中的漏洞,但会阻止基于二进制文件的漏洞扫描、渗透测试以及漏洞利用代码生成等操作。

特别值得注意的是,Opus 5并未经过专门的网络攻击任务训练,但随着整体能力提升,其漏洞发现能力有所增强。在OSS-Fuzz测试中,Opus 5与Mythos 5在漏洞发现方面表现接近,但在将漏洞转化为实际攻击工具方面,仍明显落后于Mythos 5。这个差距其实是一种刻意的设计——能力可以强,但边界必须清晰。

在生物领域,Opus 5延续了Opus 4.8的安全机制,目前成为Anthropic面向公众开放的能力最强科研模型。不过,Anthropic也坦承,Opus 5在长时间、自主执行科研任务方面仍存在限制,这类任务被认为可能带来更高风险。这种谨慎的态度,在当前的AI行业里其实并不多见。

再来说说价格。Claude Opus 5已经通过Anthropic各平台上线,输入价格为每百万词元5美元(约合33.9元软妹币),输出价格为每百万词元25美元(约合169.6元软妹币),与Opus 4.8保持一致。开发者可以通过Claude API调用claude-opus-5。

Anthropic还推出了Opus 5 Fast模式,运行速度约为默认模式的2.5倍,价格为基础价格的两倍。对于需要快速响应的场景,这个模式很实用。同时,Anthropic开放测试了两项新功能:Claude平台中的对话中途工具切换,以及API中的自动回退功能。自动回退功能允许用户在安全分类器拦截请求时,将任务自动转交给其他可用模型处理,避免直接返回错误信息——这对开发者来说,无疑是个贴心的设计。

最后需要提一句:Opus 5与此前Opus系列模型一样,面向普通用户开放时不设置数据保留要求。这一点在隐私敏感的当下,值得关注。

来源:https://www.ithome.com/0/981/398.htm

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。