Anthropic 这次的动作,值得深入探讨。他们正式发布了 Claude Opus 5——一款在“全面性”和“主动性”两个维度都下足功夫的新一代 AI 模型。其智能能力已经逼近自家顶级旗舰 Claude Fable 5,但使用成本却仅需一半。换句话说,你只需支付更少的费用,就能享受到接近天花板的性能表现。在编程开发、知识工作,甚至像 ARC-AGI 3 这种公认的“硬核”测试中,它都刷新了行业纪录。作为 Claude Max 的默认模型,它还配备了一个灵活的“努力程度设置”,让性价比控制变得非常直观。可以说,这是日常高效办公和软件工程领域的一个全新标杆。
核心要点
- 极致性价比:智能水平逼近旗舰模型 Claude Fable 5,但单次任务成本仅为其 50%。
- 编程与知识工作 SOTA:在 Frontier-Bench 和 ARC-AGI 3 等多项权威评估中刷新纪录,性能远超前代。
- 灵活成本控制:引入“努力程度设置”,允许用户根据需求在智能水平与 Token 消耗之间进行优化。
- 广泛应用场景:成为 Claude Max 的默认模型及 Claude Pro 的最强模型,擅长自动化任务与软件工程。
详细分析
什么叫极致性价比?看看数据就知道了。在 CursorBench 3.2 的评估中,Opus 5 在最高努力模式下的表现,与 Fable 5 的峰值差距不到 0.5%,但成本直接少了一半。对比它自己的前代 Opus 4.8,性能提升更是惊人——在 Frontier-Bench v0.1 上,它的表现直接翻了一番还多,而且单次任务成本反而更低。
衡量模型解决新颖问题能力的 ARC-AGI 3 测试,向来是检验逻辑推理硬实力的试金石。Opus 5 在这里的得分,是次优模型的三倍。这个差距,已经不能用“领先”来形容了,更像是直接跨了一个量级。在业务自动化方面,它在 Zapier AutomationBench 上的任务通过率,是同等成本下其他模型的 1.5 倍。更值得一提的是,即便是在最低努力设置下,它的任务完成度依然领先于竞品。这意味着,在处理端到端的业务流程时,它不仅有实力,而且很稳定。
Opus 5 的设计初衷,就是做一款“周全且主动”的日常工具。它在 OSWorld 2.0 计算机使用基准测试中,甚至超越了 Fable 5 的最佳纪录,同时通过更高效的运行机制降低了延迟。当然,在某些特定领域,比如网络安全任务上,它还是会逊于 Mythos 5。但在编程、知识处理和通用办公这些更广泛的场景里,它的全面表现,让它毫无疑问地成为了 Claude Max 用户的首选默认模型。
行业影响
Opus 5 的发布,释放了一个清晰信号:AI 行业正在进入“高智能、低成本”的普及化阶段。把接近顶级旗舰的性能下放到中端价位,Anthropic 正在重新定义大模型的商业竞争规则。尤其是它在 ARC-AGI 3 上的突破,暗示了模型在处理未知复杂任务上的巨大潜力。这不仅仅是技术指标的提升,更意味着软件工程自动化和企业级工作流自动化,将迎来一个更成熟的阶段。而那个灵活的“努力程度设置”,则给开发者提供了一把精细的成本控制钥匙,让 AI 的大规模落地变得更具可行性。
常见问题
问题 1:Claude Opus 5 与 Claude Fable 5 相比如何?
Opus 5 的智能水平非常接近 Fable 5(在某些测试中差距不足 0.5%),但其使用成本仅为 Fable 5 的一半,具有极高的性价比。
问题 2:Opus 5 在哪些领域表现最强?
它在编程(Frontier-Bench)、复杂问题解决(ARC-AGI 3)和业务自动化(Zapier AutomationBench)方面表现尤为出色,均达到了行业领先水平。
问题 3:用户如何控制 Opus 5 的运行成本?
Opus 5 支持“努力程度设置”(effort setting),用户可以根据任务需求选择更高的智能水平,或选择更低的设置以节省 Token 并获得更快的响应速度。
