2025年7月24日,Anthropic正式推出了Claude Opus 5。此次官方定位颇为有趣——并未追求成为体系内最强的旗舰级模型,而是更侧重于“日常高频调用场景下的能力密度”,用他们自己的话来说,是“以一半的推理成本,接近Claude Fable 5的前沿智能水平”。发布当天,Opus 5便在Anthropic全平台同步上线,同时成为Claude Max的默认模型,也是Claude Pro订阅用户当前可访问的最强模型。
从产品层级架构来看,Claude Opus 5位于Anthropic现有产品线中段偏上的位置。向上看,是Mythos层级的Claude Fable 5以及访问受限的Claude Mythos 5;向下看,则涵盖主打性价比的Sonnet 5和适用于轻量级场景的Haiku 4.5。Opus 5接替了Opus 4.8,成为这一层级的旗舰模型,其API模型ID为claude-opus-5。官方并未公开具体的参数规模与上下文窗口长度,在信息细节把控上颇为克制。
在技术性能方面,Anthropic公布了一组官方基准测试数据。在编码与知识工作评测(如Frontier-Bench和GDPval-AA)中,Opus 5创下新一轮测试新高,其在Frontier-Bench v0.1上的表现达到Opus 4.8的两倍以上,而单任务成本反而更低。在CursorBench 3.2的最高effort档位下,Opus 5的得分与Fable 5的峰值成绩相差不到0.5%,但单任务成本仅为后者的一半左右。在ARC-AGI 3这一考察陌生问题求解能力的基准上,官方表示其得分是次优模型的三倍。更值得关注的是计算机操作基准OSWorld 2.0,Opus 5以约三分之一的成本便超越了Fable 5的最佳成绩。科研方向的提升也被单独强调——在Anthropic所有生命科学评测中,Opus 5均优于Opus 4.8,其中在从光谱数据推断分子结构等有机化学任务上,内部基准得分高出10.2个百分点;在蛋白质序列变异的功能预测任务上,则高出7.7个百分点。当然,以上数据均为厂商自测结果,目前尚无第三方独立复现。
将视角拉远,这些能力提升实际上指向了一些非常具体的应用场景。软件工程团队可利用其进行跨文件的大规模代码重构以及疑难缺陷的根因定位——官方案例中,模型在一个开源包管理器的真实缺陷上,直接找出了社区补丁遗漏的边界情况。Agent开发者则可将其作为长链路自主任务的底层模型,在缺乏现成验证条件时,让模型自主构建测试方案。企业自动化团队能够借助它端到端地跑通业务流程,Zapier在AutomationBench上的反馈显示,模型完整执行了一套客户流失预防流程,包括标记风险账户、通知责任人、为留存团队生成摘要。专业知识工作者(如法律、金融、科研领域)也能借助其在数值推理、表格处理、文书批注等方面的改进,处理精度敏感的任务。
本次升级中最受关注的一点,是模型自我校验与迭代能力的增强。Anthropic给出的典型示例是一项Frontier-Bench任务:模型被要求根据一张机械零件图纸编写代码,将其重建为3D FreeCAD模型,但无法直接查看图纸。Opus 5的应对策略是自行编写一套计算机视觉管线,从原始像素中提取几何信息,然后完成整个零件的重建,且能够重复成功。在相同条件下,其他参与对比的模型经过五次尝试全部失败。多家早期客户的反馈也集中在效率而非峰值能力上。法律AI公司Harvey表示,Opus 5在较低推理档位即可达到Opus 4.8最高推理档的质量,平均token消耗降低约26%。应用开发平台Lovable则强调,该模型在内部评测中“运行间波动明显更小”,对他们而言,这种稳定性比分数本身更为重要。
安全与对齐是此次发布的另一条主线。Anthropic表示,在部署前的自动化行为审计中,Opus 5的整体失准行为评分为2.3,在其近期发布的模型中最低,欺骗性行为发生率也最低,最不容易被诱导至滥用场景。安全能力方面,官方称Opus 5并未针对网络安全任务进行专门训练,但随着通用能力的提升,其漏洞发现能力已接近Mythos 5,不过在将漏洞转化为可用攻击手段这一环节上,仍明显落后。相应的安全策略为:允许模型在源代码中发现漏洞,但阻断二进制漏洞扫描、渗透测试和漏洞利用生成。官方预计分类器的触发频率约为Fable 5的15%,在Claude.ai、Claude Code和Claude Cowork中,被标记的请求将默认回退到Opus 4.8。
在可用性与定价方面,Claude Opus 5的API定价为每百万输入token 5美元、每百万输出token 25美元,与Opus 4.8完全一致,大约是Fable 5的一半。模型还提供约2.5倍默认速度的Fast模式,在Claude Platform上按基础价格的两倍计费,在Claude Code中则通过用量额度使用。与之前的Opus模型一样,Opus 5在通用访问下不设数据保留要求。与模型同步发布的还有两项Beta功能:Claude Platform支持在会话中途变更可用工具,同时不使prompt缓存失效;API侧新增自动回退能力,被安全分类器标记的请求可自动路由至其他模型,而非直接被阻断。
整体来看,Claude Opus 5的发布折射出模型竞争重心的一次位移。当各家旗舰在绝对能力上的差距逐步收窄,单位成本内的有效产出正取代基准测试峰值,成为更受关注的衡量指标。Anthropic此次并未宣称推出了最聪明的模型——那个位置仍属于Fable 5——而是选择在价格不变的前提下将性能推至新高,并反复强调token效率与运行稳定性。对于高频调用的开发团队和企业用户而言,这类改进的实际价值可能高于榜单排名的变化。不过必须指出的是,公告中的对比数据目前全部来自厂商自测与早期客户反馈,真实表现仍有待更广泛的实际使用和第三方评测来检验。
