游乐游手机版
首页/AI教程/文章详情

Claude Opus5 便宜稳定的最强AGI

时间:2026-07-25 14:37
近日ClaudeOpus5发布,在Agent任务、自主执行和复杂推理方面领先,终端智能编程准确率达43 3%,新问题解决基准ARC-AGI-3上准确率达30 2%,成本低且性价比极高,安全性表现优异,综合实力突出,在多项基准测试中均取得最优成绩,是当前最强模型。

Kimi K3 的出色表现令人瞩目,这对 K3 与 Claude 的用户而言无疑是重大利好。紧随其后,Claude Opus 5 也正式发布。

尽管 K3 实力强劲,但业界普遍认为 Claude 在全面性、稳定性及自主性方面更胜一筹。

今日,Claude Opus 5 正式亮相,其开场白这样写道:

面对这类产品介绍,通常只需把握第一句话的核心即可。

一个真正的主力模型,应当具备深思熟虑、主动决策以及相对较低的价格等特质。

稳定可靠、极少出错、不犯低级错误,这才是高性价比的真正体现。

1、基准数据

在了解核心要点后,我们再深入解析具体细节:

Opus 5 在绝大多数 Agent 类任务中占据领先优势,尤其在“自主执行任务”与“复杂推理”这两个维度表现突出。

其在多个关键指标上甚至超越了 Fable 5,这一结果多少令人意外。

Fable 5 曾被业界形容为“不敢发布的怪物”,然而 Opus 5 却轻松将其超越。

表格中的性能对比清晰直观,强弱差异一目了然。

下面我们逐一解读:

1、终端智能编程(Agentic terminal coding)——本次评测的核心指标。

这一项反映了模型在开发场景中的核心能力。

  • Opus 5:43.3%
  • Fable 5:33.7%
  • Opus 4.8:21.1%
  • GPT-5.6 Sol:34.4%

这组数据表明:

Opus 5 在类似 Claude Code 这类场景中提升巨大,能够更好地:

  • 深度理解大型代码库
  • 高效修改多个文件
  • 精准调试
  • 自主完成端到端开发任务

这恰好与 Anthropic 重点推进的技术方向相契合。

2、知识工作能力

GDVal-AA v2:

  • Opus 5:1861
  • Fable 5:1747
  • GPT-5.6 Sol:1736
  • Opus 4.8:1593

该指标代表:

模型在撰写报告、分析资料、处理复杂办公任务方面的能力显著提升。

3、新问题解决能力

ARC-AGI-3:

  • Opus 5:30.2%
  • Opus 4.8:1.5%
  • GPT-5.6 Sol:7.8%

这一项比较特殊,测试模型面对陌生规则、没有训练经验的问题。

Opus 5 提升非常明显。

4、Agent 搜索能力

BrowseComp:

  • Opus 5:90.8%
  • GPT-5.6 Sol:90.4%
  • Fable 5:87.4%

说明:

联网搜索、信息整理能力已经接近顶级水平。

5、电脑操作(Computer Use)

OSWorld 2.0:

  • Opus 5:70.6%
  • Fable 5:66.1%
  • GPT-5.6 Sol:62.6%
  • Opus 4.8:55.7%

表示:

操作真实电脑环境,比如:

  • 点击界面
  • 使用软件
  • 完成流程

Opus 5 有明显优势。

2、每个任务成本

还有一个有意思的点:Claude 也开始谈性价比了!

它们推特的第三楼是这么说的:

他们给出了四种使用场景下的任务消耗情况图:

这让人意外:Anthropic 用了四张图来展示 Opus 5.0 的性价比(竞争真是美妙)。

从这四个图来看,Opus 5.0 实现了在相同价格下性能更高,相同性能下价格更低。

这四个图分别讲的是:

1、电脑操作任务

测试 AI 能不能像人一样操作电脑完成事情。

例如:

  • 打开软件
  • 点击按钮
  • 填表
  • 修改文档
  • 使用网页应用
  • 完成一套办公流程

2、企业业务流程任务

测试 AI 能不能完成真实工作流程。

例如:

  • 处理客户请求
  • 分析业务资料
  • 整理数据
  • 执行审批流程
  • 跨多个系统完成任务

3、多学科综合推理任务

测试 AI 的复杂知识和推理能力。

例如:

  • 数学问题
  • 科学问题
  • 医学问题
  • 法律问题
  • 工程问题
  • 跨领域综合分析

4、智能编程任务

测试 AI 能不能自主完成软件开发。

例如:

  • 阅读代码库
  • 找 Bug
  • 修改代码
  • 编写功能
  • 运行测试
  • 完成开发任务

3、通用人工智能

当“梁圣”在朝着 AGI 这个目标前进的时候,Anthropic 已经给出了阶段性的结果。

前面提到了一个叫 AGI3 的基准!

这是一个很少被提及的新基准,之所以很少被提及,是因为它太难了,对当前模型来说基本上得不了多少分。

这个基准是今年上半年刚提出的,最大的特点是不告诉你规则。

相当于给你一个完全陌生的环境,不告诉你规则、目标、有效操作和重要元素,全部需要 AI 自己去探索。

这个基准刚推出时,几乎所有模型都徘徊在个位数的百分比。

Sol 的 7.8% 已经算非常高了。

但 Opus 5 直接把它干到了 30%,这让人不禁担心 Anthropic 会不会一下子刷到 80%,大家又没得玩了。

虽然大家都知道 AGI 还没有实现,但在这个 AGI3 基准上,它已经是最强的存在了。

4、不对齐行为

除了基准领先和性价比高,Claude 还强调了另一点:不对齐行为(越低越好)。

这个图主要表明,Opus 5 是 Claude 家族里最不容易出现危险、欺骗、鲁莽行为的模型。

这种数据不太适合放在第一个展示,但事实上这才是最重要的点。

5、安全防御

另外还强调了网络安全方面的:

这个图展示了两方面的能力:左图是发现漏洞的能力,右图是漏洞的利用能力。

也就是说,Opus 5.0 的防御能力已经和 Mythos 5 差不多了,只是在攻击力上差很多。

就是给了你最强的盾,而矛还在少数人手里。

这也不是坏事,至少人家打过来的时候,还能扛一下。

作为五代模型,现在推出什么功能都不会太新鲜了。

现在的模型比拼的是生态能力和实战能力。

别看 Opus 系列相对比较贵,但它真正完成任务的成本其实比较低。现在官方也用数据来证明单任务成本。

再者,Opus 总是能以非常专业的视角,帮你做最好的规划。开头也说了,它是一个深思熟虑的主动型模型。

“主动”这个词可能很多人没有体会,但实际使用中,它总是能想得更多、更全,做得更好。它绝对不是那种单纯执行任务的模型,而是会按最优路径来完成任务的模型。

就是那种你一个眼神,它心领神会,然后做得很好。

这也就是为什么在众多模型中,实际使用的只有 Opus,从 4.6 到 4.7 到 4.8,再到 5.0。

这次 Opus 5.0 的发布时机也很有意思,居然是在星期五,多少还是有点危机感,不过这是好事。

国产模型继续加油!你们越强大,对全行业越有利。

来源:https://juejin.cn/post/7665983042769322011
上一篇基于多轮对话生成架构图的Agent设计实践方法 下一篇从工作流到智能体:Anthropic与OpenAI的Agent指南解读与思考
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
TalkVisions实时视频翻译应用,消除语言障碍
AI教程 · 2026-07-25

TalkVisions实时视频翻译应用,消除语言障碍

TalkVisions是一款实时视频翻译应用,能将视频中的口语实时转录为文本并翻译成用户所选语言,以字幕形式叠加在画面上,支持多语言、低延迟,还可保存录制视频,有效消除跨语言沟通障碍。

AI驱动的日历管理工具Ipso
AI教程 · 2026-07-25

AI驱动的日历管理工具Ipso

IpsoAI是一款专为专业人士及助手打造的AI日历管理工具,能够自动协调多方日程、智能草拟邮件,并通过快速安排会议、提供智能建议及自动化工作流程,显著减少琐碎操作,帮助用户高效管理时间、提升工作效率。

Spectate企业级专业高效监控与事故管理一体化平台
AI教程 · 2026-07-25

Spectate企业级专业高效监控与事故管理一体化平台

Spectate是一款高效监控和事故管理工具,能在30秒内检测故障并推送告警。它支持Slack、PagerDuty等主流集成,提供自定义状态页面和全球性能监控。系统自动更新状态并推送修复建议,帮助团队减少沟通成本,快速解决问题。

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4
AI教程 · 2026-07-25

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4

通义千问2 5大模型发布,多项能力宣称赶超GPT-4,中文语境下文本理解、生成、知识问答等表现优异。相比2 1版本,理解提升9%、逻辑推理提升16%、指令遵循提升19%。开源1100亿参数模型超越Llama-3-70B,获评开源最强。已服务超9万家企业,与小米、微博等达成合作。

万知个人AI工作站:一站式智能阅读创作分享平台
AI教程 · 2026-07-25

万知个人AI工作站:一站式智能阅读创作分享平台

万知是集成多种AI能力的个人工作站,支持自然语言交互、文档快速阅读与摘要生成、PPT自动设计与优化,覆盖学术研究、商务报告、写作辅助及日常问答等场景,全方位提升工作效率。