Claude Sonnet 4.5 正式发布,编程能力大幅提升,直逼 GPT-5,AI 模型竞赛再添变数。
核心亮点一目了然:第一,Sonnet 4.5 在编程基准测试上取得突破性进展;第二,新增了 VS Code 扩展和 Chrome 插件等实用工具;第三,两个全新的 API 功能为构建更强大的 AI Agent 奠定了基础。
就在 DeepSeek V3.2 发布后不久,北京时间 9 月 30 日凌晨,Anthropic 正式推出 Claude Sonnet 4.5,并直接打出“世界最强编程模型”的旗号。时间点选择如此精准,狙击意味不言而喻。谈到技术路线,不得不感慨——DeepSeek 在 DSA 稀疏注意力上的探索确实有其独到之处,与其在量化降智的路上越走越远,不如多关注竞争对手的务实方向。
回到 Sonnet 4.5 本身,一系列基准测试数据颇为亮眼。在 Terminal Bench 测试中,它跨入了 50% 分位;而在 Agentic tool use 的评测上,成绩从 71 分飙升至 98 分,实现了一次质的飞跃。数值逼近 GPT-5,难免让人浮想联翩——两者如此接近,难道是蒸馏了 GPT-5?另一个值得关注的维度是 Computer Use 能力,从 44 分跃升至 61.4 分。可惜 GPT-5 在该榜单的表现尚未公开,否则可以做一个更直观的横向对比。
Claude Code 也迎来了升级换代,新增的 VS Code 扩展支持通过检查点功能进行版本回退。在此背景下,GitHub 推出的 Copilot CLI 命令行工具反倒显得有些令人困惑——行业方向究竟在哪里?
功能层面,Claude 现在可以基于代码分析数据来创建文件和可视化内容,实用性进一步增强。Chrome 扩展插件也正式向所有用户开放。在演示场景中,Claude 已能控制浏览器自动发送邮件、编辑 Google Docs,这些以前需要人工操作的日常任务正在快速实现自动化。
在 Agent 构建方面,两个新的 API 功能值得高度关注——它们能有效降低频繁触及上下文限制的困扰。一个是上下文编辑功能,可以自动清理过时的上下文信息;另一个是记忆工具,专门用来存储和检索上下文窗口之外的关键数据。这意味着 Agent 可以拥有更长的“工作记忆”。
此外,Anthropic 还推出了一个临时研究预览版——Imagine With Claude,不过该功能目前仅供 Max 用户使用。
价格方面维持不变,没有调整。回看历史,DeepSeek R1 发布时,Anthropic CEO 的态度可谓针锋相对,如今 Sonnet 4.5 的发布时间点选择,狙击意图已经非常明显。不过话说回来,DeepSeek 这次只是放出了一个实验版本,就已经让对手如此紧张——这本身就是一种实力的证明。
