游乐游手机版
首页/AI热点日报/热点详情

OpenAI前成员创立的Anthropic发布Claude 3.7 Sonnet语言大模型

类型:热点整理2026-07-24
Claude3 7Sonnet是Anthropic推出的混合推理模型,内置标准与扩展两种思考模式。扩展模式下深度推理能力提升超10%,编程协作支持代码编辑与GitHub集成,SWE-bench测试创70 3%新高。安全优化使误拒绝减少45%,多模态与智能体能力亦显著增强。

Claude 3.7 Sonnet 近期在人工智能领域备受关注,官方将其定义为“全球首个具备双重模式的混合推理模型”——简而言之,该模型集合了两种不同的思考模式于一体。

在标准模式下,Claude 3.7 Sonnet 可视为 Claude 3.5 的增强版本,响应迅捷,适用于日常对话;而当切换至扩展思考模式(即推理模式)时,模型会启动深度逐步推理,在数学、物理、指令理解及编程等复杂任务中展现出卓越性能。可以将其理解为“Deepseek V3 与 R1 的结合体”。

编程能力在此次升级中达到了新高度。众多开发者反馈:“它更像是一个主动协作的编程伙伴,而非被动执行命令的工具。”对于产品经理而言,亲自定义需求并交由AI生成代码的时代已近在眼前。

功能特点

混合推理模式是本次升级的核心亮点。标准模式侧重快速响应,日常对话与简单任务几乎即时完成;而扩展思考模式则如同开启了“深度推理”功能,模型内部会进行多步自我反思,尤其适合数学、物理、逻辑推理和编程等硬核场景。在复杂任务处理能力方面,基准测试表现优异,例如SWE-bench Verified和TAU-bench测试均取得了出色成绩。

除推理能力外,代码协作体验也实现了实质性提升。该模型支持代码编辑、测试执行等开发流程,并能与GitHub集成,协助开发者修复Bug、开发新功能、完成全栈更新。此外,安全性方面亦进行了优化——相较前代版本,模型能更精准地区分恶意请求与正常请求,不必要的拒绝率降低了45%。

此外,值得关注的是:Claude 3.7 Sonnet 提供了免费版、专业版、团队版和企业版等多种订阅计划,用户可通过Anthropic API、Amazon Bedrock 以及 Google Cloud 的 Vertex AI 进行访问。在API模式下,用户可自定义思考的token数量,输出上限达128K token,灵活性极高。

性能表现

根据多项测试数据,扩展思考模式下的Claude 3.7 Sonnet相较上一代模型,整体推理能力提升超过10%。在SWE-bench Verified测试中,其取得了70.3%的高分,直接刷新了SOTA(State of the Art)记录。

多模态与智能体能力同样取得了实质性突破。在OSWorld测试中,模型能够通过虚拟鼠标点击和键盘按键独立完成任务;在Pokémon游戏测试中,借助扩展思考能力与智能体训练,获得了相应的徽章,表现远超早期版本。

值得关注的是测试时计算扩展(Scaling)的表现——模型在生成最终输出前,会执行多个连续推理步骤,持续投入计算资源。在数学问题求解中,准确率随思考Token数量的增加呈对数增长。通过采样多个独立思维过程并选取最优结果,模型性能得到了显著提升。

使用场景

在实际应用中,Claude 3.7 Sonnet 的适用场景极为广泛:从软件开发到数据科学,从学术研究到商业分析,几乎所有需要强推理能力与高效编程的领域均能发挥价值。具体而言,它可协助开发者快速生成代码、提升开发效率;支持复杂的数据分析与算法优化;提供强大的推理与信息获取能力,助力学术研究;同时也能处理复杂的商业数据与逻辑分析任务。

来源:https://www.faxianai.com/ai/11368.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。