Claude Sonnet 4 此次升级堪称重大更新——百万 token 上下文容量,直接提升至原来的 5 倍。简单来说,现在可以一次性加载完整的代码库或数十篇论文,让 AI 代码分析能力迈上一个新台阶。
核心看点其实只有几个:
第一,支持 100 万 token 上下文,这是与 Gemini 对标的节奏;第二,应用场景瞬间拓宽,大规模代码分析、文档综合、智能体构建都成为现实;第三,在可靠性和实用性方面,Claude 的积累确实有优势,不过价格也相应提升。

价格方面也做了相应调整。超过 200K token 的部分按新标准计价:输入 15 美元/百万 token(上涨 5 倍),输出 22.5 美元/百万 token(上涨 1.5 倍)。需要留意的是,目前最强的 Opus 模型尚未享受这项待遇。
不过,该功能仍处于 Beta 阶段,想使用的话有几个门槛和限制:
- 使用门槛:必须是 Tier 4 的 API 用户,即至少购买过 400 美元的 API 额度。Pro/Max 订阅用户暂时无法使用。
- 可用平台:目前只能在 Anthropic API 和亚马逊 Bedrock 上使用,谷歌 Vertex AI 会在稍后跟进。
- API 请求:必须添加 `context-1m-2025-08-07` 这个 beta 头。
- 多模态注意:如果图片或 PDF 文件过多,可能会超出请求大小限制。
- 速率限制:有用户反馈,基础用户每分钟 token 总量仅为 200 万,这意味着 100 万上下文的请求,一分钟最多只能发送两次。
百万上下文到底有多大?换算一下,大约相当于 75 万个单词,或 7.5 万行代码。这意味着 AI 能够理解整个项目结构,跨文件追踪问题,解读长篇需求,完全不需要来回切换上下文。
Anthropic 专门提出了一个概念叫“有效上下文”,即模型实际能理解的部分,而不仅仅是机械存储。这对长时间运行的 AI 智能体来说至关重要,能有效减少偏离方向和返工的情况。
对比
- 市场格局:GPT-4o 是 128K,Gemini 1.5 Pro 是 1M(可扩展至 2M),Llama 3 有传闻称能达到 2M。
- Anthropic 的卖点:不只是上下文长,更强调 1M 上下文下的可靠性、实用的定价,以及在大代码库和长周期智能体场景中的适用性。
- 价格对比:Gemini Pro 和 Flash 确实便宜很多。Gemini 1.5 Pro 超过 128K token 后为 7 美元/百万 token,比 Claude 便宜不止一点。
- 实测效果:有测试发现,Sonnet 3.5 在文本分析上比 Gemini 更快,幻觉也更少。但如果细分到代码分析,Gemini 在长上下文中找细节的能力反而更强。
- 提示词策略:也有人担心,上下文这么长,提示词策略也得跟着调整,否则效果可能适得其反。
更长的上下文让 Claude 进入了更广泛、数据密集型的应用领域。
在大规模代码分析方面,开发者现在可以将整个代码库加载进去,让 Claude 理解项目架构、识别依赖关系,并给出系统级建议。
在文档综合方面,模型可以处理法律合同、研究论文这类海量文档,在完整的上下文中进行分析。
在智能体构建方面,模型可以在数百次工具调用和多步工作流中保持上下文连贯,不掉线。
已经有客户开始使用起来。Bolt.new 的 CEO Eric Simons 提到,Sonnet 3.5 在他们的代码生成工作流中一直表现优于其他模型,百万上下文后,处理更大项目的能力就更彻底了。
如果想在 Claude Code 里用上 Sonnet 3.5 的 100 万上下文,有一个小技巧:用 `/model sonnet-3.5-20240620-1m` 这个命令就能切换。
不过,这招需要满足几个前提:
- 只支持 API 认证:必须使用自己的 API key,Pro/Max 订阅不行。
- 功能还没完全跟上:有用户发现,虽然上下文窗口大了,但 Claude Code 仍然读不了超过 200K token 的文件。
