游乐游手机版
首页/AI热点日报/热点详情

Anthropic官方揭秘:3招上下文优化避免Agent性能暴跌

类型:热点整理2026-07-25
上下文工程作为提示词工程的演进,通过信息选择机制、上下文窗口管理和架构约束突破三大策略,解决智能体因上下文腐化导致的性能持续暴跌问题,实现高效可控的Agent构建。

本文深度解析Anthropic官方提出的“上下文工程”核心理念,帮助您从传统提示词工程思维跃迁至更高阶的上下文管理思路,并掌握三大核心优化策略——信息选择机制、上下文窗口管理以及架构约束突破,彻底解决智能体性能持续衰减的难题。

本文是对Anthropic官方发布的“上下文工程(context engineering)”文章的深度解读与中文翻译。从提示词工程拓展至上下文工程,并详细阐述上下文工程的具体构建方法。

一、引言

在提示词工程流行数年后,一个全新的概念应运而生:上下文工程(context engineering)。利用语言模型构建应用时,核心问题已从“如何为提示词选择恰当的词语”转变为“何种上下文配置最有可能引导模型产生期望的行为”

  • 上下文(Context):指大语言模型在运行时所能接触到的所有token集合。
  • 工程(engineering)问题:针对大语言模型的约束条件,优化这些token的使用方式(下文将详述为何需要约束)。

使用大语言模型需要站在上下文中思考:考虑模型在任何时刻可用的整体状态,以及该状态可能引发的行为模式。

本文将系统阐述上下文工程,提供一套构建可控、高效智能体的思维模型。

二、对比:上下文工程 vs. 提示词工程

Anthropic将上下文工程视为提示词工程的自然演进。

1. 提示词工程

  • 定义:编写和组织大语言模型指令的方法论
  • 关注点:如何设计有效的提示词,尤其是系统提示词
  • 适用场景:单次分类或文本生成任务

2. 上下文工程

  • 定义:在大语言模型推理过程中,选择并维护最优token集合的策略
  • 范围:涵盖提示词之外所有进入上下文的信息(系统指令、工具、MCP、外部数据、消息历史等)
  • 适用场景:多轮推理、长时间运行的智能体

3. 为何需要演进?

智能体在循环运行中会不断产生大量可能相关的数据,这些信息必须经过循环精炼。

上下文工程的核心:从持续演化的候选信息中,筛选出最适合放入有限上下文窗口的内容。

关键区别

  • 提示词工程:离散任务(一次性编写提示词)
  • 上下文工程:迭代过程(每次推理都需要决定向模型传递什么信息)

三、为什么上下文工程对构建智能体至关重要

核心问题:上下文腐化

大语言模型像人类一样,在某个节点会失去焦点或产生困惑。“大海捞针”式基准测试研究揭示了上下文腐化(context rot)现象:

  • 上下文窗口中的token数量增加
  • 模型准确回忆信息的能力随之下降

这一特性普遍存在于所有模型中。

根本原因:注意力预算有限

上下文是一种边际收益递减的有限资源。如同人类拥有有限的工作记忆容量,大语言模型在解析大量上下文时,会消耗其“注意力预算”:

  • 每个新token都会消耗一部分预算
  • 必须精心选择模型可用的token

架构约束

这种注意力稀缺源于大语言模型的架构限制。模型基于transformer架构

  • 每个token需要关注整个上下文中的每一个其他token
  • 导致n个token之间存在n²个成对关系

上下文长度增加 → 模型捕获成对关系的能力被稀释 → 上下文规模与注意力焦点之间产生张力

训练数据的限制

模型在训练过程中:

  • 接触大量短文本(如简短对话、短篇文章)
  • 接触的长文本相对较少(如长篇文档、长对话)

结果:

  • 模型擅长处理短上下文
  • 处理长上下文时能力受限
  • 难以准确记住距离较远的信息之间的关联

类比:就像学生平时主要练习短跑,偶尔跑一次马拉松,其马拉松成绩自然不如短跑表现突出。

扩大上下文窗口的局限

有人可能会想:直接扩大上下文窗口不就行了?

确实存在技术手段让模型处理更长的上下文(如位置编码插值技术),但需付出代价:

  • 效果:并非达到某个长度后突然完全失效(断崖式),而是随着长度增加,准确率逐步下降(渐进式)。
  • 具体表现:模型在较长上下文中仍能工作,但信息检索和长程推理的精度会降低;上下文越长,精度下降越明显。

类比:就像人的注意力——你可以同时关注10个屏幕,但记忆准确度会比只看1个屏幕低很多。

结论

这些现实因素意味着上下文工程对构建智能体至关重要。

即使技术进步允许更长的上下文,我们仍需精心筛选放入其中的信息。

四、上下文的构成

受限于有限的注意力预算,优秀的上下文工程意味着找到最小的有效token集合,以最大化期望结果出现的概率。下面概述这一原则在上下文不同组成部分中的实际应用。

1. 系统提示词

系统提示词应做到清晰、简洁、直接,并保持适度的抽象程度。

两种极端,一个平衡点

适度的抽象程度意味着在两种失败模式之间找到平衡:

  • ❌ 极端1:过度硬编码 – 在提示词中硬编码复杂、脆弱的逻辑,试图引出精确行为,但会创造脆弱性,维护成本随时间增加。
  • ❌ 极端2:过于模糊 – 提供笼统的高级指导,无法给大语言模型具体的输出信号,错误地假设共享上下文。
  • ✅ 平衡点:适度抽象 – 足够具体以引导行为,又足够灵活,为模型提供强有力的启发式指导。

组织建议

将提示词划分为不同部分:

  • 背景信息
  • 指令
  • ## Tool guidance 工具指导
  • ## Output description 输出描述

使用XML标签或Markdown标题来划分这些部分。

来源:https://www.53ai.com/news/LargeLanguageModel/2025100513687.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。