游乐游手机版
首页/AI教程/文章详情

GPT-5.6 Sol在ARC-AGI-3分数近三倍增长的原因解析:Agent评测需记录完整运行合同

时间:2026-08-14 20:38
GPT-5 6 Sol 的 ARC-AGI-3 分数为何接近翻三倍:Agent 评测必须记录完整运行合同摘要同样是 GPT-5 6 Sol,同样是 ARC-AGI-3 Public set:使用官方 Harness 跑出的成绩是 13 3%,而启用 retained reasoning 与 comp

GPT-5.6 Sol 的 ARC-AGI-3 分数为何接近翻三倍:Agent 评测必须记录完整运行合同

摘要

同样是 GPT-5.6 Sol,同样是 ARC-AGI-3 Public set:使用官方 Harness 跑出的成绩是 13.3%,而启用 retained reasoning 与 compaction 的 Responses API Harness 则达到 38.3%,同时输出 Token 还减少了约六倍。如果把这个现象简单理解为“两个开关把模型能力提升了三倍”,其实会误判问题本质。真正发生变化的,并不是模型突然更聪明了,而是 Agent 的运行系统被重新设计:推理状态能否连续保留、超长上下文如何压缩整理、任务会在哪一层被重置,以及预算与环境怎样共同约束模型。接下来,本文会先厘清 13.3%、38.3% 与 7.78% 这三组数字各自对应的统计口径,再拆解两层失忆、RHAE 评分机制与公开消融中的空白,最后给出四组可辨识复现实验、双轨报告规范,以及一份可直接复用的 Agent Eval Contract。

关键词

ARC-AGI-3、Agent Eval、Harness、Responses API、Retained Reasoning、Compaction

目录

  • 同一个模型,为什么会出现两个完全不同的分数
  • 先把 13.3%、38.3% 与 7.78% 放回正确位置
  • ARC-AGI-3 为什么特别依赖状态连续性
  • 官方 Harness 的两层失忆
  • retained reasoning 与 compaction 各自解决什么
  • Token 少六倍,为什么不会自动把分数抬高
  • 两项设置没有公开独立消融
  • 怎样设计一组可辨识的复现实验
  • 通用 Harness 与生产 Harness 应双轨报告
  • Agent Eval Contract:模型名只是一个字段
  • FAQ

同一个模型,为什么会出现两个完全不同的分数

OpenAI 在 2026 年 7 月公布了一组非常容易被误读的数据结果:

  • GPT-5.6 Sol + ARC 官方 Harness:Public set 13.3%;
  • GPT-5.6 Sol + Responses API Harness + retained reasoning + compaction:同一 Public set 38.3%;
  • 后一种运行方式的输出 Token 约减少六倍。1

模型名称没有变化,公开任务集也没有变化,最终成绩却从 13.3% 跃升到 38.3%。最容易吸引眼球的说法,往往是“两个设置让模型能力接近翻了三倍”,但这种表述把系统层面的结果误压缩成了模型本身的属性。

更准确的解释是:旧运行系统会在每一步持续破坏模型刚刚形成的工作状态,而新运行系统则尽可能避免这种破坏。对于交互式 Agent 来说,Harness 不只是输入输出的中间胶水,它还决定模型能看到哪些信息、能保留哪些记忆、何时会被清空、怎样进行压缩、如何重试,以及可消耗多少动作、Token、时间与成本。

因此,“GPT-5.6 Sol 得了多少分”并不是完整结论。更完整的描述至少应该写成:

这张官方图比单看两个分数端点更关键:它同时展示了 Low、Medium、High、Xhigh 与 Max reasoning effort。随着推理预算逐步提高,两种 Harness 并不是沿着同一条效率曲线前进。官方 Harness 在 Max 时每局平均输出约 290 万 Token,得分 13.3%;而保留 reasoning 并启用 compaction 的 Harness 只用约 48.5 万 Token,就达到了 38.3%。1

因此,变化并不只是“少花 Token 获得同样结果”,而是整条质量—资源前沿发生了明显位移。但图表本身仍只能证明两套组合系统之间存在差异,不能直接把收益分别归因给 retained reasoning 或 compaction 某一项设置。

先把 13.3%、38.3% 与 7.78% 放回正确位置

这三个数字来自两个不同任务口径,不能直接串成一条“能力提升曲线”。

数字任务集合运行与发布方正确含义
13.3%PublicOpenAI 文章中的官方 Harness 基线同一 Public set 的参考对照端点
38.3%PublicOpenAI 自有 Responses API Harnessretained reasoning + compaction 的组合结果
7.78%Semi-PrivateARC Prize Verified 页面GPT-5.6 Sol Max 当前 Verified 成绩

ARC Prize 的 GPT-5.6 页面同时列出了 Public 13.33% 与 Semi-Private 7.78%。2 Semi-Private 用于 Verified frontier 测试,数据集与验证流程都不同于 Public。ARC 的政策页也明确强调,Verified frontier 测试通常采用单次运行,并要求外部模型 API 使用 Zero Data Retention。3

所以,不能写成“7.78% 提升到 38.3%”,也不能用 Public 上的 38.3% 去推算 Semi-Private 的可能成绩。ARC 提到 Public demo 整体上通常被认为更难,并用绝对差 ±15 个百分点描述数据集层面的良好一致性,但这并不是模型层面的换算公式。3

这是本文的第一条评测纪律:

ARC-AGI-3 为什么特别依赖状态连续性

ARC-AGI-3 并不是传统的静态问答任务。Agent 面对的是一组没有说明书的二维交互环境,需要通过动作观察变化,逐步推断对象、规则、目标与解题策略。ARC Prize 公布的完整系列包含 135 个环境,其中 25 个被用作 Public demo;人类数据则包含 458 名参与者和 342 条逐步回放。4

在这类任务中,正确答案并不直接存在于初始输入里。Agent 必须不断构建、验证并修正自己的世界模型:

  1. 观察一个场景,提出假设;
  2. 执行动作,读取环境反馈;
  3. 判断假设是被支持还是被否定;
  4. 保留有效规则与失败证据;
  5. 在后续关卡复用已经学到的结构。

一次动作本身只是一条操作记录。真正有价值的是“为什么执行这个动作、验证了什么、排除了什么、接下来准备做什么”。如果 Harness 只保留动作日志,却丢掉这些工作状态,模型每一轮都不得不从历史记录里重新反推自己的计划。

官方视频给出了静态分数之外的过程证据:当两侧累计输出 Token 都在约 9.6 万时,官方 Harness 仍停在 1/6,Responses API Harness 已推进到 4/6;约 10.1 万 Token 时,右侧继续推进到 5/6,而左侧仍然停留在 1/6。1 这不能替代正式消融实验,但足以排除一种过度简化的理解——差异并不是只在最终计分时才突然出现,而是在连续探索过程中逐步累积形成的。

官方 Harness 的两层失忆

OpenAI 对运行轨迹的分析指出,官方 Harness 存在两种会破坏长期学习的行为。1

第一层:每次环境动作之后,private reasoning 会被丢弃。

模型可能仍然看得到“刚才向左移动”这类表层操作,却失去了“向左是为了验证蓝色区域是否具有传送属性,结果否定了假设 A”这样的内部工作状态。下一轮不是在既有推理上继续,而是重新定向。

第二层:当历史增长到 175,000 字符后,最旧消息会被滚动删除。

此时丢失的不只是“为什么这么做”,还包括“早期做过什么、观察到什么”。两种失忆叠加之后,模型就容易反复识别同一对象、重复验证已经失败的路线,甚至在后期关卡里丢掉前期建立的关键规则。

这也解释了为什么状态策略会同时影响质量与资源消耗:重复定向会产生更多 Token,也常常伴随更多无效环境动作。但这依然只是机制上合理的解释,还不能视作已经完成的因果拆解。OpenAI 并没有公开逐游戏动作数、中介分析,以及两项设置的完整消融数据。

retained reasoning 与 compaction 各自解决什么

OpenAI 对 Harness 进行了底层重构,核心变化是引入 Responses API。这一改动不仅让推理过程与行动指令形成更连续的循环,更重要的是,它借助 previous response ID 实现了 GPT-5.6 推理状态的有效延续。这意味着模型在后续采样中,能够继续利用并处理先前生成的 opaque reasoning items,从而打破过去的状态割裂,形成更平滑的链式推理流程。

这里需要先排除两个常见误解。

第一,retained reasoning 不等于开发者可以读取隐藏思维链。OpenAI 明确说明,raw chain-of-thought 不会直接暴露;reasoning item 由系统内部保留,客户端获得的是 response ID、opaque item、加密内容或可选摘要。56

第二,状态延续也不等于“免费上下文”。即便使用 previous_response_id,链路中的先前输入 Token 仍然会作为输入 Token 计费。7

retained reasoning 解决的是跨工具调用、跨轮次的认知连续性问题;但它并不能解决历史无限膨胀的问题。compaction 的作用,则是在接近上下文阈值时,把关键先前状态与推理压缩成更少 Token 的 opaque item。服务端压缩既可以通过 compact_threshold 自动触发,也可以显式调用 standalone compact endpoint。8

compaction 并不是无损归档。官方只说明它会携带 key prior state and reasoning,并没有承诺每一条消息、每个数字、每个顺序与每份证据都能逐字恢复。standalone compact 的输出还可能保留原始 items,下一轮应原样使用完整输出,不能由开发者自行再次裁剪。8

第二段官方动画把这种差异直观画成了时间序列:左侧上下文顶部出现红色 dropped 区域,旧消息被直接删除;右侧则保留 reasoning,并用紫色 compaction item 携带压缩后的先前状态。两组关键帧还显示,右侧每次动作的输出规模约为 852—1,100 Token,左侧约为 2,600—3,000 Token。1 这与“减少重复定向”的解释方向一致,但仍应被视为机制可视化,而不是逐项独立的因果证明。

因此,在真实生产系统中,不应把 opaque compaction 当成唯一可信事实源。目标、权限、已确认事实、信息来源、工具结果与审批记录,仍然应该存放在外部 canonical state 或事件日志中。

Token 少六倍,为什么不会自动把分数抬高

ARC-AGI-3 使用 RHAE(Relative Human Action Efficiency)来衡量完成度以及相对人类动作效率。只有那些真正改变环境状态的离散交互才会计入 action;内部推理、工具调用以及不改变环境的重试,都不计入环境动作。9

完成某一关后的核心公式是:

level_score = (human_baseline_actions / ai_actions)^2

单关得分上限为 1.15,后期关卡权重更高,如果未完成后续关卡,还会限制整局游戏总分。9

输出 Token 并不在公式中。因此:

  • Token 减少,但环境动作与完成关卡数量不变,RHAE 不变;
  • Token 减少,却导致模型思考不足、环境动作增加,RHAE 反而下降;
  • Token 增加,但换来了更少环境动作和更多关卡完成,RHAE 可能上升;
  • Harness 即使执行了大量内部工具调用,只要没有改变环境状态,RHAE 也不会直接惩罚这些成本。

两项指标可以同时改善,但只能通过一条间接路径来理解:

状态连续性提高→ 重复定向与重复探索减少→ 输出 Token 和无效环境动作都可能减少→ 完成更多关卡或用更少动作完成→ RHAE 上升

RHAE 的平方项会放大动作效率差异:如果 AI 动作数翻倍,单关得分不是减半,而是下降到四分之一。后期关卡加权又会进一步放大长期状态连续性的价值。

但在缺少逐游戏动作、关卡完成情况与 Token 轨迹的前提下,我们仍不能断言这条路径解释了全部 25 个百分点的差异。

两项设置没有公开独立消融

OpenAI 公开展示的是两个端点:

  • G00:官方 Harness,13.3%;
  • G11:retained reasoning + compaction,38.3%。

文章并没有公开:

  • retained reasoning 开、compaction 关;
  • retained reasoning 关、compaction 开;
  • 各组逐游戏成绩、动作数、Token 与方差;
  • 两项设置之外是否还存在其他实现差异。

更关键的是,native compaction item 本身就可能携带 prior state and reasoning。8 即使表面上关闭了 all_turns,只要系统仍然回传 native compaction item,就不能自动证明跨窗口 reasoning 已经被彻底排除。

所以,retained reasoning 与 native compaction 并不是天然正交的两个布尔开关。直接画一个 2×2 表格并给每一格命名,并不代表实验设计已经具备可辨识性。

怎样设计一组可辨识的复现实验

一组更严谨、更诚实的主实验可以采用四组设计:

组跨调用推理长历史处理能回答的问题
G00丢弃滚动删除最旧完整 turn官方风格参考基线
G10保留不压缩,超窗即失败并分类在未超窗范围内 retained reasoning 是否有帮助
G01丢弃自定义、可见、结构化压缩保留显式任务状态是否优于直接删除
G11保留OpenAI native compaction产品推荐组合的系统效果

G01 并不是 native compaction 的“纯关闭 reasoning”版本。它应该采用可见 schema,例如:

confirmed_rules: []rejected_hypotheses: []current_goal: ""key_objects: []open_questions: []evidence_refs: []

这组测试要回答的是“显式状态压缩是否优于滚动删除”,而不是假装可以把 native compaction 中的隐藏 reasoning 完整剥离出来。

四组实验还必须固定以下关键条件:

  • 模型不可变快照、reasoning effort、最大输出;
  • API、SDK、Prompt、帧序列化与动作解析;
  • game ID 与 version、task manifest hash、评分版本;
  • 任务顺序、动作预算、Token/时间/成本预算;
  • 重试、超时、非法动作与 overflow 行为;
  • 数据保留、状态重置、重复次数和执行随机化。

指标至少应分成三层:

  1. 任务指标:RHAE、逐关完成情况、环境动作数;
  2. 资源指标:输入/输出/reasoning Token、模型调用、工具调用、重试、compaction 次数、延迟、成本;
  3. 状态质量:关键事实召回、重复失败动作、重新定向 Token、世界模型探针。

通用 Harness 与生产 Harness 应双轨报告

通用 Harness 与生产 Harness 回答的是两类不同问题。

Reference Harness 追求公开、最小化、跨供应商与固定预算,回答的是“在统一接口下,这个模型能做到什么”。它有利于公平比较,但也可能压制某些模型在训练时预期使用的原生状态机制。

Production-Aligned Harness 使用模型推荐 API、推理状态、工具与上下文管理,回答的是“在真实产品栈中,用户最终能获得什么”。它更接近实际可部署上限,但也会把供应商私有 API 与工程优化一起混入系统成绩。

更成熟的评测报告应当同时包含:

  1. Reference Harness Score;
  2. Production-Aligned Score;
  3. Resource Envelope:动作、Token、延迟、成本、重试、compaction;
  4. Run Contract Diff:两套运行合同到底改了哪些内容。

这样一来,研究者可以比较模型能力,工程团队也能评估产品上限,读者则不会把整套运行系统误当成模型本体。

Agent Eval Contract:模型名只是一个字段

ARC 的评分基线、单关上限以及多个游戏版本曾在 2026 年 4 月更新;游戏 ID 本身也同时包含稳定的 game name 与可变化的 version。1011 只写“ARC-AGI-3 + GPT-5.6 Sol”远远不足以复现结果。

下面是一份可裁剪、可落地的最低运行合同:

contract_version: agent-eval-contract/1.0benchmark:name: ARC-AGI-3split: publicscoring_method: RHAEscoring_version: exact-date-or-committask_manifest_hash: sha256game_ids_and_versions: []toolkit_commit: exactmodel:provider: openaipublic_name: gpt-5.6-solimmutable_snapshot: exact-if-a vailablereasoning_effort: maxmax_output_tokens: exactapi_and_prompt:endpoint: /v1/responsesapi_version: exactsdk_version: exactsystem_prompt_sha256: exactframe_serializer_version: exactaction_schema_sha256: exactstate_and_context:reasoning_context: all_turnshidden_reasoning_readable: falsereset_on_level: falsereset_on_game: truecompaction_mode: server-sidecompact_threshold: exactoverflow_beha vior: fail-and-classifybudget:max_environment_actions: exactmax_model_calls: exactretry_limit: exacttimeout_ms: exactcost_budget_usd: exactrun:repetitions: exactexecution_order: randomizedprovider_request_ids: []artifact_manifest_sha256: exactmetrics:rhae_total: nullrhae_per_game: {}levels_completed: 0environment_actions: 0model_calls: 0retries: 0input_tokens: 0output_tokens: 0compaction_count: 0latency_p95_ms: nulltotal_cost_usd: null

合同中还应绑定失败分类:推理重置、滚动截断遗忘、compaction 遗漏或失真、旧状态污染、上下文溢出、非法动作、重试风暴、预算耗尽、跨任务状态泄漏与异常值等。

最终真正需要比较的,不是一个孤立分数,而是一条完整系统前沿:质量、环境动作、Token、延迟、成本、可审计性与可移植性会如何随着运行合同变化而移动。

FAQ

38.3% 是否说明 GPT-5.6 Sol 的模型能力提高了近三倍?

不能这样下结论。模型名称虽然相同,但 Harness、状态管理与上下文策略已经不同。38.3% 只能说明可实现的系统表现出现了显著变化,并不等于模型权重本体被独立测量为提升三倍。

38.3% 是否是 ARC Prize Verified 成绩?

不是。它是 OpenAI 在 Public set 上使用自有 Harness 得到的实验结果。ARC Prize 当前页面列出的 Semi-Private Verified 成绩是 7.78%。2

输出 Token 少六倍是否直接导致 RHAE 上升?

不会直接导致。Token 并不进入 RHAE 公式;它只能通过减少无效环境动作,或帮助模型完成更多关卡,间接影响最终得分。

retained reasoning 会不会泄露模型的隐藏思维链?

按照官方机制,不会把 raw chain-of-thought 直接交给客户端。开发者接触到的是 response ID、opaque reasoning item、加密内容或可选摘要。56

所有 Agent 都应默认启用 retained reasoning 与 compaction 吗?

不应一概而论。短任务、要求样本严格独立的批量评测、强审计任务、需要跨供应商恢复,或状态污染风险较高的场景,都应单独评估。显式状态机、事件日志、pinned facts 或阶段性 checkpoint 往往会更合适。

结论

这次结果真正改变的,并不是某个 API 设置本身的流行度,而是 Agent 评测的责任边界。

模型名当然仍然重要,但它只是运行合同中的一个字段。只有同时记录 API、推理状态、上下文策略、环境与评分版本、预算、重试以及产物证据,评测分数才真正具备可复现、可比较与可归因的意义。

通用 Harness 提供共同坐标,生产 Harness 给出可部署上限,消融实验则负责解释二者之间的差异。三者缺一不可。

Footnotes

  1. OpenAI, How enabling two settings tripled our scores on the ARC-AGI-3 benchmark ↩ ↩2 ↩3 ↩4 ↩5

  2. ARC Prize, GPT-5.6 - ARC-AGI Results ↩ ↩2

  3. ARC Prize, Verified Testing Policy ↩ ↩2

  4. ARC Prize, Measuring Human Performance on ARC-AGI-3 ↩

  5. OpenAI Developers, Why we built the Responses API ↩ ↩2 ↩3

  6. OpenAI Developers, Reasoning models ↩ ↩2 ↩3

  7. OpenAI Developers, Conversation state ↩

  8. OpenAI Developers, Compaction ↩ ↩2 ↩3

  9. ARC Prize Docs, ARC-AGI-3 Scoring Methodology ↩ ↩2

  10. ARC Prize Docs, Toolkit Changelog ↩

  11. ARC Prize Docs, Game Schema ↩

来源:https://juejin.cn/post/7670487540566982666
上一篇阿里云前端技术周刊第十一期前端开发热点精选 下一篇Java面试进阶:ElasticSearch部署架构解析
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令
AI教程 · 2026-09-01

CAD零基础入门教程:坐标输入、图层管理与基础绘图命令

本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。

CAD从入门到项目交付:绘图、标注、图块与实战工作流
AI教程 · 2026-09-01

CAD从入门到项目交付:绘图、标注、图块与实战工作流

掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤
AI教程 · 2026-09-01

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤

本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。

Claude Code 文件修改前的权限模式配置与命令审批指南
AI教程 · 2026-09-01

Claude Code 文件修改前的权限模式配置与命令审批指南

本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。

Claude Code接入VS Code后先测扩展和终端命令
AI教程 · 2026-09-01

Claude Code接入VS Code后先测扩展和终端命令

在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。