游乐游手机版
首页/AI热点日报/热点详情

DeepSeek V4 Flash不换模型凭自验证反超Fable 5解析

类型:热点整理2026-08-20
DeepSeek V4 Flash 借助「自验证」机制,在 Terminal-Bench 2 1 上的任务成功率提升至 88%,超过了 Fable 5,同时单任务成本仅约 0 11 美元,不到后者的十分之一。核心内容:1 自验证实现方式:针对每个任务采样 5 条候选轨迹,再由 DeepSeek V

DeepSeek V4 Flash 借助「自验证」机制,在 Terminal-Bench 2.1 上的任务成功率提升至 88%,超过了 Fable 5,同时单任务成本仅约 0.11 美元,不到后者的十分之一。
核心内容:
1. 自验证实现方式:针对每个任务采样 5 条候选轨迹,再由 DeepSeek V4 Flash 模型自身完成验证与筛选。
2. 实验结果:整体成功率达到 88%,高于 Fable 5(单任务成本约 1.3 美元),而 DeepSeek V4 Flash 的单任务成本仅约 0.11 美元。
3. 技术来源:该方法基于斯坦福、UC Berkeley 与 NVIDIA Research 团队提出的 LLM-as-a-Verifier 框架,通过更细粒度的验证和排序,从 Agent 多次尝试中筛选出更可靠的结果。该框架不仅适用于测试时扩展,验证信号还可进一步用于进度跟踪与强化学习优化。

DeepSeek V4 Flash不换模型,只靠「自验证」反超Fable 5


通过自验证策略,DeepSeek 将任务成功率提升到接近甚至超过 Fable 5 的水平,而单任务成本约为 0.11 美元,仅为后者的十分之一左右。


当大模型本身也可能出错时,让模型参与“自己验证自己”的答案筛选,正在成为提升效果的新路径。


在 Terminal-Bench 2.1 测试中,DeepSeek V4 Flash 会针对每个任务采样 5 条候选轨迹,并在自验证后将系统成功率提升至 88%,整体表现超过 Claude Fable 5。



〓 LLM-as-a-Verifier 框架概览


实验过程中,每个任务会先由 DeepSeek V4 Flash 生成 5 条 mini-swe-agent 执行轨迹。Best-of-3 使用前 3 条候选轨迹,Best-of-5 则使用完整的 5 条候选结果。


与此同时,DeepSeek V4 Flash 还会对这些候选轨迹进行评分,LLM-as-a-Verifier 再基于评分完成排序与选择,整个流程无需额外训练专门的验证模型。


这一提升并非轻微优化。Best-of-3 将成功率从 79.4% 提升到 86.5%,Best-of-5 则把 78.7% 进一步推高至 88.0%。


如果放在 Terminal-Bench 2.1 的成本与性能对比图中,这种优势会显得更加直观。



〓 DeepSeek V4 Flash 自验证的成本与任务成功率


DeepSeek 侧采用的是 DeepSeek V4 Flash Max,成本按照当时 OpenRouter 的定价进行测算。GPT-5.6 与 Claude 系列的基线数据,则继续沿用 GPT-5.6 技术报告中的结果。


需要说明的是,这里展示的是系统级结果。DeepSeek 侧引入了多次采样和 LLM-as-a-Verifier 机制,而 Fable 5 侧使用的是 Claude Code,因此不能简单理解为两个基础模型在完全相同条件下的一次直接横向对比。



〓 DeepSeek V4 Flash 自验证结果

项目同时公开了这组实验中的候选执行轨迹,以及 Best-of-3、Best-of-5 对应的复现脚本,方便研究者进一步验证与复现。


Best-of-5 还有一个更值得关注的指标,Oracle(理想选择上限)达到 96.6%。


这意味着,对于大量任务而言,在 5 条候选轨迹中其实已经至少出现了一条成功路径。也就是说,模型具备生成正确解的能力,但验证器尚未将所有正确结果完全识别出来。


原论文还进一步汇总了 Terminal-Bench V2 排行榜中不同模型与 Agent 配置生成的执行轨迹,在理想选择器条件下,任务覆盖率最高可达到 98.9%。



〓 候选覆盖率与评分概率分布


〓 验证扩展的三个维度



登录查看剩余 70% 内容

来源:https://www.53ai.com/news/LargeLanguageModel/2026081939026.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。