Kimi K3 发布 10 天后,AI 原生云服务商 Together AI 公布了一份独立第三方评测报告。
https://www.together.ai/blog/kimi-k3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing
这份报告给出的结论颇为意外:如果你的 Coding Agent 仍然按照排行榜直接选模型,那么 Together AI 的这份独立测试结果,可能会让你重新调整默认模型配置。
如果只看「一次调用就写对代码」的能力,GPT-5.6 Sol 的确更占优;但 Together AI 进一步追问了一个更贴近真实开发的问题:如果允许模型进行多次重试,会发生什么?
结果很快出现反转:Kimi K3 在 DeepSWE-pass@2 上以 82.0% 反超 Sol 的 81.0%,到了 DeepSWE-pass@4,差距进一步扩大到 89.4% 对 85.8%。
最终可以概括为:如果是单次调用决胜负,GPT-5.6 Sol 更强;如果放在允许 2-4 次重试的 Agent 架构中,Kimi K3 的上限更高,而且整体成本更低。
下面我们拆开来看这份评测报告的关键数据与结论。

一次调用,GPT-5.6 Sol 哪里强?
在正式展开对比之前,有必要先解释一下,为什么 Together AI 会选择 DeepSWE 作为此次模型评测的核心基准。
DeepSWE 是今年 5 月发布的新一代编程测试基准,被视为继 SWE-bench 之后更受关注的代码能力评测。近几个月,包括 OpenAI、Anthropic 在内的多家模型厂商在发布新模型时,也都优先引用 DeepSWE 成绩来证明编程能力。

它与 SWE-bench Pro 的主要区别在于两点:
第一,提示词长度大约只有 SWE-bench 的一半,但解题所需生成的代码量却是后者的 5.5 倍。这意味着模型不能只靠理解长 Prompt 来抓线索,而是必须真正完成问题分析、逻辑推理与大量有效代码生成。
第二,全部任务和评估标准都是从零重新编写的,模型在预训练阶段几乎不可能见过相同题目。
也正因为如此,DeepSWE 被认为是当前最难“刷分”的编程评测基准之一。

理解评测方式之后,再看 Together AI 这次实验的具体方法和结果:本次实验共记录了 904 条执行数据,覆盖 113 个任务,每个任务独立尝试 4 次,两个模型都开启了最大推理强度。
如果只看单轮调用效果,GPT-5.6 Sol 的整体优势主要体现在以下几个方面:
1. 在单次尝试场景下,Sol 确实更强。其 pass@1 达到 72.7%,领先 Kimi K3 约 4 个百分点。72.7% 的 pass@1,也意味着它在接近四分之三的任务中,第一次就能输出正确结果。

2. 在稳定性方面,Sol 的优势更加明显。4 次尝试全部成功的任务中,Sol 有 61 个,而 Kimi K3 只有 45 个。换句话说,Sol 在更多任务上能够稳定复现成功,可靠性评分达到 84.5%,Kimi K3 为 76.6%。
3.Sol 在执行速度上的领先同样明显。Sol 的中位执行时间为 17 分钟,而 Kimi K3 需要 66 分钟(基于 7 月 25 日 Moonshot 的 Kimi K3 API 数据)。
4.Sol 的整体 Token 消耗也更低。由于完成任务所需步骤大约少了 40%,因此面对同一任务时,它的资源消耗相对更少。
如果你的应用场景是一次调用定胜负、对响应延迟敏感,并且预算较为充足,那么 Sol 仍然是更稳妥的模型选择。
为什么 K3 适合 Agent 场景
但在真实的软件开发流程中,编程 Agent 很少是「一次调用决定结果」的。
pass@1 衡量的是单次命中率,而 pass@k 衡量的是在 k 次尝试内至少成功一次的概率。对于具备自动重试机制的 Coding Agent 来说,pass@k 往往更接近真实生产环境中的实际表现:
因为真实的 Coding Agent 本身就会进行多轮重试,所以 pass@k 越高,最终任务成功率通常也越高。
Kimi K3 在 pass@2 时就已经实现反超,82.0% 对 81.0%;到了 pass@4,优势进一步扩大到 89.4% 对 85.8%。

与此同时,Kimi K3 每次部署成本为 4.65 美元,而 Sol 为 8.37 美元。换算下来,每花费 100 美元,Kimi K3 可以解决 14.7 个任务,Sol 只能解决 5.3 个。按每美元可完成的任务数计算,K3 的解题效率领先 Sol 约 2.8 倍。

报告对失败模式的分析,也解释了这种性能差异背后的原因:
1. Kimi K3 有 65% 的失败案例属于“差一点成功”的类型。
也就是说,超过 80% 的测试用例已经通过,只是在少数细节上卡住。这类错误在重试过程中更容易被修正,因为模型已经抓住了问题的核心逻辑。
2. Sol 的失败模式则不太一样,它更接近“确实不会”。
在 20% 的失败案例中,Sol 会破坏代码库原有测试,而这一现象在 GPT 系列模型中也较为常见。更重要的是,Sol 一旦第一次失败,后续重试带来的改善幅度通常有限。
在多轮对话环境中,即便提供了报错信息,Sol 也更倾向于沿着同一方向反复修补,缺少跳出当前思路重新求解的能力。报告将这一问题归因于采样多样性不足。
最优解:Kimi K3 优先,Sol 兜底
Together AI 在报告中还提出了一个可以直接落地的工程化建议:
如果任务只能调用一次,那么使用 Sol 会更可靠;如果允许多次重试,并且有测试套件负责验证结果,那么使用 Kimi K3 往往能带来更高覆盖率和更好的成本效率。
因此,对于大多数 coding agent 团队来说,更合理的方案是:让 Kimi 先处理大部分任务,再由 Sol 接手那些未通过验证的剩余问题。
具体来看,研究团队发现两个模型在成功/失败分布上的相关性只有 0.46:这说明它们并不是简单的“谁绝对更强”,而是存在明显互补性,擅长与不擅长的任务类型并不完全相同。
基于这一发现,Together AI 提出了一种级联路由策略:先运行 Kimi K3,如果测试套件判定结果未通过,再升级调用 Sol。该策略的准确率约为 85.6%,在 113 个任务中覆盖了 108 个。

85.6% 的结果不仅高于任何单一模型的 pass@1,甚至还超过了“完美路由器”的理论上限 83.4%。
所谓完美路由器,是指假设你可以提前 100% 准确判断每道题该交给哪个模型,但每道题只允许调用一次。级联策略之所以能突破这一上限,是因为它为困难任务额外提供了第二次独立尝试机会。
从成本收益角度来看,这一策略同样合理:
Kimi K3 可以在第一轮处理掉大约 70% 的任务队列,只有剩下更难的任务才需要交给更昂贵的 Sol。每个任务的平均成本约为 7.30 美元,低于全部直接使用 Sol 的 8.37 美元,但准确率却高出接近 13 个百分点。
当然,这个方案有一个明确前提:你需要具备验证器,也就是测试套件,来判断第一轮结果是否正确。如果没有验证器,现实中的路由器准确率通常只会落在 70 多分的区间。
在更细的任务分配维度上,Together AI 也给出了可参考的建议:
1. 序列化处理(92 对 79)、并发处理(72 对 55)以及程序分析(64 对 56)更适合交给 Sol。
2. 工具调用相关任务(79 对 73)和运行时相关任务(77 对 75)则更适合选择 Kimi K3。
3. 在合规性方面,两者整体基本持平,61 对 59。

国产模型的七月:从追赶者到搅局者
以上主要是技术能力层面的对比。但这份报告发布的时间点,也恰好落在中国 AI 行业一个颇具代表性的敏感时期。
7 月,海外模型相关的合规风险集中爆发:
Anthropic 不仅试图垄断旗下 Fable5 模型,还指控阿里巴巴蒸馏 Claude;随后,又有消息曝出 Anthropic 在 Claude Code 中对中国用户进行了隐式标记。紧接着,工信部迅速发布了 Claude Code 安全风险提示,阿里也随之全面禁用 Claude 全系产品。
依赖海外闭源 API 的技术路线,合规风险在短时间内显著上升。
但国产模型的回应速度明显超出市场预期:在技术封锁与信任危机并行出现的 72 小时内,Kimi K3、Qwen3.8-Max 接连发布,国产开源模型也首次在多项评测中跻身全球前三。
从 Together AI 这份评测报告来看,至少在编程 Agent 与 Coding Agent 场景下,Kimi K3 已经成为全球范围内的优选模型之一,而不再只是海外大模型的平替。这也意味着,国产大模型不再只是“追赶者”,而是第一次真正进入全球第一梯队。
随后,国产模型带来的性能与价格压力,也迅速传导到了海外市场:
7 月最后一天,OpenAI 对上线仅三周的 GPT-5.6 Luna 实施了 80% 降价——这是 OpenAI 历史上幅度最大的单次价格调整之一。
同一天,DeepSeek-V4-flash 正式版发布,以极高性价比再次引发全球关注。与此同时,Gemini 3.5 Pro 在 Arena 平台上线不到 30 分钟后便被撤回。

与此同时,海内外模型厂商竞争的重点也正在发生变化:
当模型被深度嵌入 Agent 工作流之后,单次推理价格已不再是唯一衡量标准,多轮调用下的总成本、任务成功率与工程可用性,才是真正关键的指标。而这恰恰是国产模型当前表现突出的优势区间。
更值得关注的是,这可能还只是一个开始。
8 月,智谱据传即将发布 GLM 最新模型(网传名称为 GLM-5.5),对标 Fable5。创始人唐杰用「史诗级 plus」来形容这次升级。同时,智谱也整体放开了限购并提高了 GLM 套餐额度,似乎正在为新模型上线提前做准备,也显示出对本次发布的信心。
此外,DeepSeek-V4-Pro 正式版预计将在 8 月初跟进。预计到 9 月,MiniMax 的 3 万亿级参数模型 M3 Pro 也将正式发布。

如果这些模型在编程能力与 Agent 场景表现上也达到类似水准,那么 Together AI 报告提出的级联路由策略,未来还会拥有更多可组合、可优化的模型搭配方式。
当 Anthropic 和 OpenAI 还在争论谁是世界第一模型时,中国已经开始批量产出第一梯队模型。
恭喜 Kimi 3 交出亮眼表现,也期待本月即将发布的 GLM 新模型,能否再次引爆全球 AI 与编程大模型市场。
‼️ 欢迎来 TokenDance 上调用各种国产模型,不定期还有不少折扣活动~
官网:https://tokendance.space/models
