用户选择 API 时,第一反应往往是比延迟、比成本,这没错。但那些更微妙、却直接影响最终效果的精度差异,很容易被忽略过去。
因此,我们推出了 K2 Vendor Verifier 项目。一方面,希望为大家挑选 API 服务商提供一份实实在在的参考;另一方面,也希望能推动模型服务商优化自己的方案,让 API 体验更统一、更可靠。项目地址在此:https://github.com/MoonshotAI/K2-Vendor-Verifier

既然先测 ToolCall,自然有原因。ToolCall 能力是衡量模型在做 Agent 时“手脚是否麻利”的核心指标,而这恰恰也是 Kimi K2 的关键优势所在。所以,K2 Vendor Verifier 的第一项基准测试就锁定在这里。几天前,我们更新了最新的评测结果,一共有 12 家第三方 API 服务商参与其中。
评估结果用几项关键指标来衡量:
Matching Rate——响应与官方结果完全匹配的比例,越接近 1 越好。
Act_match_rate——动作(调用的函数及参数)是否匹配,不苛求每个细节完全一致,但关键行为要对上。
Reasoning Effort——一个综合性的定性评估,看模型回答是否合理、是否遵从了调用的步骤。
到底表现如何?直接看数据更有说服力。官方 API 的 Matching Rate 是 1.0,作为基准线。其他服务商的差距就很有意思了:有的服务商非常接近,Matching Rate 在 0.9 以上,与官方结果的一致性相当高;但也有服务商掉到了 0.8 甚至 0.7 以下,差距肉眼可见。Act_match_rate 反映了更实际的调用准确性——排名靠前的服务商依然可以达到 0.9 的匹配度,而部分服务商明显无法跟上。Reasoning Effort 评价更直观,显示出不同服务商调用的可靠度差异悬殊。
更关键的是,不同服务商之间的差距并非稳定可预测。某些号称低成本的服务商,在匹配度上只有官方水平的 60% 左右——这在实际应用中,意味着大量的调用失败和结果跑偏。
我们这次的测试集涵盖了 4000 条数据,通过逐一比对每个服务商的返回结果与官方 API 的差异,得出上述结论。为了使结果更透明可验证,我们已经在 Github 项目的 samples.jsonl 文件中公开了 50% 的测试数据,方便大家自行测试、复现甚至对服务商发起 benchmark。
项目还在持续迭代中。接下来,我们会继续拓展测试维度,不仅仅是 ToolCall,还会加入更多复杂场景的 Agent 能力评测。目标是把这个项目打造成一个“公开、公正、透明”的 API 性能参考体系,让每一个选择 Kimi K2 的用户,都能做出更聪明的决定。
