游乐游手机版
首页/AI热点日报/热点详情

Kimi K2工具调用性能对比多家服务商实测与开源测试集

类型:热点整理2026-07-25
自 Kimi K2 发布以来,我们被问得最多的问题之一就是:“这模型的 ToolCall 到底靠不靠谱?”收到的反馈五花八门——有人觉得非常好用,有人却频频翻车。仔细排查下来才发现,背后绕不开一个关键因素——不同 API 服务商采用的 Kimi K2 推理方案,在 ToolCall 性能上存在显著差
自 Kimi K2 发布以来,我们被问得最多的问题之一就是:“这模型的 ToolCall 到底靠不靠谱?”收到的反馈五花八门——有人觉得非常好用,有人却频频翻车。仔细排查下来才发现,背后绕不开一个关键因素——不同 API 服务商采用的 Kimi K2 推理方案,在 ToolCall 性能上存在显著差异。

用户选择 API 时,第一反应往往是比延迟、比成本,这没错。但那些更微妙、却直接影响最终效果的精度差异,很容易被忽略过去。

因此,我们推出了 K2 Vendor Verifier 项目。一方面,希望为大家挑选 API 服务商提供一份实实在在的参考;另一方面,也希望能推动模型服务商优化自己的方案,让 API 体验更统一、更可靠。项目地址在此:https://github.com/MoonshotAI/K2-Vendor-Verifier

都是Kimi K2,表现却不同?我们测了多家服务商ToolCall性能,并开源了测试集

既然先测 ToolCall,自然有原因。ToolCall 能力是衡量模型在做 Agent 时“手脚是否麻利”的核心指标,而这恰恰也是 Kimi K2 的关键优势所在。所以,K2 Vendor Verifier 的第一项基准测试就锁定在这里。几天前,我们更新了最新的评测结果,一共有 12 家第三方 API 服务商参与其中。

评估结果用几项关键指标来衡量:

Matching Rate——响应与官方结果完全匹配的比例,越接近 1 越好。
Act_match_rate——动作(调用的函数及参数)是否匹配,不苛求每个细节完全一致,但关键行为要对上。
Reasoning Effort——一个综合性的定性评估,看模型回答是否合理、是否遵从了调用的步骤。

到底表现如何?直接看数据更有说服力。官方 API 的 Matching Rate 是 1.0,作为基准线。其他服务商的差距就很有意思了:有的服务商非常接近,Matching Rate 在 0.9 以上,与官方结果的一致性相当高;但也有服务商掉到了 0.8 甚至 0.7 以下,差距肉眼可见。Act_match_rate 反映了更实际的调用准确性——排名靠前的服务商依然可以达到 0.9 的匹配度,而部分服务商明显无法跟上。Reasoning Effort 评价更直观,显示出不同服务商调用的可靠度差异悬殊。

更关键的是,不同服务商之间的差距并非稳定可预测。某些号称低成本的服务商,在匹配度上只有官方水平的 60% 左右——这在实际应用中,意味着大量的调用失败和结果跑偏。

我们这次的测试集涵盖了 4000 条数据,通过逐一比对每个服务商的返回结果与官方 API 的差异,得出上述结论。为了使结果更透明可验证,我们已经在 Github 项目的 samples.jsonl 文件中公开了 50% 的测试数据,方便大家自行测试、复现甚至对服务商发起 benchmark。

项目还在持续迭代中。接下来,我们会继续拓展测试维度,不仅仅是 ToolCall,还会加入更多复杂场景的 Agent 能力评测。目标是把这个项目打造成一个“公开、公正、透明”的 API 性能参考体系,让每一个选择 Kimi K2 的用户,都能做出更聪明的决定。

来源:https://www.53ai.com/news/LargeLanguageModel/2025101221390.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。