游乐游手机版
首页/AI热点日报/热点详情

Kimi K3 API费用计算方式详解

类型:热点整理2026-07-25
KimiK3API计费规则:输入按缓存命中状态分两档,命中每百万令牌二元,未命中每百万令牌二十元;输出统一每百万令牌一百元;上下文按实际传入量每百万令牌二十元;总成本由输入、输出、上下文三项费用叠加计算。

Kimi K3 API 计费规则详解:输入按缓存命中状态分两档收费,输出统一为 100 元/百万 token,上下文按实际传入量计算

月之暗面(Moonshot AI)为其大语言模型 Kimi K3 的 API 制定了详尽的计费方案。若要准确预估单次 API 调用成本,必须同时考虑输入 token 数、输出 token 数、缓存命中状态以及上下文窗口长度这四个变量,遗漏其中任意一项都可能导致最终账单偏差超过 200%。

输入费用根据缓存命中状态区分

K3 API 的输入费用划分为两档,具体取决于请求是否命中系统自动管理的 KV 缓存。该缓存机制由 Mooncake 架构自动调控,开发者无法手动开启或关闭,但可以通过保持稳定前缀和静态 system message 来有效提升缓存命中率。

  • 缓存命中时:输入按 2 元/百万 token 计费。在编程类工具场景中,该状态占比通常超过 90%,10 万 token 输入大约只需 0.2 元。
  • 缓存未命中时:输入按 20 元/百万 token 计费。冷启动对话、随机 prompt 或频繁变更系统指令等情况容易触发此档,2 万 token 输入费用为 0.4 元。

输出费用统一标准定价

所有生成内容,包括思考链(reasoning trace)、中间步骤及最终回答,均计入输出 token 总量。输出单价固定为 100 元/百万 token(约合 15 美元),每生成 1000 token 费用为 0.1 元。

若将 max_completion_tokens 设置为 131072(默认上限),满额输出对应的成本约为 1.31 元;若拉满至 100 万 token,单次输出费用则达到 10 元。

上下文窗口费用按实际传入量计算

Kimi K3 支持完整的 1M token 上下文,但这项能力并不会额外加收“长文本费用”。计费方式为:按实际传入的上下文 token 数乘以单价 20 元/百万 token(与输入未命中档一致)。例如传入 50 万 token 的文档,上下文费用为 1 元。

需要注意的是,只要传入上下文即开始按量计费,即使只读取其中部分内容也不例外。

真实账单计算示例

单次调用的总成本由以下四项叠加计算得出:

  1. 实际输入 token 数(不含上下文)乘以对应缓存状态的单价;
  2. 实际输出 token 数乘以 100 元/百万;
  3. 实际传入的上下文 token 总数(含文档、历史消息等)乘以 20 元/百万;
  4. 将以上三项费用相加。

示例:20 万上下文 + 2000 输入(未命中)+ 2000 输出,成本 = (2000×20÷1000000) + (2000×100÷1000000) + (200000×20÷1000000) = 0.04 + 0.2 + 4 = 4.24 元。

本文信息基于原始资料记录时的状态,模型版本、产品功能、价格、企业合作及政策可能持续变化,实际情况请以相关主体最新公开信息为准。

来源:https://www.php.cn/faq/2874970.html?uid=1431639

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。