7月19日,月之暗面正式发布了Kimi K3大模型。产品与API同步上线,完整权重预计最迟于7月27日公开。此次发布意义重大,值得深入探讨。
K3的模型规模令人瞩目——总参数达到2.8万亿,原生支持视觉输入,上下文窗口高达100万词元。不过,真正使其在业界引起广泛关注的,是前端开发任务上的出色表现。在Arena榜单上,它暂时位居榜首。
K3在Arena前端开发榜暂居首位
根据Arena 7月16日更新的前端开发榜单,K3以1679分暂时领先,超过了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。然而,Arena自身也标注这一成绩为“初步”——意味着投票数尚未达到稳定阈值,结论尚不确定。此外,该榜单的评估方向非常明确:聚焦于前端网页开发任务,特别是涉及多步推理与工具调用的智能体编程流程,并非模型整体的综合能力。
截至榜单更新时,K3仍被标记为“专有模型”,因为完整权重尚未公开。换言之,开源社区暂时无法获取该模型。
月之暗面方面保持清醒认知。公司在发布博客中指出,根据其内部基准测试,K3的综合表现仅落后于Claude Fable 5及GPT-5.6 Sol;但同时承认,整体用户体验与这两款模型相比仍有明显差距。最新列出的限制包括:思考历史传递不完整时,生成质量可能不稳定;面对模糊需求时,模型可能替用户做出过多决策。
“落后几个月”取决于比较维度
K3并非孤例。其他中国模型的测试结果也在逐步缩小差距。
彭博社报道称,K3发布前,Anthropic一位高管曾认为自家技术领先中国竞争对手约6到12个月。但K3问世后,加州大学伯克利分校教授、Arena联合创始人Ion Stoica判断,中国开放模型与前沿闭源模型之间的差距可能已缩短至2到3个月。
英国人工智能安全研究所7月17日发布的结果亦印证了这一趋势。GLM-5.2和DeepSeek V4-Pro在网络安全能力上,与早4到7个月发布的前沿闭源模型表现相近,远优于2025年大部分时间测得的6到10个月差距。不过,该机构明确提醒,该结论仅适用于网络安全测试,不能外推至其他能力;此外,其尚未对K3进行测试。
K3并非“更便宜的DeepSeek”
还有一个值得关注的维度——价格。月之暗面公布的K3 API价格为:缓存未命中时输入每百万词元3美元,输出15美元。这一价格已接近Anthropic的中档模型。开发者Simon Willison直言,这是当时中国AI实验室发布的单价最贵模型。
但单价并不等同于完成一项任务的实际成本。开发工具Cline公开测试了K3与Claude Fable 5,让两款模型修复同一个真实缺陷。两款模型均成功完成任务,但结果颇具对比性:K3花费0.92美元,Fable花费2.13美元,表面上看K3更便宜;然而,K3使用了约120万词元及34次工具调用,耗时12分钟,而Fable仅使用约73万词元及18次工具调用,3.5分钟便完成。这组实测数据表明,K3的任务总成本可能更低,但代价是完成速度更慢,消耗的词元与工具调用更多。这好比用更多、更便宜的砖块建造房屋——砖块成本降低,但施工时间却延长了。
