7月22日消息,7月17日凌晨,月之暗面扔出了一颗重磅冲击波——2.8万亿参数的大模型Kimi K3。这个模型以1679分的成绩登顶Frontend Code Arena榜单,成为史上第一款在前端编程领域超越一众闭源模型的开源大模型。消息一出,全球AI圈都炸了锅。
这亮眼的表现,连特斯拉CEO马斯克都坐不住了。他在相关评测内容下留了一句“Impressive(令人印象深刻)”。
其实,这已经不是马斯克第一次公开认可这支中国AI团队了。今年3月,他就曾点赞过Kimi的底层架构技术报告。而这次,在预告自家新模型Grok 4.6时,马斯克更是直接把Kimi K3列为对标参照目标。有意思的是,Kimi K3一边被马斯克“点名”,一边也陷入了争议——网络上开始流传一些质疑声,说K3是蒸馏美国模型的产物。
嗯,事儿就是这么个事儿。针对外界广为流传的“K3是蒸馏小模型”的猜测,7月21日上午,月之暗面企业业务负责人黄震昕在媒体采访中正面回应了。他明确表示,Kimi K3性能实现跨越式提升,核心是依托底层原创架构创新,并非对任何现有模型进行蒸馏复刻。
那么,K3到底强在哪?根据最新介绍,Kimi K3搭载了自研的Kimi Delta Attention(KDA)混合线性注意力机制,以及Attention Residuals(AttnRes)注意力残差技术。在MoE混合专家架构设计上,模型总计设置了896个专家,单次推理激活16个专家单元。这些结构性革新,让Kimi K3对比前代K2模型,整体扩展效率提升了大约2.5倍。
值得一提的是,月之暗面强调将继续坚持开源路线。核心底层技术与论文均对外公开,对行业保持开放姿态,未来也不会改变这一策略。

