7月23日下午,月之暗面企业业务负责人黄震昕就外界关于K3模型是否为“蒸馏小模型”的质疑作出正式回应,明确否认了该说法。他进一步强调,K3性能跃升的核心驱动力在于底层原创架构的突破创新,而非对现有模型的蒸馏复刻或简单模仿。

7月16日,月之暗面旗下Kimi K3正式发布,这款参数规模高达2.8万亿的开源模型凭借在Arena前端代码榜单登顶的亮眼表现,引发了全球AI圈的广泛关注。然而,随之而来的是一些业内人士的质疑——性能突然大幅跃升,是否“偷师”了其他闭源大模型?所谓“蒸馏”,简单来说就是利用现有模型的输出作为训练数据,本质上属于复制而非创新。黄震昕的回应明确否定了这一猜测,并指出K3的竞争力来源于三项原创核心技术:Kimi Delta Attention(KDA)混合线性注意力机制、Attention Residuals(AttnRes)注意力残差技术,以及首次应用于大模型训练的Moon Clip二阶优化器。
其中,Moon Clip优化器尤为引人注目。在训练数据资源趋于饱和的大背景下,它能让20T数据跑出40T级别的训练效果——同等性能下,训练成本与算力功耗直接减半。再配合896个专家中仅激活16个的极致稀疏MoE架构,K3相较前代K2的整体扩展效率提升了约2.5倍。这才是关键所在:不是靠“克隆”或“蒸馏”,而是靠底层架构的硬核突破与原创创新。
