中国开源大模型领域再次迎来里程碑式进展。核心结论如下:北京月之暗面公司推出的开源模型Kimi K3,参数量高达2.8万亿,在复杂推理、代码生成、长上下文处理及智能体任务执行等关键能力上均实现了显著提升。这一突破的背后,离不开两项自主研发技术的支撑。
K3的进步不仅体现在“信息存储量更大”,更在于信息处理方式的高效性。企业业务负责人黄震昕对此给出了明确判断。
在大型语言模型的发展浪潮中,注意力机制始终是技术基石。参数规模决定了模型“能容纳多少知识”,而注意力机制则决定了它“能否抓住重点”——即从海量信息中快速定位关键点、建立关联并生成答案。那么关键问题随之而来:当模型参数达到2.8万亿时,依靠什么支撑其高效运转?
K3的第一项核心创新,是团队自主研发的KDA混合线性注意力机制。传统全注意力机制在处理长文本时,计算量会随文本长度呈现近似平方级增长——文本长度翻倍,计算量约增加四倍。这正是超长文本落地困难的主要瓶颈。KDA通过混合线性设计,将这一开销降低至接近线性增长。在同等算力条件下,模型能够读取更长的内容、处理更多信息、完成更复杂的任务。

Kimi K3品牌视觉图。(月之暗面供图)
第二项创新是注意力残差技术。模型规模越大、层数越多,信息传递的“通路”就越长,信号容易衰减和失真,训练过程也更容易出现不稳定性——这是全球顶尖实验室共同面临的工程难题。注意力残差技术优化了信息在不同网络层之间的传递与复用方式,相当于为大模型安装了一套“稳定器”,使2.8万亿参数不仅能“训练成功”,还能稳定高效地投入实际应用。
KDA解决的是“如何让大模型处理更长任务”,注意力残差技术则应对“超大模型如何越训越聪明”。这两项自主研发技术表明,中国大模型企业的竞争力正从扩大参数规模,延伸至基础架构与原创算法层面。
Kimi K3的发布引发了国际研究机构的关注。高盛集团在研报中将其视为中国模型走向定价权的新节点,认为中国开源及开放权重模型的智能水平,已接近面向全球扩散的关键临界点。
针对海外部分质疑,黄震昕回应称,K3性能跃升的核心来自底层原创架构创新,而非对现有模型的蒸馏复刻。这次突破恰恰印证了:开源模型与中国大模型都不应被贴上“低价标签”。
从应用场景来看,Kimi K3已展现出扎实的落地能力。它能够高效处理海量医学文献、药品说明书及临床指南,快速生成结构化、精准的辅助用药建议;同时实现了标普与万得数据的插件接入,可自动抓取并分析上市公司财报、债券评级、资金流向等数据,为金融行业降本增效。
黄震昕表示,中国开源大模型不仅是效率工具,更是连接技术红利与社会福祉的桥梁,能够让技术服务更公平、更高效地惠及更广泛人群。从这个角度看,这正体现了以人为本的发展理念在中国科技领域的具体实践。
