K3并非全球科技股暴跌的罪魁祸首,恰恰相反,它是下一轮AI繁荣的报信者。
这个标题或许听起来有些夸张,但请耐心阅读以下数据和分析,你很可能也会得出相同结论。

7月16日晚间,月之暗面正式发布了Kimi K3大模型。该模型拥有2.8万亿参数,采用开源、多模态架构,上下文窗口超过100万。7月27日将完整开放权重。消息传到华尔街时,交易员们正在为一轮持续数日的科技股抛售寻找理由。K3的出现恰逢其时。
让我们看看它的成绩:在Artificial Analysis智力指数中排名全球第3,Arena Frontend Code排名全球第1。Terminal-Bench 2.1得分88.3,仅比GPT-5.6 Sol的88.8低0.5分。FrontierSWE得分81.2,仅次于Fable 5的86.6,远高于GPT-5.6 Sol的71.3。
一家中国公司推出的开源模型,在编程和长程推理这两个最硬核的指标上,已经能够与全球顶尖闭源系统比肩。市场因此开始躁动:有观点认为,K3戳破了全球算力扩展的泡沫,打破了Anthropic与OpenAI的估值逻辑,并加剧了近期高位科技股的剧烈波动。
逻辑链条十分直接:如果开源模型在有限算力下仍能取得如此突破,那么此前市场对AI基础设施的天价资本开支定价,是否建立在过度乐观的假设之上?如果一家中国公司能用更少的资源做出接近顶尖水平的模型,那么英伟达的订单簿、Anthropic与OpenAI的高毛利故事,是否都在同一瞬间被打上了问号?
总而言之一句话:都怪KIMI。
012.8万亿参数的重型基建
先看一个最容易被忽略的事实:2.8万亿参数。这个数字本身的分量,比任何Benchmark都更有说服力。将如此多的参数塞进一个模型,让它们在896个专家模块中各司其职,每次推理仅唤醒其中16个。这从来不是节省算力的技术路线,而是重型基建。
模型权重在4比特浮点精度下就需要超过1.5太字节的HBM显存容量,推理时需要在64卡以上的超节点上才能运行。专家并行方案采用了极高稀疏度的WideEP架构,对scale-up域的容量和带宽要求极高。K3之所以看起来“省”,是因为它在每一分算力上都压榨出了成倍的效能,而不是因为它不需要算力。它不是一架仅用于滑翔的纸飞机,而是一架装配了更先进引擎的重型战斗机。引擎效率越高,飞得越远,但对燃料的绝对需求只会更大,不会更小。
这是整个论证的基础,不把这件事讲清楚,后面所有的推论都会失去根基。
02一架超级引擎
K3真正令人兴奋之处,在于其超级引擎的价值。月之暗面在K3上落地了三项关键技术:KDA混合线性注意力、注意力残差和高稀疏度MoE。这三项技术指向同一个目标:将算力转化为模型效果的效率推向极致。
第一,KDA混合线性注意力。Transformer最消耗算力的部分是注意力机制。标准注意力随着序列长度增加,计算量呈平方级增长。对于百万级上下文的任务,大部分算力都消耗在维持长序列的注意力矩阵上。KDA机制将大部分注意力层的计算复杂度从平方级降低到线性。根据月之暗面此前发布的Kimi Linear技术报告,在48亿参数和3亿激活参数的实验模型上,采用3:1的KDA与MLA混合比例,KV缓存占用最高减少了75%,100万上下文长度下的解码吞吐量提升至原来的6倍。对开发者而言,这意味着同样的GPU集群可以同时服务更多用户,处理更长的任务。
第二,注意力残差。当模型规模达到万亿级别后,信息在层与层之间传递会衰减,浅层信号传到底层时已经变得模糊。注意力残差允许模型在深层直接跳回浅层提取原始特征,再融合进当前推理。这解释了为什么K3在FrontierSWE这种需要持续数十分钟的长周期软件工程任务上表现格外出色——它能在漫长的推理链条中保持方向感,不会在过程中迷失目标。
第三,高稀疏度MoE。896个专家,每次只激活16个。这个极端比例意味着每个专家模块必须在自己领域内做到极致,否则整个系统会崩溃。支撑这套架构的是Stable LatentMoE,通过低维隐空间进行专家路由,再利用历史思维链保留训练来维持跨轮推理的稳定性。叠加训练方法和数据配方的优化,K3相比上一代K2的整体扩展效率提升了约2.5倍。
本质上,这三项技术削减的不是算力,更不是Scaling Law,而是粗糙的算法浪费。将每一分算力转化为模型能力的效率推向极致,这不叫节省,这叫更善于使用资源。
03市场到底在恐慌什么
从K2.6到K3,仅几个月时间,Arena Code榜单排名从第18名跃升至第1名。部分观点研判认为,K3可能将国产模型与海外前沿的代际差距缩短到3个月以内。一年前这个差距是12到18个月,两年前开源模型甚至不在讨论范围。这样的加速度,才是改变定价逻辑的关键因素。
Anthropic的Fable 5每百万Token输入10美元,输出50美元;GPT-5.6 Sol分别是5美元和30美元;而K3是3美元和15美元,缓存命中仅0.3美元,只有Fable 5的30分之一。当开源模型以更低价格提供接近的性能时,闭源的高毛利叙事便开始松动:Anthropic推理毛利率长期维持在75%以上,这是其高估值的核心支柱。如果开源追赶速度继续加快,这根支柱需要重新审视。
但市场在恐慌时,似乎忽略了一个关键事实:定价权的转移并非价值的消失,而是价值从一层流向另一层。就像当年电力从爱迪生的直流发电机流出,进入西屋公司的交流变压器,再流入福特工厂的独立电动机。每一次流动都没有减少电力的价值,只是改变了谁在收取电费。这一次也一样。
04SuperApp的种子
当模型迫近顶尖水平、抹平基础壁垒之后,发生的不是算力过剩,而是算力在另一个维度上的爆炸。当K3将顶尖编程和Agent能力以开源方式交给全球开发者时,它点燃的东西比任何BenchMark排行榜都要深远。一个编程Agent从零构建GPU编译器,一个设计师用自然语言生成完整的前端工程,一个研究员将两周的科研编程压缩进两个小时——这些场景已经在K3上线后出现。
SuperApp的种子埋在开源的土壤里。当模型不再是瓶颈,算力就会成为瓶颈。用户量每一次增长,Agent任务每一次深层调用,都会转化为巨量推理需求。还有一个被忽略的技术细节:K3在默认最高思考强度下的思维链偏长,实际Token消耗比常规模型更高。在Kimi Work Max的高强度思考模式下,任务反馈速度稍慢,但推理深度更深,Token消耗也更大。这意味着应用越普及,Agent越复杂,单次调用的Token消耗就越惊人,推理计算的规模也将以远超训练计算的速度膨胀。
05还在路上
当然,K3距离AGI还有很长的路。它的缓存保留只有10分钟,可能源自KDA快照缓存的架构特性。在指令模糊时容易过度主动,行为边界尚不稳定。62TPS的输出速度低于同档模型中位数72TPS。这些都是工程问题,可以解决。但更大的问题不在技术,而在场景。
K3需要部署在64卡以上的超节点才能运行,这意味着它还远远不是一款普通企业或个人能够随意消费的基础设施。从实验室到大规模普及,中间还隔着成本、稳定性、生态工具链的一整套工程化鸿沟。它证明了这条路能走通,但尚未走完——这目前是对它最准确的定位。
K3是一个节点,还不是终点。规模法则再次被验证有效:更大参数、更复杂架构、更长上下文,仍然在产生更好的模型。各家不仅不会收手,反而会因为看到对手的底牌而加速。算力侧在加速,算法侧也在加速,两个轮子同时高速转动,中间挤出来的,是一轮从基础设施到应用的繁荣。
有一个古老的哲学命题:如果一支箭在飞行途中的每一个瞬间都静止在某一个位置上,那么它永远也到达不了靶心。芝诺用这个悖论证明了运动的不可理解,但现实中每一支箭都稳稳钉在靶上。K3这支箭已经飞过了从K2.6到K3的这段航程,正在飞向下一段。它经过了每一个瞬间,但它从未静止。
“都怪KIMI”——这句话放在K3发布之后的语境里,最大的讽刺在于,它被当成了一句甩锅。就像老王说,都怪隔壁老张把围墙修得太高,害我也得加砖。K3不是全球科技股暴跌的肇事者,而是下一轮AI繁荣的报信人。它打破了安卧在万亿美元估值之上的垄断叙事,却开启了一个更宏大、更公平、更具爆发力的竞争周期。
算力的下半场,应用的上半场,都已经开始了。
本文基于公开资料撰写,仅作为信息交流之用,不构成任何投资建议。
