8月3日,阿里巴巴正式推出Qwen 3.8-Max版,该模型总参数达到2.4T,激活参数为95B。消息公布后,阿里巴巴港股(89988.HK)当日收盘上涨6.75%。
就在几天前的7月31日,DeepSeek发布了V4 Flash正式版。根据Artificial Analysis的分析,该版本被认为是目前单任务成本最低的AI模型,比Anthropic的Fable 5便宜约105倍,成本优势显著。
再往前看,7月17日,Kimi K3发布后,智谱(02513.HK)和MiniMax(00100.HK)的股价同步下滑。数据显示,智谱在17日(周五)和20日两个交易日内,股价下跌42.47%;而MiniMax两日累计下跌约24.57%。K3发布时,在Artificial Analysis(以下简称AA)上的编程评分一度位居第一。有分析认为,智谱此前依靠GLM-5.2建立的“国产最强开源模型”叙事,受到了不小的冲击。
然而,戏剧性的一幕在两周后上演。7月31日,DeepSeek V4 Flash正式版和MiniMax H3(视频生成模型)同步发布,港股AI板块迎来反弹。智谱当天上涨约14.56%,MiniMax上涨约13.15%,阿里巴巴港股也收涨4.73%。
同样是竞争对手发布新模型,一次导致股价下跌,另一次却带动整个板块上涨。市场为何给出截然不同的反应?
一种分析认为,市场对DeepSeek的定位理解发生了变化。4月V4预览版发布时,市场更倾向于将其视为对模型公司估值的冲击,这一逻辑在Kimi K3发布时依然适用。但到了7月底,V4 Flash被重新定义为:国产开源生态的成本基准和能力下限得到重构,这反而放大了所有开源模型公司未来的增长潜力。
有意思的是,8月3日港股收盘后,智谱股价下跌4.73%;而MiniMax则上涨7.2%,这或许归功于H3带来的差异化配置逻辑。
从过去半年中国已上市大模型公司的股价走势来看,一个明显趋势是:中国开源模型性能达到SOTA(State-of-the-Art,即最优水平)所带来的估值上涨窗口期正在急剧缩短。以前,这个周期以季度甚至月为单位,但如今已降低到以双周、周为单位。长期来看,单一模型的性能、评分和排名,已很难为公司的长期估值提供有力支撑。
另一方面,对于国内几家开源模型的估值叙事,资本市场似乎已开始从中观层面对标北美市场。大语言模型市场正在“缩圈”,从“三巨头”走向“双寡头”。基础模型领域的参与者将越来越少。在这种语境下,一款短期内评分排名靠前的模型,并不能保证你留在圈内。

模型排名曾直接支撑估值叙事
如果要找一个时间点来分析市场变化,智谱和MiniMax的上市解禁期可能是一个勉强合适的分水岭。一是因为时间点接近年中,二是因为两家公司上市时间只差1天,市场叙事的时间点基本一致。
智谱是上半年“模型即估值”的典型代表。2月,GLM-5发布并开源,在AA上达到50分,成为开源模型首次突破50分的案例。AlphaEngine数据显示,智谱发布当日上涨28.68%,T+3累计上涨132.07%。6月,GLM-5.2发布后,AA智能指数达到51分,进入全球前三,智谱在官宣后首个交易日上涨32.82%,6月下旬市值一度突破万亿港元。
影响估值的,不仅仅是模型性能,还有价格。智谱在GLM-5发布时,同步将Coding Plan价格上调30%,这直接带动了公司API收入。市场当时愿意相信的逻辑是:模型能力提升,带来排名跃升;排名跃升支撑涨价;涨价后调用量还能增长,说明公司具备定价权。这是纯模型公司最容易获得估值溢价的方式。
MiniMax在早期也有过类似的叙事。2月M2.5发布后,MiniMax股价当日上涨14.62%,T+3累计上涨89.08%。但其支撑逻辑与智谱不同。M2.5在AA智能指数上的位置并不突出,报告中约为42分,全球排名在15名以外,但SWE-bench表现和OpenRouter调用量提供了另一套证据。市场当时接受的是“榜单弱、调用强”的商业化叙事。
到了6月,MiniMax的模型发布开始无法支撑估值,尤其是M3“不及预期”。5月31日晚M3发布,6月1日股价高开低走,收跌15.71%。M3具备1M上下文和自研MSA架构,但在AA智能指数上约为44分,处于跟随位置。
与此同时,M3虽然提价,但没有足够强的榜单排名和调用量数据来验证定价权。市场没有将这次提价视为商业化能力,反而将其视为估值兑现的窗口。
阿里Qwen则呈现出另一种情况。Qwen模型迭代频率高,技术能力处于第一梯队,但阿里的股价很少由单一模型发布直接决定。其估值变量包括阿里云收入、MaaS平台、资本开支、AI应用分发、海外云映射和集团基本面。6月17日,Qwen 3.7-Max正式版发布,部分口径下AA分数达到56.6分,中国第一、全球第六,但阿里美股当日下跌3.18%,T+5累计下跌14.33%。
Kimi和DeepSeek虽未上市,却成为上市模型公司的外部定价变量。Kimi K3发布后,智谱和MiniMax下跌,未上市公司也能通过模型排名改变二级市场对上市模型公司的估值。
DeepSeek的影响则更为复杂。4月V4预览版发布时,模型公司下跌、硬件股上涨,市场理解为DeepSeek压低了模型层估值;7月V4 Flash正式版发布时,智谱、MiniMax、阿里和算力链同步上涨,市场改用生态框架来定价。
SOTA窗口期缩短,单次领先不再是长期估值锚
市场叙事的逻辑,在两家公司解禁前后发生了明显变化。随着SOTA窗口期缩短,单一模型性能已逐渐与估值“脱钩”。
智谱和MiniMax都在7月进入解禁窗口,但市场反应不同。智谱7月解禁比例约5.76%,7月8日至9日附近股价仍能上涨,说明市场当时仍认可其GLM-5.2带来的领先叙事,也相信后续GLM-5.3或更大参数旗舰模型能够继续支撑“持续SOTA可见度”。
MiniMax的情况则相反。其解禁比例约48%,7月9日股价下跌17.98%,市值跌破千亿港元。对MiniMax来说,解禁压力、M3定价权受质疑和多模态叙事降温同时出现,模型发布已无法对抗筹码供给和估值回归的合力。
解禁后,智谱也很快遭遇外部冲击。7月17日Kimi K3发布后,国产模型排序被重排,智谱此前“国产开源第一”的溢价被压缩。7月21日,J.P.Morgan将智谱目标价从2400港元下调至1600港元,降幅约33%,但仍维持“增持”评级。
这个动作说明,卖方并未否定智谱公司本身,而是在下调市场愿意为单一领先性支付的估值倍数。也就是说,公司仍可能具备持续交付能力,但一个模型的领先周期已不足以支撑此前的估值水平。
MiniMax则在7月31日借助H3获得一次修复。H3是MiniMax首款开源多模态生成模型,被媒体称为AA视频编辑榜全球第一,定价为0.8元/秒,并在8月3日开源。对MiniMax而言,H3不是重新证明自己全面领先,而是回应市场对多模态叙事是否结束的质疑。
此前M3发布时,市场不认可其提价和跟随地位,而H3则用开源、多模态榜单和较低定价重新提供了一个可讨论的估值锚。MiniMax在7月31日上涨约13.15%,更接近低位修复,而非长期重估。
这些变化背后的共同趋势,是SOTA窗口期在缩短。模型发布周期不等于SOTA保持时间。BenchLM统计显示,过去12个月有107个显著模型发布,平均约3天一个;进入2026年下半年,frontier模型发布周期已接近1至2周。
资本市场甚至不需要等到模型“登顶”才反应。只要新模型足以改变排序预期,或削弱原SOTA公司的领先假设,股价就会提前调整。Kimi K3发布后智谱和MiniMax下跌,是“排序重排”的反应;DeepSeek V4 Flash发布后板块上涨,则是“生态成本下降”的反应。
两者看似相反,实际上都说明市场正在用更高频的方式重估模型公司,这也会改变模型公司的长期估值方式。
过去,模型公司可以依靠一次SOTA获得较长时间的估值溢价。现在,SOTA更像短期交易信号。
智谱GLM-5和GLM-5.2之所以有效,是因为它们同时具备首次突破、排名跃升和涨价验证。MiniMax M3之所以失效,是因为跟随式发布无法支撑提价,也无法抵消解禁压力。阿里Qwen的股价弹性较弱,则说明平台公司要靠云收入、MaaS调用和生态合作来承接模型能力,而不是仅靠模型榜单本身。
长期看,短期给出一个SOTA模型,并不意味着公司一定能获得更好的商业化潜力。模型排名会变化,API价格会被开源生态压低,客户会在性能、成本和场景之间切换。一个公司如果只有一次登顶,却没有持续迭代能力、调用量增长、客户留存和收入转化,那么SOTA带来的估值溢价很快会被下一次发布稀释。
7月之后,市场降低了对单一模型领先的估值权重,并开始在叙事中寻求更多“证据”,包括迭代速度、收入增速和价格弹性、长期的商业模式等。但正如之前提到的,资本市场对模型能力的估值逻辑正在发生变化。当越来越多公司能够接近前沿模型水平时,单纯依靠模型性能领先已难以形成长期估值溢价,市场开始进一步追问模型能力之外的商业价值。
在通往AGI终点的路上,谁能够更清晰地描绘“路线图”,往往意味着更有可能掌握叙事的话语权。
