阿里近期重磅发布——通义团队正式推出新一代旗舰大模型Qwen3-Max-Preview(Instruct)。先列出几个关键亮点:万亿参数规模、26万token超长上下文、推理与编程能力媲美全球顶级商业模型,这一举措直接将国产大模型的能力上限推升至新高度。

先来看行业整体趋势。当前大模型领域的主流方向是“更轻量、更高效”,MoE架构的稀疏激活、模型蒸馏、量化压缩等技术成为热点,核心目标是在保持性能的同时降低推理成本。在此背景下,阿里选择逆势而上,打造一个超大规模的密集参数模型,这一战略决策本身就值得深思。它背后不仅体现了对底层算力调度与分布式训练能力的自信,更彰显了坚持探索“极致能力”的路径。
那么,Qwen3-Max的实际表现如何?参数规模突破一万亿,上下文窗口最长支持262,144个token——输入上限258,048,输出上限32,768。这一长度在当前商业模型中处于领先水平,处理整本书籍、完整代码库或超长对话记录几乎毫无压力。更关键的是,它引入了context caching机制,能在多轮交互中缓存上下文表示,大幅减少重复计算,实际体验的流畅度提升较为明显。
在性能方面,根据公开评测数据,Qwen3-Max-Preview在SuperGPQA、AIME25、LiveCodeBench v6、Arena-Hard v2和LiveBench等多个权威基准测试中表现亮眼。不仅全面超越自家前代产品Qwen3-235B-A22B-2507,而且在推理、编程和综合任务上与Claude Opus 4、Kimi K2以及DeepSeek-V3.1等顶级模型正面对抗也毫不逊色。值得注意的是,官方并未刻意强调其为“强推理”模型,但从早期用户反馈看,它在复杂问题拆解和结构化推理方面展现出不错的涌现能力——这种意外惊喜往往是重大技术突破的前兆。
不过,这次发布也伴随着一些值得关注的变化。Qwen3-Max目前采用闭源策略(not open-weight),与Qwen系列一贯的开源传统形成鲜明对比。这意味着你无法像以前那样下载权重、本地部署或进行深度研究,访问方式仅限于API和合作平台。从商业逻辑看,这一选择并不难理解:万亿参数模型的训练和运维成本极为高昂,企业需要通过服务化来实现商业闭环。但站在科研社区角度,模型的可复现性、透明度和学术探索空间确实会受到一定限制。
定价方面,阿里云采用分层计费模式,对不同应用场景的影响差异较大:
- 0–32K tokens:输入每百万token 0.861美元,输出3.441美元
- 32K–128K tokens:输入1.434美元,输出5.735美元
- 128K–252K tokens:输入2.151美元,输出8.602美元
可以看出,常规短文本任务的价格相对合理,性价比较高。但一旦涉及超长上下文处理——尤其是接近25万token级别的输入输出——费用会明显攀升。对于需要频繁处理长文档或大规模代码分析的企业用户而言,成本控制将成为一个现实挑战。
总结来看,Qwen3-Max-Preview的发布确实将国产大模型的规模上限再次推高。万亿参数、26万token上下文、强大的综合能力,这些硬指标体现了阿里在大模型底层技术上深厚的工程积累,尤其在训练稳定性、长上下文优化和推理效率方面的能力。
但硬币的另一面是,闭源策略和阶梯式定价使该模型更倾向于“企业级服务”的定位,而非面向大众开发者或研究者的开放平台。可以预见,它未来更大的影响力可能体现在商业落地和行业解决方案中,而在开源生态中的传播力或将有所弱化。
总体而言,这种探索是有价值的——无论是走“极致规模”路线,还是追求“极致效率”路线,都是推动技术进步的重要尝试。关键在于在能力、成本和开放性之间找到合适的平衡点。Qwen3-Max至少让我们看到,在这个多元化的时代,中国团队依然在用自身方式参与全球AI前沿的竞争。
