就在美国高调发布AI行动计划、宣称要打造“全球无可争议的AI领导者”之际,阿里通义以一连串重磅模型发布,给这份宏大的路线图带来了出乎意料的回应。这份新出炉的计划涵盖90项要点,核心支柱无非是加速创新、建设基础设施、主导国际规则——听起来气势磅礴,但纸面上的规划,终究敌不过真刀真枪的产品落地。
从7月22日到25日,阿里AI上演了一场“三连发”重磅发布。先是Qwen3-235B非思考版本强势登场,紧接着23日推出480B参数的Qwen3-Coder,而今天(7月25日)压轴亮相的,正是千问3推理模型。用一句话概括:这不仅是技术实力的全面展示,更是对全球AI发展路径的一次重新定义——与其制定宏大计划,不如直接交付硬核产品。
非思考模型登顶全球最强
先看第一弹。几天前开源的Qwen3-235B-A22B-Instruct-2507(非思考版),在GPQA(知识推理)、AIME25(数学竞赛)、LiveCodeBench(编程实战)、Arena-Hard(人类偏好对齐)、BFCL(智能体能力)等多项评测中表现亮眼,一举超越Claude4等闭源模型的非思考版本。权威机构Artificial Analysis直接给出结论:千问3当前是全球最智能的非思考基础模型。
Qwen3-Coder:开发者专属的巨兽级模型
紧随其后的Qwen3-Coder,堪称专为开发者打造的“超级巨兽”。它基于MoE架构,总参数达到480B,激活参数35B,原生支持256K上下文,可扩展至1M。在开发者最关注的SWE-bench Verified基准测试中,它斩获了开源模型中的最佳成绩。
更值得关注的是,阿里不仅开源了模型本身,还推出了配套的命令行工具Qwen Code,并基于Gemini CLI进行了深度优化。LM Studio第一时间表示支持,并指出该模型支持工具调用,本地运行大约需要250GB内存——虽然不是轻量级选手,但作为专业开发工具,这样的算力需求完全在可接受范围内。
重磅推理模型震撼登场
回到今天的重头戏。千问3推理模型迎来重大更新,性能直接对标Gemini-2.5 pro、o4-mini等顶级闭源产品。凭借92.3分的AIME25(数学)、74.1分的LiveCodeBench v6(编程)、88.3分的WritingBench(写作)以及60.1分的PolyMATH(多语言数学),它一举夺得“全球最强开源推理模型”的桂冠。
从技术参数来看,Qwen3-235B-A22B-Thinking-2507的配置相当扎实:总参数235B,激活参数22B,94层网络,64个注意力头,128个专家(每次激活8个),原生支持262,144 tokens上下文。模型专为深度推理而设计,默认聊天模板会自动包含thinking标签,开箱即用。
使用方式也极其简单:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-235B-A22B-Thinking-2507"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto"
)
# 模型会自动进入思考模式
messages = [{"role": "user", "content": "给我简短介绍一下大语言模型。"}]
全球网友反响热烈
全球网友的反应可以用“炸裂”来形容。有网友直言“中国开源了o4-mini”,有行业分析师评论“中国刚刚投下了一个怪物级AI模型”。AI Thinkers更是一针见血:逻辑、数学、多领域深度的无缝扩展令人惊叹,256K原生上下文窗口对自主智能体工作流来说是变革性的突破。
还有网友拿模型名字调侃:“我用4o,你呢?”“哦,我只是用qwen3-235b-a22b-thinking-2507”。虽然名字确实有点长,但比起OpenAI那些容易混淆的命名体系,反而更好分辨了。
不完美的小插曲
当然,一周的疯狂发布中也出现了一些小插曲。有用户反馈Qwen Code在使用时费用偏高,甚至出现了“一个/init指令,从充100变成欠179.36”的情况。阿里官方已经给予了费用减免,并表示正在优化计费系统。
不过,从另一个角度看,有网友在对比Qwen3-Coder和Claude Code处理同一问题时发现,Qwen3-Coder的处理反而更准确。魔搭社区也提供了每天免费两千次的使用额度,让更多开发者能够上手体验。
有国内网友评论得很实在:“这是预期中的,毕竟阿里没学OpenAI吊胃口灰度,也没学其他家饥饿式的邀请码,算是足够厚道了。”
话说回来,目前不少开发者还在使用Claude Code,主要原因在于项目惯性——已经设置好的hooks和commands不好轻易迁移。但对于无法方便使用Claude Code的开发者,Qwen3-Coder确实是值得尝试的替代方案。希望通义团队能继续打磨Qwen Coder的周边能力,参考Claude Code的长处,真正提升核心用户的体验。
中国开源崛起 vs 美国闭源路径
回头再看美国的AI行动计划,读起来像一家科技公司的路线图:需要跨机构协调、数十亿美元资金、各种许可审批。但阿里用实际行动证明了一件事:与其制定宏大计划,不如直接交付强大产品。
当美国还在讨论如何扩建电网来支撑AI发展时,阿里已经把全球最强的开源模型摆在了所有人面前。开源,正在成为中国AI弯道超车的关键密码。真正重要的不是谁在纸上写着“必赢”的计划,而是谁在真正行动、定义未来。
当阿里用疯狂的一周刷新开源AI的天花板时,全球开发者用脚投票,选择了开源,选择了创新,选择了更加开放的千问。
这或许就是对美国AI行动计划最好的回应:别光说,来真的。
