2025年7月6日,腾讯旗下混元系列迎来重磅升级——混元Hy3正式从预览阶段迈向全面商用。早在今年4月推出的Preview版本,官方就已将其定义为混元系列当前最强的语言模型,如今正式版落地,自然吸引了行业内外的高度关注。
从技术参数来看,Hy3基于MoE(混合专家)架构设计,总参数量达到295B,而激活参数仅需21B,上下文窗口支持256K。这一配置在当前大模型领域走出了一条“轻量高效”的差异化路线——虽然参数规模并非最大,但实际性能表现却令人眼前一亮。
相比Preview版本,正式版在后训练数据的质量与多样性上进行了深度优化,同时大幅扩展了强化学习(RL)的算力投入。结果在推理能力、智能体交互以及长上下文处理等关键任务上,提升效果非常显著。腾讯特别强调:Hy3的整体效果已具备与国内外参数规模大2至5倍的旗舰模型相抗衡的实力,这才是真正的性价比优势所在。

在应用层面,Hy3的核心优势集中在生产力场景:包括软件开发、办公自动化、金融建模、前端设计以及游戏制作。在这些领域,它已经能够成为高性价比的可靠选择。腾讯内部组织了一场由270位专家参与的真实工作盲测,Hy3平均得分为2.67/4,直接超越了GLM5.1的2.51/4。尤其是在前端开发、数据与存储、CI/CD(持续集成/持续部署)等类别中,优势更为突出。
从官方演示来看,Hy3的多轮交互能力非常直观。用户可以让它协助完成一款“落日飞车”游戏的制作;也可以在办公场景中,基于101个SKU的销售数据,自动生成Excel建模分析,并一键输出30页的汇报PPT。整个流程一气呵成,彻底告别了那种令人烦躁的“请稍等”体验。

更值得关注的是,模型在幻觉率方面取得了显著降低。在基于真实产品的内部评测中,Hy3的幻觉率从12.5%下降至5.4%,常识性错误率从25.4%降至12.7%。这意味着,那些常见的“张冠李戴”、无中生有以及逻辑矛盾等令人头疼的问题,得到了大幅改善。对于企业级应用而言,这项指标的重要性甚至超越了参数规模本身。
此外,Hy3在跨脚手架泛化能力上也进行了强化。腾讯表示,在不同脚手架环境下——例如Codebuddy、Cline、KiloCode——进行SWE Bench Verified测试时,分数标准差能够控制在4个百分点以内。这意味着,即便更换工具链,模型性能也不会出现大幅波动,落地稳定性得到了充分保障。
最后来看价格策略。在腾讯云平台上,Hy3的输入定价为1元/百万tokens,输出定价为4元/百万tokens。如果输入能够命中缓存,价格更是直降至0.25元/百万tokens。考虑到其性能已接近更大参数规模的旗舰模型,这一定价策略显然意在“好用不贵”的赛道上抢占先机。


