就在今天,腾讯内部发布了一项重磅消息:混元多模态模型部门与大语言模型部门正式合并,并升级为基础模型部。新部门将由腾讯首席AI科学家姚顺雨统一领导——这一决策背后,释放出一个非常明确的信号:腾讯正在多模态领域全面提速。

具体来说,腾讯混元目前已构建起相当完整的模型矩阵——以强大的大语言模型为基础底座,衍生出图像、视频、语音、3D生成等一系列模型能力。此次合并,本质上是要打通不同模态之间的壁垒,让整个研发体系更加高效地协同作战。目标非常明确:探索全模态模型的智能上限。
先看大语言模型这条线。7月正式上线的混元Hy3,表现相当亮眼:在同等参数规模下,其智能水平已能比肩参数规模大2到5倍的旗舰模型。这不仅是普通的进步,更是实打实的技术突破。目前,Hy3已在WorkBuddy、CodeBuddy、元宝、Marvis、ima等多个业务场景落地,API也同步在腾讯云TokenHub和多个海外平台上架。发布仅一周,Hy3的总调用量就比上一代Hy2暴增了68倍。更值得关注的是,在WorkBuddy的自选模型中,有60%的用户主动选择了Hy3——这一比例说明,市场在用脚投票。
多模态方面同样没有停歇。4月发布的混元3D世界模型2.0(Hy World 2.0),能力边界已延伸至3D世界:它可以根据文字、图片、视频等不同类型的输入,自动生成、重建甚至模拟3D世界。更关键的是,它支持多格式3D资产导出,这意味着能无缝对接现有游戏工作流,快速生成游戏地图和关卡原型。从社区反响来看,混元3D模型的下载量已超过300万次。图像方面,混元图像模型3.0在LMArena榜单上位居国内开源模型第一,这一成绩同样相当硬核。
说到姚顺雨,背景确实足够硬核。本科毕业于清华大学姚班,普林斯顿大学计算机科学博士,2024年加入OpenAI,深度参与了智能体产品Operator和Deep Research的开发。他的研究聚焦于语言智能体与现实世界的交互,提出的ReAct方法首创了“推理-行动”结合的智能体范式,这一范式在学术界和工业界都得到了广泛采用。可以说,由他来统领腾讯的大模型研发,是顺理成章的安排。
在这个时间点,有必要回顾一下2025年12月腾讯的架构调整。当时,腾讯升级了大模型研发架构,新成立了AI Infra部、AI Data部、数据计算平台部,全面强化研发体系。姚顺雨那时就已经出任CEO/总裁办公室首席AI科学家,向总裁刘炽平汇报,同时兼任AI Infra部和大语言模型部负责人,向技术工程事业群总裁卢山汇报。今天的这次合并,更像是对前期布局的进一步优化和深化。
