近日,腾讯在人工智能领域迈出重要一步——将混元多模态模型部门与大语言模型部门正式合并,统一组建为基础模型部,由首席AI科学家姚顺雨负责统筹。这一举措的意图非常明确:整合两大团队的力量,从底层架构到上层应用全面打通,致力于探索全模态模型的智能上限。

姚顺雨(右) 资料图
此次合并,意味着自2025年4月起实行的大语言与多模态双团队并行研发模式正式结束。官方表示,整合后研发与协同效率将得到提升,并能更集中地探索全模态模型的能力上限。这背后释放出一个信号:腾讯在AI赛道上不再满足于“两条腿走路”,而是将所有资源朝同一方向集中发力。
姚顺雨于2025年9月从OpenAI低调加盟腾讯,同年12月即出任首席AI科学家,负责统筹混元大语言模型的研发工作。入职不到一年,他推动混元对底层基础设施进行了全面重建。如今,混元已形成以语言模型为核心的完整技术架构,覆盖图像、视频、语音、3D生成等主流模态,几乎涵盖了所有可想象的领域。
7月初,混元正式发布并开源了大语言模型Hy3。该模型采用MoE架构,总参数达295B,激活参数为21B,相比4月发布的preview版本,在智能体与代码能力上提升了20%至30%。在同等参数规模下,其性能测评表现领先,甚至可以比肩参数规模为自身2到5倍的旗舰模型。这一成绩在行业内具备较强竞争力。
Hy3已接入WorkBuddy、CodeBuddy、元宝、Marvis、ima等多个业务,并同步上线腾讯云TokenHub及多个海外平台。发布首周,Hy3总调用量较上一代Hy2增长超过68倍;在WorkBuddy自选模型的用户中,选择Hy3的比例达到60%。这一数据表明市场对其认可度相当高。
在多模态方面,腾讯于4月发布并开源了混元3D世界模型2.0(Hy World 2.0)。该模型支持文本、图片、视频等多种输入类型,能够自动生成、重建并模拟3D世界,同时兼容多种格式的3D资产导出,可与现有游戏工作流无缝对接。社区下载量已突破300万。此外,混元图像模型3.0在LMArena榜单中排名国内开源模型第一。
多模态业务的快速发展也带动了人才层面的变动。7月8日,前OpenAI研究员、姚顺雨的前同事田永龙加入腾讯大语言模型部。田永龙在视觉模型与多模态表征学习方面的研究对行业影响显著。他的加入预计将为下一代混元多模态模型提供关键技术支撑,也让人对后续进展充满期待。
