腾讯在AI领域再度推出重大举措——此次组织架构重组,将核心管理权直接交予姚顺雨。
7月23日,腾讯宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由“95后”首席AI科学家姚顺雨统一领导。其目标十分清晰:进一步增强模型研发与协同效率,探索全模态模型的智能上限。
根据腾讯官方表态,混元已构建了以基础大语言模型为核心的图像、视频、语音、3D生成模型等完整矩阵。自2026年以来,模型迭代速度显著加快,与公司业务的协同效应也在持续增强。
此次调整,或许与姚顺雨在混元大模型上取得的显著成果直接相关。公开数据显示,7月正式上线的大语言模型Hy3,在智能水平上显著优于同尺寸模型,甚至可比肩参数规模2-5倍的旗舰模型。目前,该模型已接入WorkBuddy/CodeBuddy、元宝、Marvis、ima等多个业务,API也在腾讯云TokenHub以及多个海外平台上线。上线仅一周,Hy3总调用量就比上一代模型Hy2增长了超过68倍,WorkBuddy自选模型的用户中,选择Hy3的比例高达60%。
混元多模态模型同样在持续进化。4月发布并开源的混元3D世界模型2.0(HyWorld2.0),能够根据文字、图片、视频等不同类型输入,自动生成、重建和模拟3D世界,同时支持多格式3D资产导出,可与现有游戏工作流无缝对接,快速生成游戏地图和关卡原型。数据极具说服力:混元3D系列模型社区下载量超过300万,成为全球最受欢迎的3D开源模型。混元图像模型3.0在LMArena榜单上位居国内开源模型第一。
在频繁的组织调整下,混元团队内部也出现了一些人事变动。据了解,前腾讯混元多模态理解负责人胡瀚或将离职创业。他曾任微软亚洲研究院视觉计算组首席研究员,2025年初加入腾讯后负责视觉大模型研究,随后被调整到大语言模型部旗下的“Frontier”前沿技术研究组,负责多模态理解相关研究,并向姚顺雨汇报。
另一边,7月8日,OpenAI前研究员Yonglong Tian(田永龙)宣布加入腾讯大语言模型部,后续将参与VLM(视觉语言模型)相关研发。公开资料显示,田永龙在OpenAI的核心研究方向涵盖计算机视觉、视觉表征学习以及生成式模型。此前他曾在“谷歌系”深耕多年:2024年底加入剑桥的Google Research担任高级研究科学家,随后于2024年5月转入Google DeepMind。
值得注意的是,田永龙与现任腾讯首席科学家姚顺雨在OpenAI阶段有过共事经历。这层关系,或许也为此次组织调整和人才引进增添了一些有趣的注脚。
