先来看几则关键动态。

7月23日,腾讯内部发布通知,正式成立基础模型部,将大语言模型部与多模态模型部进行整合,相关业务与团队也一并划入新部门。腾讯首席AI科学家姚顺雨兼任基础模型部负责人,直接向技术工程事业群(TEG)总裁卢山汇报工作。
目前仍有部分信息尚不明确:原混元多模态模型部负责人薄列峰的具体去向,腾讯并未对外公布;近期有消息称,混元多模态理解负责人胡瀚已离职,前OpenAI研究员田永龙或将接替其职位,但腾讯方面对此未作回应。在合并大语言模型与多模态模型部门后,姚顺雨的管辖范围显著扩大。腾讯官方表示,此次调整旨在提升模型研发效率与协同能力,有助于进一步探索全模态模型的智能上限。
这意味着,腾讯混元自2025年4月将大语言模型部与多模态模型部分拆后,持续了约15个月的算法研发“双轨制”正式结束,如今重新合并。此次调整将语言、视觉、语音、3D等模型研发统一纳入基础模型架构,由姚顺雨统筹技术路线、算力资源及产品协同等关键环节。
腾讯在游戏领域拥有显著优势,多模态能力被视为其相对擅长的方向。混元多模态模型部的研发方向涵盖图像、视频、语音、3D生成及多模态理解,依托腾讯在游戏、内容、社交及企业服务等场景的深厚积累,将这些能力应用于游戏资产生成、图片与视频创作等环节,并通过腾讯云向外部客户开放服务。
具体成果方面,混元图像3.0的图生图版本已接入腾讯元宝;混元3D世界模型2.0于2026年4月发布并开源,据腾讯介绍,该模型能够理解文字、图片、视频等多种输入类型,自动完成生成、重建与模拟3D世界的任务,并可无缝对接现有游戏工作流,快速生成游戏地图及关卡原型。此外,图像设计智能体“妙境Miora”已于7月22日正式上线。
在架构调整方面,此次是腾讯大模型团队继今年3月之后的又一次重大变动。当时腾讯撤销了AI实验室(AI Lab),仅保留产学研合作中心,部分人员调整至混元团队并向姚顺雨汇报,多模态部负责人则向卢山汇报。
在姚顺雨的领导下,腾讯混元重新构建了预训练与强化学习的基础设施,确立了模型以实用性为核心的原则。7月6日,腾讯发布基座模型混元Hy3,定价策略主打性价比,较前代版本更为优惠。输入价格为1元/百万tokens,较预览版下降0.2元/百万tokens;输出价格维持在4元/百万tokens;输入命中缓存价格从预览版的0.4元/百万tokens降至0.25元/百万tokens。
从现有表现来看,Hy3的能力提升主要源于基础设施与训练数据层面的统一,而非不同模态架构的直接融合。腾讯透露,其推理效率提升约40%,幻觉率从12.5%降至5.4%。
与OpenAI、谷歌将文本、图像、音频乃至视频能力逐步整合进同一基础模型的路径不同,根据腾讯已披露的产品形态,Hy3主要承担文本推理与Agent任务,而图像、视频及3D等能力则由不同的专用模型分别完成,再通过智能体或产品流程实现协同工作。
姚顺雨在6月5日与腾讯云与智慧产业事业群CEO汤道生对谈时指出,多模态、具身智能等领域仍有大量空间待开发,下半场才刚刚开始。他选择加入腾讯,正是因为腾讯拥有丰富的场景与产品,使模型能够获得真实的输入与上下文。他还进一步强调,AI下半场的关键在于建立一个长期面向AGI的组织,在基础模型、产品落地与前沿研究三个方向形成均衡布局,构建一个三者平衡的“三角形”组织架构。
