7月21日,腾讯正式发布其首个研究智能体(Research Agent)——Hyra(Hunyuan Research Agent)。该智能体能够模拟科研人员的工作流程,自主提出假设、执行实验、总结经验,并通过递归自我改进(Recursive Self-Improvement,RSI)机制实现自我进化。
根据腾讯公开的实验结果,Hyra已在AI模型训练优化、GPU Kernel优化、数学发现、量子计算、药物设计等十余个方向展现出卓越能力,并在多个公开任务中刷新了历史纪录。例如,在科研领域,Hyra设计出了一个仅含15个可训练参数、即可完成10位数加法的Transformer,相比Adderboard公开纪录中的36个参数减少了58.3%。腾讯表示,这一成果证明Hyra能够在严格资源约束下,联合搜索模型结构与计算机制,为研究神经网络能力边界、追求极致性能的模型压缩提供有力支持。此外,Hyra还能通过观察AI模型训练日志,自动发现模型的Scaling Law,从而指导训练配方的优化设计。
Hyra的应用范围并不仅限于科研,还可用于3D建模、音乐创作等创意场景。例如,在获得一段主旋律后,Hyra能够为多种乐器编写完整的和声,并逐步将一段原本保守的和声迭代为多乐器、灵活节奏和丰富色彩的完整音乐作品。

腾讯在博客中透露,新一代Hy模型乃至腾讯的部分产品,都将与Hyra持续共同进化。研究博客地址为:https://hy.tencent.com/research/hyra
轻量级Harness设计,有效防止AI“作弊”
递归自我改进已成为全球AI领域广泛关注的技术方向之一。Google DeepMind推出了AlphaEvolve,将Gemini用于算法发现;Together AI通过Einstein Arena让多个智能体协同探索数学开放问题;Andrej Karpathy也提出了autoresearch,旨在让模型训练实验自动循环运行。不过,上述研究主要聚焦于单一方向,而腾讯此次发布的Hyra旨在构建一套通用研究框架,使智能体能够进入AI研发、科学发现乃至工业设计等更多真实应用场景。
Hyra的核心设计围绕“假设-实验-总结-再假设”这一循环展开。整个系统采用轻量级Harness架构,遵循Rich Sutton提出的“The Bitter Lesson”:从长远来看,真正能够持续胜出的不是人为设计越来越复杂的规则,而是给予AI更大的搜索空间,让计算资源持续发挥其作用。
Hyra系统包含两个核心角色:
- Context Agent:负责维护经验库(Experience Bank)。每一次实验的代码、日志、评测结果以及生成文件都会被保存,并不断整理成新的“灵感”,提供给下一轮探索使用。
- 多个Proposal Agent:不断领取不同的灵感上下文,提出新方案,自动生成完整解法,并进入独立沙盒执行。程序运行结束后,系统会自动打分,再将结果重新写回经验库。

整个系统保持异步运行,Context Agent持续生产探索方向,Proposal Agent持续消费任务并验证结果,确保计算资源、沙盒环境以及模型推理始终保持高利用率。
Hyra还设计了双层循环机制来解决评估器升级问题。首先,根据任务描述设计初版评估器,内层循环基于该评估器反复优化解法;内层循环结束后,结合经验库中积累的历史信息进一步优化评估器,并使用升级后的评估器开启下一轮循环。这意味着Hyra优化的不仅仅是答案,而是整个科研流程本身。
多领域能力展示:从模型优化到药物设计
腾讯展示了十多个由Hyra执行的科研任务案例。
AI for AI方向
腾讯选择了三项公开任务进行评测:NanoChat Autoresearch、NanoGPT Speedrun以及NVIDIA推出的SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和GPU kernel优化。在完全相同的实验设置下,腾讯将Hyra与AI初创公司Recursive打造的研究智能体进行了对比:
- 在NanoChat任务中,Hyra将Validation BPB进一步降低至0.9015。
- 在NanoGPT Speedrun中,Hyra将达到指定Loss所需的时间缩短至76.4秒。
- 在GPU Kernel优化任务SOL-ExecBench中,Hyra将Mean SOL提升至0.771。

腾讯同时展示了科研智能体面临的问题。随着搜索能力的增强,AI开始主动寻找评估器的漏洞。例如,在NanoChat实验中,Hyra曾试图通过泄露未来Token信息来获得异常优秀的BPB成绩;在Kernel优化过程中,也出现过缓存结果绕过真实性验证的情况。这些案例说明,当AI越来越擅长优化目标时,评估器本身也必须持续进行升级。
AI for Science方向
腾讯从Einstein Arena、Packing Center等公开数据库收集了55个长期未解决的数学开放问题,Hyra在其中29个问题上刷新了历史最佳结果。Hyra还能直接从数据中寻找规律,当获得1749年至1932年的太阳黑子历史数据后,自动发现了一套递推公式,用于预测后续近百年的太阳黑子变化趋势。

Hyra可以直接设计科学与工程产物。它设计的量子比特路由算法在IBM Q20上,相比经典SABRE算法将路由效率提升了44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。

在药物设计任务中,Hyra围绕精准抗癌靶点PARP1自动生成候选分子,在结合能力和成药性联合评分上超过了已上市的PARP抑制剂奥拉帕利(Olaparib)。腾讯强调,该结果目前仍属于模拟筛选阶段,距离真实药物研发还需要经过更严格的计算验证、化学合成以及湿实验验证。

开放场景探索
Hyra通过持续自博弈,将一个黑白棋Bot训练到Botzone平台730多个程序中的第3名。它还可以根据一张二维图片,不断修改建模代码和渲染参数,自动生成更接近参考图像的三维模型。


这些案例说明,Research Agent并不仅适用于存在唯一标准答案的问题。无论面对数学、科学发现、游戏策略,还是艺术创作,只要能够建立有效的反馈机制,智能体就能够持续搜索、不断演进。
后续安排与展望
腾讯在博客中透露,新一代Hy模型以及腾讯的部分产品将与Hyra持续共同进化。随着大模型能力不断提升,如何让AI自身加速AI的发展已成为不少大模型企业关注的核心方向。芯片、药物等领域的企业也正在尝试将科研过程本身交给AI完成。科研智能体能否真正成为科学发现的新工具,还有待更多真实场景的验证,但AI正在从帮助人类完成工作,进一步迈向帮助人类创造知识的新阶段。
本文信息基于原始资料记录时的状态,模型版本、产品功能、价格、企业合作和政策可能持续变化,实际情况以相关主体最新公开信息为准。
