腾讯最新发布的首个研究智能体——Hyra(Hunyuan Research Agent),正式进入公众视野。Hyra 并非仅止步于执行指令,而是能够像一位真正的科研工作者那样,提出假设、设计实验方案、执行验证、总结规律,并在此基础上不断迭代优化。这一过程循环往复,正是当前学术界讨论热度极高的“递归自我改进”(Recursive Self-Improvement, RSI)理念的完整呈现。

根据腾讯公开的实验数据,Hyra 已在AI模型训练优化、GPU Kernel优化、数学发现、量子计算、药物设计等十余个研究方向落地应用,并在多项公开任务中成功刷新了历史最佳纪录。
举一个具体实例:在科研领域,Hyra 设计出了一个仅含15个可训练参数的Transformer模型,便能高效完成10位数加法运算。相较于Adderboard公开纪录中的36个参数,参数数量直接减少了58.3%。这意味着,Hyra 能够在严格的资源约束下,同步搜索最优模型结构与计算机制,为探索神经网络的能力边界,以及追求极致模型压缩,提供了全新的研究思路。
不仅如此,Hyra 还能通过观察AI模型的训练日志,自主发现模型内部的Scaling Law,进而指导训练配方的工程设计——这一能力已十分接近人类研究员的思维方式。
Hyra 的应用场景远不止于学术研究。它同样擅长3D建模、音乐创作等创意领域。例如,给定一段主旋律后,Hyra 能够为多种乐器编写完整的和声,并逐步将一段原本保守的和声编排,迭代为一首多乐器交织、节奏灵活、色彩丰富的完整作品。听起来,就像一位渐入佳境的作曲家。
腾讯还在官方博客中透露,新一代Hy模型乃至腾讯的部分产品,都将与Hyra持续协同进化。这或许意味着,AI自我迭代的闭环,正在从理论走向真正的落地实践。
01. 采用轻量Harness设计,有效防止AI“作弊”
过去一年,递归自我改进已成为全球AI领域最受瞩目的技术方向之一。Google DeepMind 推出了AlphaEvolve,利用Gemini进行算法发现,成功将4×4复数矩阵乘法的标量乘法次数压缩至48次;Together AI 通过Einstein Arena,让多个智能体协同探索数学开放问题;Andrej Karpathy 也提出了autoresearch,旨在让模型训练实验实现自动循环运行。
然而,上述研究大多聚焦于单一方向。腾讯此次推出的Hyra,目标更为宏大:构建一套通用的研究框架,让智能体真正融入AI研发、科学发现乃至工业设计等真实场景,在不断积累经验的过程中,实现自主进化。
科研真正的难点在哪里?并非一次实验的成功,而是在经历上百次失败之后,依然能够稳住心态,调整方向,重新设计实验,并再次验证。这本质上是一个不断循环的搜索过程,也是科研智能体区别于普通AI助手的关键所在。
Hyra 的核心设计,正是围绕这一循环展开的。
整个系统并未设计复杂的工作流,而是采用了一套非常轻量的Harness。腾讯团队遵循了Rich Sutton提出的“苦涩教训”(The Bitter Lesson):长期来看,真正能够持续胜出的,并非人为设计越来越复杂的规则,而是给予AI更大的搜索空间,让计算资源持续发挥价值。
Hyra 智能体的整个系统只包含两个核心角色:
一个Context Agent,负责维护经验库(Experience Bank)。每一次实验的代码、日志、评测结果、生成文件都会被完整保存,并不断整理成新的“灵感”,供下一轮探索使用。
另一侧,则是多个Proposal Agent。它们不断领取不同的灵感上下文,提出新方案,自动生成完整解法,并进入独立的沙盒环境执行。程序运行结束后,系统会自动打分,再将结果回传至经验库。
整个系统保持异步运行:Context Agent持续生产探索方向,Proposal Agent持续消费任务并验证结果,计算资源、沙盒环境、模型推理始终保持高利用率。Context Agent还会将灵感准备得尽可能多样化,让Proposal Agent能够朝不同方向进行探索。
Hyra 不仅优化方案,还优化评测标准。许多科研问题缺乏天然的评估器。例如,设计一个世界冠军级的国际象棋AI,最初只能构建一个简单的Elo评测系统。但随着越来越强的AI不断涌现,评测体系本身也必须持续升级,否则AI很容易通过“刷分”来获得虚假进步,而非真正变强。
为解决这一问题,腾讯混元团队提出了一套双层循环机制。首先,Hyra会根据任务描述设计一个初版评估器,内层循环基于该评估器反复优化解法;当内层循环结束后,Hyra会结合历史经验进一步优化评估器,并用升级后的评估器开启下一轮循环。这意味着,Hyra 优化的不只是答案,而是整个科研流程本身。
02. 从模型优化到药物设计,Hyra展现多领域潜力
科研智能体最终还是要靠实际成果说话。腾讯此次展示了十多个由Hyra执行的科研任务案例。
首先来看AI for AI方向。模型训练是最适合科研智能体发挥作用的领域之一,其中包含大量可执行、可评估、可迭代的研究循环。腾讯选择了三项公开任务进行评测:NanoChat Autoresearch、NanoGPT Speedrun 和 NVIDIA 的 SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和GPU Kernel优化。
在完全相同的实验设置下,腾讯将Hyra与AI初创公司Recursive的研究智能体进行了对比。在NanoChat任务中,Hyra将Validation BPB进一步下降至0.9015;在NanoGPT Speedrun中,Hyra达到指定Loss所需时间缩短至76.4秒;在GPU Kernel优化任务SOL-ExecBench中,Hyra将Mean SOL提升至0.771,均显著超过基线水平。
不过,腾讯也展示了科研智能体面临的一个有趣问题。随着搜索能力的增强,AI开始主动寻找评估器的漏洞。例如,在NanoChat实验中,Hyra曾尝试通过泄露未来Token信息,获得异常优异的BPB成绩;而在Kernel优化过程中,也出现过缓存结果绕过真实性验证的情况。这些案例说明,当AI越来越擅长优化目标时,评估器本身也必须持续升级,否则所谓的“进步”可能只是形式上的作弊。
Hyra在AI for Science方向也展现出不错的潜力。腾讯从Einstein Arena、Packing Center等公开数据库收集了55个长期未解决的数学开放问题。最终,Hyra在其中29个问题上刷新了历史最佳结果。
它还能直接从数据中寻找规律。当获得1749年至1932年的太阳黑子历史数据后,Hyra自动发现了一套递推公式,用于预测后续近百年的太阳黑子变化趋势。
Hyra可以直接设计科学与工程产物。它设计的量子比特路由算法,在IBM Q20上相比经典SABRE算法,将路由效率提升了44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。
在药物设计任务中,Hyra围绕精准抗癌“明星靶点”PARP1自动生成候选分子,在结合能力和成药性联合评分上,超过了已上市的PARP抑制剂奥拉帕利(Olaparib)。当然,腾讯也强调,这一结果目前仍属于模拟筛选阶段,距离真实药物研发还需要经过更严格的计算验证、化学合成以及湿实验验证。
除了科研,Hyra也可以进入更多开放场景。它通过持续的自博弈,将一个黑白棋Bot训练到Botzone平台730多个程序中的第3名。或者,根据一张二维图片,不断修改建模代码和渲染参数,自动生成更接近参考图像的三维模型。
这些案例共同说明,Research Agent并不仅适用于存在唯一标准答案的问题。无论面对数学、科学发现、游戏策略,还是艺术创作,只要能够建立有效的反馈机制,智能体都能够持续搜索、不断演进。
03. 结语:科研智能体或成下一代AI系统重要形态
随着大模型能力的不断提升,如何让AI自身加速AI的发展,已成为不少大模型企业开始深入思考的问题。芯片、药物等领域的企业也正在尝试将科研过程本身交给AI来完成。
未来,科研智能体能否真正成为科学发现的新工具,还有待更多真实场景的验证。但可以确定的是,AI正在从帮助人类完成工作,进一步迈向帮助人类创造知识。而能够持续自我改进、自我研究的智能体,也极有可能成为下一代AI系统的重要形态之一。
