游乐游手机版
首页/AI热点日报/热点详情

Kimi K3与Harness实现18个Agent自主科研逼近Opus 5

类型:热点整理2026-08-21
刚刚,闭源RSI的“钦点严父”来了!开源AI基础设施公司Prime Intellect在最新研究中提出:借助多智能体 Harness,可以将监控与具体执行交给更小、更便宜的开源模型,从而让“AI开发AI”这件事变得更低成本,甚至取得更好的实验效果。在实验中,他们把 Fable 5、Opus 5、GP

刚刚,闭源RSI的“钦点严父”来了!

开源AI基础设施公司Prime Intellect在最新研究中提出:

借助多智能体 Harness,可以将监控与具体执行交给更小、更便宜的开源模型,从而让“AI开发AI”这件事变得更低成本,甚至取得更好的实验效果。

在实验中,他们把 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3 等18个前沿大模型,投入到一场 nanoGPT 优化器速通测试中。

结果显示,开源权重模型 Kimi K3 搭配 Prime Agent Harness 后,在原始结果页中跑出了2930步的成绩。

这不仅优于 GPT-5.6 Sol 的3042步,和 Claude 旗舰模型 Opus 5 的2920步也只差10步。

换句话说,在 AI 研究自动化这件事上,一套由开源模型与 Harness 组成的系统,已经能够超过部分顶级闭源模型,甚至逼近第一梯队。

这也在一定程度上动摇了过去那个最经典的 RSI 剧本:

某个最强闭源模型率先跨过“AI开发AI”的临界点,然后持续自我迭代,把其他参与者越甩越远,最终形成赢家通吃的局面。

另一方面,Prime Intellect 也展示了另一种可能:

模型不一定非得最强,只要底层这套科研机器足够高效,开源模型同样可以依靠更高的试错吞吐量追赶上来。

而这也进一步体现了 Harness 这类 Agent 编排框架在 AI4AI、AutoResearch 等方向上的潜力。

这是怎么做到的?

nanoGPT优化器速通

简单来说,这次 Prime Intellect 的实验,就是让十几个前沿大模型去速通 Karpathy 那套著名的nanoGPT 训练任务。

不过需要先澄清一点。

这次比的并不是谁能凭空发明出多么原创的全新算法。

Prime Intellect 所做的,是把 AI 直接放进一个目标清晰、反馈快速的真实训练任务中,看它能不能像人类研究员一样,持续提出假设、运行实验、观察结果,再继续往下优化。

Agent 一开始会拿到一份带有 baseline 超参数的训练脚本,同时只收到一个提示:现在这套方案还不够好。

至于哪里能改进、该如何改进,并不会有人告诉它:

到底是换一种更优的预条件方法,给权重与更新幅度设置上下限,调整学习率 schedule,让高学习率维持更久,还是在训练后期加入权重平均,都要靠 Agent 自己一点点试出来。

因此,这些实验最终只看一个核心指标:

用尽可能少的 training steps,把一个1.24亿参数 GPT 的验证集 loss 降到3.28以下。

为了让所有模型站在同一起跑线上,Prime Intellect 将 baseline 定在了3290步。

作为参考,目前公开的最好纪录则是人类研究者达到的2600步。

于是,整个比赛就变成了从3290步出发,看谁能把这个数字压得更低。

压得越低,说明它找到的训练 recipe 越高效,也就越接近顶尖人类研究者已经实现的水平。

具体来看,此次参与测试的包括 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro、Grok 4.6、Muse Spark 1.2、Qwen 3.8 等,共计18个前沿模型。

每次启动之后,Agent 会拿到三样东西:代码仓库、一份规则手册,以及一条目标指令。

实验统一运行在8张 H200 上,从这里开始,人类基本退出流程。

修改优化器、编写代码、启动训练、比较 loss、判断结果是否只是噪声、决定下一轮实验要做什么,全部由 Agent 自主完成。

值得一提的是,为了防止它们直接联网“抄答案”,整个过程都被限制在 sandbox 中,并且彻底断网。

实验验证

最终,Prime Intellect 一共运行了153次全自主实验,单次最长持续超过8天。

随后,他们先得出了一个多少有些“扫兴”的结论:

没有任何一次实验,提出了真正意义上的全新方法。

最终有效的那些策略,无论是 normalization、学习率调整、权重平均,还是各种 optimizer 技巧,基本都能在已有研究中找到相似思路。

但也正因为大家最后找到的 idea 大同小异,另一个现象反而更加突出:

真正拉开模型差距的,不是想到了什么,而是怎么把它高效试出来。

这里先放几个关键结论:

强模型不会轻易把一个idea判死刑。

弱模型常常因为一个 seed 跑差了就直接放弃,强模型则会更换 seed、重新做消融,甚至等 recipe 发生变化后,再把旧方案捡回来复测。

Opus 5 在重新调 β2 后刷出了新纪录,Fable 5 也曾通过重新探测旧方案,又省下了31个 steps。

强模型更会处理噪声。

它们会先判断一个小幅提升究竟来自真实改进,还是随机波动,再决定是否值得继续投入算力。

甚至有模型发现,同一个 seed 重复跑,loss 也会因为 GPU 非确定性而发生变化,随后便围绕这个现象重做实验流程。

强模型还会自己造工具。

Kimi K3 会主动编写实验函数、比较 loss 曲线、恢复 baseline,甚至搭建一个小型数值实验室,先验证 Newton-Schulz,再把结论带回真实训练流程。

而跑得最远的 Fable 5,最终做到了2726步。

从3290步 baseline 到2600步的人类纪录,中间一共有690步优化空间。

Fable 5 已经吃掉了564步,相当于完成了其中大约82%。到了这里,这次实验真正有意思的地方才开始显现。

因为如果十几个模型最后想到的东西都差不多,那么至少在这类研究任务中,idea 本身可能并没有大家想象中那么稀缺。

真正影响成绩的,反而是能不能多试几个方向,能不能更快排除错误,能不能抓住那些很弱但真实存在的信号,再把它们一轮轮叠加起来。

换句话说,科研能力正在越来越像一个试错吞吐量问题。

而这,也恰好解释了 Prime Intellect 为什么接下来把重点放在了 Multi-Agent Harness 上。

既然大量工作都集中在写代码、跑实验、盯结果、做验证这些环节,那么就没有必要每一步都调用最昂贵的前沿模型。

完全可以让更便宜的开源模型负责监控与执行,把真正需要高质量判断的环节留给更强的模型。

这样一来,同样的预算可以跑更多实验,同样的实验也能更快完成。

而当一次试错越来越便宜,AI 科研能力的提升,也就不一定非得等待下一个更强的大模型出现。

把底层这套“试错机器”打造得更好,本身就能持续把成绩向上推。

所以 Prime Intellect 的下一步,还准备把 Speedrun 扩展到训练栈的更多环节,同时继续放大实验规模。

从这个角度看,Multi-Agent Harness 真正想加速的,也不只是 nanoGPT。

它真正想加速的是 AI 研发本身的迭代速度。

这其实也很像 OpenAI 研究员翁家翌此前在 Why Not TV 里提到的一个判断:

对于人类研究员来说,idea 本身往往很便宜。

大家能够想到的方向,可能并没有想象中差那么多。

真正拉开差距的,是 infra(基础设施)的迭代速度——谁能更快、更稳地验证想法、修 bug、跑实验,谁就更有机会赢。

而放到 AI4AI 这个语境里,道理可能同样成立。

我们未必需要每一步都让一个极其聪明、极其昂贵的模型亲自下场。

很多时候,真正需要解决的是:

如何让一个已经足够不错的模型,以足够低的成本,把实验循环跑得足够快。

这时候,便宜的开源模型 + Harness,反而开始显现出明显优势。

而且值得一提的是,在 Kimi K3 的测试中,正是 Prime Intellect 自家的 Prime Agent Harness 给模型提供了一个可持久运行的 IPython 内核,让它们能够围绕研究任务,自主搭建并持续迭代一套工作流。

而这套内核,也让 K3 能够在实验中主动推翻自己的假设,从而进一步提升效率。

这件事看起来只是一个小功能,但放到 RSI 语境里,其实非常关键。

因为如果模型能力在短期内没有突然跃升,那么接下来最容易继续扩张的,可能恰恰就是模型外围的科研基础设施。

让它拥有更长时间的工作状态、更顺手的实验工具、更便宜的执行模型,以及能够同时运行更多假设的 Multi-Agent 系统。

最后得到的,未必是一个突然发生“智力爆炸”的超级模型。

也可能是一台越来越便宜、越来越快、越来越不知疲倦的 AI 科研机器。

而如果 AI 开发 AI 最终真的要进入指数级加速,Prime Intellect 给出的这条路线至少提醒了一件事:

决定速度的,未必只有上面那个模型有多聪明,下面那套支撑它持续试错的机器,同样重要。

参考链接

[1]https://www.primeintellect.ai/blog/measuring-autonomous-research

[2]https://www.primeintellect.ai/blog/prime-agent

来源:https://www.aitntnews.com/newDetail.html?newId=28317

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。