英伟达4B小模型击败GPT-5+Pro!成本仅为其1/36
闻乐 发自 凹非寺
量子位 | 公众号 QbitAI
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
英伟达小模型持续获胜。
ARC-AGI 2最新成绩,4B小模型NVARC27.64%的公开榜成绩力压GPT-5 Pro 18.3%登顶榜首。
且每任务成本仅20美分,大约是GPT-5 Pro单任务成本(超过7美元)的1/36。

据最新分析,此次NVARC夺冠的亮点在于零预训练深度学习方法,没有依赖大规模通用数据集进行前期预训练,规避了预训练模型的领域偏见、数据依赖等问题。
而ARC-AGI 2确实是一个消除了与公共训练数据重叠的更高难度测试,主要是看测试模型能否高效地获取超出其训练数据的新技能。

成绩出炉后,最新访谈到了NVARC团队的Jean-Francois Puget和Ivan Sorokin,进行技术剖析。

快来看看“性价比之王”是如何“练”成的?
不靠参数堆料
英伟达的策略是将复杂推理移至离线的合成数据管道,训练能在评估时快速运行的较小模型。
简单来说就是大规模合成高质量数据,然后对现有模型进行优化,并且将昂贵的计算工作转移到离线进行

由于Kaggle比赛对计算资源限制非常严格,团队意识到,他们不能直接使用那些需要超强算力的大型LMM来进行复杂的、一步一步的推理和代码生成。
因此他们改变了思路,决定将最烧钱的计算工作转移到离线完成。比如利用GPT-OSS-120B来大规模制作高质量的合成谜题。
团队从H-ARC、BARC数据集中搜集了现有的ARC谜题数据,然后将简单的谜题混合起来,生成更复杂的新谜题。

为了确保数据质量,他们将复杂的推理管线拆分成不同的阶段,每个阶段都可以独立验证。
通过这种方式,他们建立了一个含320万+增强样本的合成数据集,其中每个样本最多有7对输入/输出。

这里忍不住提一嘴,哈萨比斯刚强调了Scaling Law的重要性,那么合成数据的Scaling怎么不算呢(doge)?

言归正传,NVARC核心的推理模块以改进版ARChitects方法为基础,选用小参数模型Qwen3-4B,通过对话式模板简化谜题理解。
训练时借助NeMo RL框架和Megatron后端进行监督微调。
不过,让模型取得优异成绩的关键一步在于测试时微调(TTFT)。
针对ARC-AGI-2“每个任务都是全新规则”的特点,NVARC引入了LoRA微调技术,并且是针对每一个问题都进行微调,让模型在做题前快速适应。
而对ARChitects方法的改进在于解码阶段DFS算法做了批处理优化,修复结果非确定性问题。
同时统一了8种数据增强操作评估候选解,最终在公开榜获得了27.64%的分数。

在竞赛后期,团队还应用了“少即是多”的TRM方法,尝试与Qwen3-4B集成补充分数,虽然有一定提升,但受各种限制并没有大幅优化。
那么问题来了,有人会说这样训练出来的小模型不就是做题机器吗?哪里比得上全面发力的超级大模型?
但更值得关注的或许不在于模型本身,而在于实现突破的方法。
在特定领域任务中,小模型经过针对性优化,性能并不逊色,再加之成本、速度、适配性与领域聚焦优势,它们已经在诸多场景崭露头角。
将正确的方法用在正确的地方,将会实现更大的价值。

借用这位网友所说,模型或许应该被设计得更加“敏捷”。
论文地址:https://drive.google.com/file/d/1vkEluaaJTzaZiJL69TkZovJUkPSDH5Xc/view
[1]https://developer.nvidia.com/blog/nvidia-kaggle-grandmasters-win-artificial-general-intelligence-competition/
[2]https://arcprize.org/blog/arc-prize-2025-results-analysis
[3]https://www.kaggle.com/competitions/arc-prize-2025/writeups/nvarc
— 完 —
相关攻略
BCBC币(BCBC)深度解析:技术底色与市场前景 在百花齐放的数字货币领域,总有项目希望以独特的技术路径站稳脚跟。BCBC币(BCBC)正是其中之一,它依托一套组合技术方案来构建其安全与稳定的基石,目标直指高效、低成本的支付新体验,同时也不失为投资者眼中一个潜在的增值选项。 技术架构:不止于共识的
BNB Chain完成第31次季度销毁,近10亿美元BNB永久退出流通 近日,全球顶尖的区块链基础设施BNB Chain正式完成了其第31次季度代币销毁。根据官方公布的数据,本次共计销毁了1,579,207 716枚BNB,按销毁时市场价值计算,总额高达约9 16亿美元。此次大规模销毁再次向市场展现
OpenClaw 核心命令完全指南:从入门到精通 当您开始接触一个新工具时,最常见的障碍是什么?往往是面对复杂的命令列表感到困惑,只能被动地复制粘贴。这不仅影响效率,而且在遇到问题时更难以排查。 本文将为您深入解析 OpenClaw 的关键指令,帮助您从基础操作者转变为理解原理的熟练用户,全面提升配
让AI告别“重视觉效果、轻物理逻辑”的行业短板,近期五一视界(51WORLD)发布全球首款物理直觉世界模型51World Model,实现AI遵循物理规律推演、与真实场景全要素交互的核心突破,彻底破
一台售价8 5万元的人形机器人,拆开来看,成本只有4 16万元,预估毛利率40 7%。但宇树G1的真正壁垒,藏在硬件之外。3月30日,中邮证券电新团队分析师苏千叶、盛炜、杨帅波发布《宇树G1人形机器
热门专题
热门推荐
《全面战争:中世纪3》:经典延续,如何平衡怀旧与创新? 近期,《全面战争:中世纪3》的项目负责人帕维尔·沃伊斯坦然指出,要打造一款真正优秀的续作,绝不能仅仅依赖对前作模式的简单复刻。这一观点引人深思——尽管《中世纪2:全面战争》至今仍在策略游戏爱好者心中占据着经典地位,但开发团队此次显然决心跳出“照
雷鸟X3 Pro斩获AWE艾普兰创新大奖,开启全民AR生活新篇章 在上海新国际博览中心隆重揭幕的2026年中国家电及消费电子博览会(AWE)上,前沿AI科技与未来生活愿景激情碰撞。全球消费级AR领导品牌雷鸟创新,以其里程碑式的表现,定义了行业发展的新方向。 通过“顶尖硬件科技+顶级文化IP”的双轨战
借力AWE2026“一展双区”,MOVA双区协同、震撼登场 备受瞩目的科技盛会——2026年中国家电及消费电子博览会(AWE),于3月12日至15日在上海盛大举办。本届AWE展会首次创新采用“一展双区”的展览模式,主会场位于上海新国际博览中心,分会场则设于上海东方枢纽国际商务合作区,两大展区高效联动
冰结师技能全解析 踏入2026年,《地下城与勇士》中的冰结师职业,其技能体系已构建得更为成熟与强大。无论是在副本中高效清理海量怪物,还是在决斗场与高手玩家周旋,这个职业都能凭借其独特的冰霜艺术掌控战局。刷图时,酷寒的范围法术可瞬间清屏;而在PVP竞技中,一套将冻结控制与瞬间爆发完美衔接的连招,往往让
iPhone 18 Pro系列模具不变,屏幕形态将与iPhone 17 Pro保持一致 备受期待的屏下Face ID组件小型化设计与灵动岛区域缩窄方案,预计将被推迟至后续迭代机型中正式应用。 近期,关于iPhone 18 Pro系列的技术传闻持续引发行业关注,尤其在显示与解锁设计领域传言甚多。多方消





