游乐游手机版
首页/AI热点日报/热点详情

冻结小模型在已解决问题上完胜顶级AI的研究

类型:热点整理2026-08-06
一项研究提出Galahad系统,将小模型冻结并建立验证解法库,对已解决问题直接取用答案,无需重新推理。测试中180道题全部答对,生成代币为零,成本远低于顶级AI,且支持知识合并与跨域复用。

一项由独立研究团队完成的行业经验报告,以论文编号arXiv:2607.14431公开发布,属于2026年度系列成果之一。研究者可通过该论文编号查阅完整文献及附录资料。

冻结的小模型如何在

当整个行业都在追逐“更大模型、更多参数、更强算力”时,某个团队却做出了一项反直觉的突破——他们将模型彻底冻结,不再进行训练,而是构建了一个“知识金库”。一旦某个问题被解决并通过严格的独立验证,所有后续的同类问题就无需重新推理,直接从金库中提取答案,零消耗,毫秒级返回,每次输出完全一致的字节。这个系统名为Galahad,底层存储引擎称为Merlin。

乍看之下,这似乎有些取巧,但仔细思考,它挑战的是AI领域一个被默认接受的浪费现象:每次用户询问一道已被解答过无数次的数学题、运算题或逻辑推理题,顶级AI服务都需要重新从头推导一遍,消耗大量算力,花费真金白银,且每次答案可能略有差异。这项研究旨在衡量:如果将“推导”与“执行”彻底分离,将会产生怎样的效果?

一、让一个冻结的小模型“开挂”:零推理代币、百分之百准确

理解这项研究的核心,需要先明确一个关键区别:当前大多数AI在每次回答问题时,都需要完整地重新“思考”一遍,就像一个学生每次被问到2+2等于几,都要重新在脑中计算,而非直接从记忆里调取答案。这个“重新思考”的过程会消耗资源,称为“生成代币”(generation tokens),可以粗略理解为AI的思考步骤数,每一步都需要花费成本、时间和电力。

Galahad系统则完全不同。它维护着一个“经过验证的解法库”,当一类问题被解决并通过严格的独立审核后,该解法会被存储起来。下次遇到同类问题,系统不让模型重新推理,而是直接从库里调出已验证的解法,由模型执行并算出新参数下的答案,然后返回结果。模型本身并未产生任何新的推理步骤。

研究团队在一个12亿参数的开源模型Gemma-4-12B上进行了测试,让其面对九类数学和算法问题的180道全新题目。所谓“全新”,是指使用了从未见过的具体数字参数。结果显示,180道题目全部答对,正确率100%,且每道题产生的生成代币数量为0。这里需要特别说明的是,这并非简单的“背答案”——系统存储的是解法方法,而非特定数字的答案。例如,某一类问题的三道测试题,输入的数字分别是3105、390和15150,这些数字从未出现在记忆库中,但系统利用存储的解法方法,成功计算出了这三个新数字的正确结果。

与此同时,研究团队还对比了四款来自不同厂商、不同架构的模型——包括稠密架构的Gemma-4-12B、Qwen3-14B、Phi-4,以及混合专家架构的DeepSeek-Coder-V2-Lite——四款模型在同一套记忆库下均取得了180/180的满分成绩,生成代币全部为零。这表明,这套机制与具体模型的选择无关,换用不同模型,结果完全一致。

二、验证不看答案卷:这个“守门员”如何工作?

你可能会问,如何确保存入的解法是正确的?这正是该系统最关键且最耗费精力的部分。

Corbenic AI对“验证”的定义极为严格:验证过程绝对不能查看答案卷(benchmark answer key)。这就像监考老师判卷,并非直接拿学生的答案与标准答案对比,而是通过完全独立的推理过程来确认答案的正确性。这样做旨在防止系统“作弊”——如果验证时偷看了答案,所谓的验证便失去了意义。

具体来说,系统针对不同类型的知识采用了三种独立的验证方式。对于数学证明类问题,使用机器可检验的形式化证明——如同数学家提交一篇证明,由独立的自动化验证工具逐步检验每一步逻辑是否成立,而非由另一个AI模型给出评分。测试中,模型写出了一个正式数学证明,独立的证明检验器在第一次提交时便通过了;同时,一个故意写错的命题(2+2=5)被同一个检验器拒绝,证明这个门禁确实在严格把关。

对于开放性推理类问题,系统采用一致性检验机制——模型以机器可解析的格式输出推理过程,自动化程序检查推理内部是否自相矛盾。如果推理的前提与结论冲突,则会被拒绝。四款模型各自接受了超过二十个推理框架的测试,88个提交全部通过并被正确复用。此外,还测试了推理方法的跨域迁移——将一种在某领域验证过的推理方法移植到完全不同的领域(如医疗分诊),四款模型总计80次迁移尝试,77次成功通过了一致性门控。

更为关键的是,团队专门测试了“欺骗”这个门禁的可能性——一个表面看似正确但实则存在细微错误的候选解法,被这套分层验证机制识别并拒绝,具体的反例也被记录在案。每个候选解法在被接受之前,都需经过150个边界条件的测试。在所有测试输入上,验证门控没有放任何一个错误答案进入库中。

三、这不是缓存,也不是普通的“知识检索”——一个被频繁误解的设计

不少人听到“存解法、取解法”时,会将其与现有技术混淆。研究团队在报告中专门列出了这套系统与相邻技术的区别,因为这些区别恰恰是整套保证成立的关键。

语义缓存(semantic cache)和向量检索系统(RAG)——即当前AI行业最流行的“知识库”方案——通过模糊的语义相似度来寻找答案,就像在图书馆里用关键词寻找大致相关的书籍。这种方式的根本问题是:找到的内容可能并非你真正需要的那本。研究团队进行了一项专门测试:在一个包含4500条目的验证知识库上,让精确地址寻址和近似相似度匹配各自工作,结果显示精确寻址零错误,而近似匹配取错的比例高达94.3%。换句话说,使用当前主流的向量检索方式,每一百次查询中有94次会拿回错误的答案——而且是拿到一个“看起来正确”的错误答案,没有任何报错,这才是真正的危险所在。

前缀缓存(prefix/KV caching)——这是vLLM、SGLang等推理引擎中常见的加速手段——确实可以复用一部分计算,但它的本质是跳过了相同输入前缀的重复计算,模型依然需要为每道题生成新的输出代币,且没有任何验证机制确保答案正确。

还有一类“智能体技能库”(agent skill libraries),例如Voyager、TroVE等系统,思路已接近Galahad,会积累可复用的工具。但它们的验收标准通常是另一个模型的判断,或针对特定任务的神谕(oracle),而非独立的、不依赖答案卷的验证门控。一旦负责判断的模型出错,错误的解法便会进入库中。

Galahad同时实现了“精确选中正确条目”、“按位精确复现答案”、“存入前通过独立验证”这三件事,而研究团队对市面上主要类别的六类已发布系统进行了系统性审查,未发现任何一个同时具备这三个属性。

四、一次性成本有多少?回本要多久?

这套机制的经济账是这样计算的:解决并验证九类问题,总共花费了16579个生成代币。这是一次性的总成本,覆盖了所有求解和验证活动。之后每次复用的边际成本为零个代币。

如果同样的问题由顶级AI服务来回答,每次都需要走完整的生成流程,通常一道经过完整推理的答案需要500到1000个生成代币。按此数字倒推,16579除以500得到33,16579除以1000得到17。也就是说,一个问题家族只要被问上17到34次,前期的一次性验证成本便全部回收。从第35次开始,每一次都是纯粹的节省。这个比例会随着使用量的增加而无限扩大。

从能耗角度看,180道题的完整复用测试,每款模型消耗了约6.3到6.5瓦时的电力,平均每道验证答案约36毫瓦时——大约相当于一只LED灯泡燃烧13秒的用电量。而那次一次性的九类问题求解验证活动,总共消耗了81.1瓦时,大约是复用成本的2000多倍,但这2000多倍只支付一次,此后便永远免费。

五、知识可以合并,而且能跨域“搭积木”

Galahad的能力并非仅限于“一对一地取出存好的答案”,存入的知识可以被组合起来回答从未存储过的新问题。

研究团队测试了一道需要同时调用三个不同存储解法的复合问题——每一个单独的解法都不包含这道题的答案,但将三个解法组合在一起,系统答对了5道中的5道,生成代币仍然为零。当将其中一个必要的解法从库中移除时,结果立刻变为0/5。这证明系统是在利用知识进行真正的计算组合,而非碰巧在某个地方存了这道题的答案。

知识合并还可以在更大尺度上进行。团队将来自单一专业领域的六个独立验证知识条目合并成一个14134个代币长的工作上下文,模型从这个合并上下文中生成了一个综合性的分阶段答案,每个元素都能追溯到它来自哪个源条目,不存在跨源的张冠李戴。

更有意思的是跨域计算:给模型提供两个来自不同领域的存储条目,一个存着物理常数,另一个存着计算规则,模型将两者结合,算出了正确答案44牛顿(与真实值完全一致),而这两个条目单独看都不包含这道题的答案。类似地,来自医学领域和天文物理领域的两个存储知识,在合并上下文下,模型能够在一个回答中同时引用两者,两种不同的合并配置均测试成功。

九个条目同时合并是目前测试过的上限,超出这个范围的行为尚未测量,研究团队在报告中明确说明了这一点,未超出测量范围进行推断。

六、存储层“Merlin”如何保证金库不崩、不混、不错?

维护这个知识金库的底层引擎名为Merlin,它负责确保存储的内容是唯一的、可查的,且出现问题也不会导致整个库损坏。

精确寻址的速度是一个关键指标。在一个包含4500个条目的知识库上,Merlin的内容键值计算速度达到每个键3.7纳秒,即每秒2.71亿个键,是加密哈希算法速度的60.2倍,是标准库默认实现的18.5倍。寻址不会成为系统的瓶颈,随着知识库扩大,这个优势只会愈发明显。在实际的全集成生产路径上,从一个查询进来到选中正确条目,中位数用时1.6微秒,95分位数是17微秒,而一次完整的复用执行需要6到23毫秒,寻址时间仅占其中极小的一部分。

去重同样经过严格测试:给系统喂入6000个候选条目,其中2000个是唯一的,4000个是字节完全相同的重复项,系统精确接受了2000个,滤掉了4000个。规则是严格的——哪怕两个条目只差一个字节,也被视为不同的新知识。

存储安全性方面,研究团队测试了两种真实故障场景。在一个硬性内存上限下,常规存储方式直接崩溃并报访问违规、进程挂掉;Merlin在同样的上限和同样的工作量下,选择拒绝超出的请求,系统继续存活。在写入中途被打断的场景下,之前已提交的条目全部保持完整可读,没有任何数据损坏;而用同样方式打断一个常规文件存储,整个文件变得完全不可读。进程完全重启之后,Merlin恢复了每一条条目,字节完全一致。

七、在“已解决的问题”上,小模型赢了

研究报告里有一节专门讲述这套系统与顶级AI服务的比较,并且特别声明:用来比较的顶级模型的数字,全部来自那些模型厂商自己公布的官方报告,未私自测试任何顶级模型。

在从零开始解决全新陌生问题方面,报告完全承认顶级模型领先——Anthropic公布的AIME 2026得分为77.5、LiveCodeBench-v6得分为72.0,谷歌公布的Gemma-4-12B在这些指标上确实不在同一水平。这个方向不是Galahad的目标,报告没有任何这方面的竞争宣称。

但在“已经解决并验证过的问题”这块领域,对比关系完全倒转。顶级API每次收到一道已被解答过无数次的问题,依然需要完整地生成一遍答案:花钱、花时间、结果不确定、没有验证保证。Galahad这边的答案是:零生成代币、6到23毫秒返回、每次输出字节完全一致、存储前通过独立验证。而且这块“已解决领土”只会随着时间推移不断扩大,从不缩小。

报告还专门提出了一个公开挑战:如果有任何厂商能展示一个API,在已解决问题上以零边际生成代币、按位精确、使用预先验证的结果来回答,研究团队愿意将这个挑战视为被推翻。目前没有已知的已发布产品文档描述这样的服务。

八、一台46GB的GPU,能装下六百万个代币的上下文

最后还有一项关于存储容量的对比测试,结果可以说是量级上的差距。

研究团队在一台46GB显存的GPU上,让Galahad系统、vLLM和SGLang三者在同样的硬件条件下各自测试能够维持多大的工作上下文。vLLM在30399个代币时触发了硬性错误,这是它的上下文长度上限,它至少会诚实地报错。SGLang接受超过32000个代币的输入,但会悄悄截断,且不返回任何第一个代币——这意味着用户以为在获得服务,实际上什么都没收到。

Galahad维持了一个600万代币的可移动窗口,整个过程GPU显存增量只有263兆字节,几乎是平的。在这600万代币的存储内容里,团队放置了5个探测点,系统全部正确取回,且无论探测点在哪个深度,访问时间都稳定在0.55到0.59秒之间——取第5970000个代币处的内容,与取第0个代币处的内容,花费的时间相同。更早的一次测试甚至达到了1498万代币,同样保持了平坦的内存占用。

这里有一个重要的说明:这不是模型在“全局注意力”600万个代币,那对当前任何模型来说都是不可能的计算量。实际上,系统维护的是一个在这600万代币上可以自由移动的窗口,模型在任何时刻实际处理的仍然是一个有限大小的窗口,只是这个窗口可以精确地移动到任何位置。团队也用一个对照实验验证了这一点:故意将窗口放在别处,深层探测点就看不到了,答案就错了。这是设计上的预期行为,而非缺陷。

此外,在复用速度上,同样的任务,Galahad在4000、16000、30000个代币大小的存储内容上,分别比对手快13倍、41倍和55倍,而且这个优势随着上下文增大而持续扩大。

说到底,这项研究的核心洞察是:当一个问题已有经过验证的正确答案,重新推导一遍不是智慧,而是浪费。Corbenic AI搭建的这套系统,本质上给AI增加了一个“永久不遗忘、永远不犯同样错误”的知识金库。小模型冻结不动,金库持续积累,已解决的问题越来越多,而每道已解决问题的回答代价趋向于零。

这种思路并非要取代顶级AI的原始推理能力——在面对全新难题时,大模型的强项无可替代。但在那些可以被验证、会反复出现的问题上,反复为相同的推理付费,实际上是在用最贵的工具做最不需要贵工具的事。对于那些有大量重复性可验证任务的场景——比如财务计算、合规检查、参数化工程分析——这套机制提供了一种在成本、速度、确定性和可审计性上同时占优的选项。

对于普通用户来说,这项研究更像是一个提醒:当前我们付费使用的AI服务,可能有相当大比例的算力和费用被花在了重复解决已解决过的问题上。如果这种浪费能够被系统性地消除,AI服务的成本结构可能会发生根本性变化。至于这是否会推动行业改变当前的默认做法,以及这套系统在更复杂、更开放的任务上能走多远,将是接下来值得持续关注的问题。


Q&A

Q1:Galahad系统和普通的AI缓存有什么本质区别?

A:普通AI缓存或向量检索是靠“大概相似”来寻找答案,研究测试表明,这类方案在4500条目的知识库上有高达94.3%的错误取回率。Galahad使用精确内容寻址,4500条目零碰撞,且每个存入的解法必须通过不依赖答案卷的独立验证,确保取出的内容真正正确。这个区别决定了两者在可靠性上不在同一个级别。

Q2:Galahad验证知识的过程为什么不能看答案卷?

A:如果验证时直接将模型输出与标准答案对比,那么这种“验证”本质上是在作弊——它依赖了外部已知答案,而非独立判断解法是否正确。Galahad的三种验证方式(形式化证明检验、一致性检验、分层边界测试)都是通过独立的逻辑推断来确认正确性,与答案卷完全隔离,这样存入的解法才具有真正的可信度。

Q3:Galahad系统对普通用户或企业有什么实际意义?

A:对于有大量重复性可验证任务的场景,比如财务计算、参数化工程分析、合规审查,这套系统意味着前期解决和验证一次之后,后续每次查询的成本接近零,速度在毫秒级,且每次结果完全一致,可留审计记录。相比每次都调用顶级AI接口重新生成,这是一种在成本和确定性上的结构性改善。

来源:https://www.techwalker.com/2026/0805/3195445.shtml

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。