游乐游手机版
首页/AI热点日报/热点详情

Neon 联手 Castform 训出 4B 文档搜索小模型:准确率超 GPT-5.6 Sol,成本仅百分之一

类型:热点整理2026-08-31
Neon与Castform联合利用强化学习后训练技术,成功开发出一款4B参数的开源文档搜索模型。该模型在文档搜索任务上的准确率超越GPT-5 6 Sol,单次推理成本仅为后者的约百分之一,为智能体应用提供了高效低成本的搜索解决方案。

随着AI智能体的普及,文档搜索正从传统的嵌入式搜索转向智能体式搜索,但高性能模型的高成本限制了其应用。Neon与Castform联合训练出一款4B参数的开源模型,在准确率超越GPT-5.6 Sol的同时,将单次推理成本降低至约百分之一,为复杂搜索任务提供了高效经济的解决方案。

搜索范式转变与智能体搜索挑战

当前文档检索的主流方法是嵌入式搜索,即将文档转换为数值化向量后进行相似度匹配。然而,随着AI智能体的广泛应用,搜索流程正逐步转向智能体式搜索。在这种模式下,模型能够将复杂问题拆解为多个子问题,自主决定搜索查询、检视结果,并循环发起下一轮搜索,直至收集到所需信息。

这种智能体搜索方式虽然能够处理更复杂的任务,但每次搜索都需要调用高性能模型,导致耗时和成本显著增加。以Neon提供的典型请求为例,GPT-5.6 Sol单次搜索请求耗时超过10秒,成本约为0.03美元。这种高成本结构成为智能体应用大规模部署的主要障碍。

Neon与Castform的合作分工与训练方法

Neon与Castform在此次合作中各司其职:Neon负责提供文档存储位置和搜索能力,而Castform则专注于训练模型判断“该搜什么”。训练过程采用强化学习后训练技术,模型首先尝试完成任务,系统根据结果进行打分,并将评分直接反馈至下一轮试验中。

评估维度不仅关注最终答案的正确性,还考察模型是否找到了正确的文档以及是否引用了合适的段落。通过这种多维度的评估机制,模型能够不断优化其搜索策略和结果判断能力。

image.png

性能对比:准确率超越GPT-5.6 Sol

在Neon的验证测试中,Castform后训练的4B参数模型取得了平均评估分1.447,这一成绩不仅超过了GPT-5.6 Sol的1.369分,也高于作为对照的GPT-5.4的1.377分,刷新了该验证的最高纪录。

这一结果表明,通过强化学习后训练技术,小参数模型在文档搜索任务上能够达到甚至超越大型模型的性能水平,为智能体搜索提供了新的技术路径。

成本优势:推理开销降低94倍

成本差异是该模型最显著的优势。4B小模型的单次推理成本仅为0.000929美元,而GPT-5.6 Sol的成本为0.087338美元,两者相差约94倍。这意味着在保持高精度搜索能力的同时,推理开销被大幅压缩至几乎可以忽略不计的水平。

对于高度依赖反复调用模型进行多轮检索的智能体应用而言,这种成本结构的改变具有革命性意义。它不仅降低了应用部署的经济门槛,还为大规模智能体搜索场景的落地提供了可行性保障。

来源:https://caip.org.cn/news/detail?id=48246

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。