随着AI智能体的普及,文档搜索正从传统的嵌入式搜索转向智能体式搜索,但高性能模型的高成本限制了其应用。Neon与Castform联合训练出一款4B参数的开源模型,在准确率超越GPT-5.6 Sol的同时,将单次推理成本降低至约百分之一,为复杂搜索任务提供了高效经济的解决方案。
搜索范式转变与智能体搜索挑战
当前文档检索的主流方法是嵌入式搜索,即将文档转换为数值化向量后进行相似度匹配。然而,随着AI智能体的广泛应用,搜索流程正逐步转向智能体式搜索。在这种模式下,模型能够将复杂问题拆解为多个子问题,自主决定搜索查询、检视结果,并循环发起下一轮搜索,直至收集到所需信息。
这种智能体搜索方式虽然能够处理更复杂的任务,但每次搜索都需要调用高性能模型,导致耗时和成本显著增加。以Neon提供的典型请求为例,GPT-5.6 Sol单次搜索请求耗时超过10秒,成本约为0.03美元。这种高成本结构成为智能体应用大规模部署的主要障碍。
Neon与Castform的合作分工与训练方法
Neon与Castform在此次合作中各司其职:Neon负责提供文档存储位置和搜索能力,而Castform则专注于训练模型判断“该搜什么”。训练过程采用强化学习后训练技术,模型首先尝试完成任务,系统根据结果进行打分,并将评分直接反馈至下一轮试验中。
评估维度不仅关注最终答案的正确性,还考察模型是否找到了正确的文档以及是否引用了合适的段落。通过这种多维度的评估机制,模型能够不断优化其搜索策略和结果判断能力。

性能对比:准确率超越GPT-5.6 Sol
在Neon的验证测试中,Castform后训练的4B参数模型取得了平均评估分1.447,这一成绩不仅超过了GPT-5.6 Sol的1.369分,也高于作为对照的GPT-5.4的1.377分,刷新了该验证的最高纪录。
这一结果表明,通过强化学习后训练技术,小参数模型在文档搜索任务上能够达到甚至超越大型模型的性能水平,为智能体搜索提供了新的技术路径。
成本优势:推理开销降低94倍
成本差异是该模型最显著的优势。4B小模型的单次推理成本仅为0.000929美元,而GPT-5.6 Sol的成本为0.087338美元,两者相差约94倍。这意味着在保持高精度搜索能力的同时,推理开销被大幅压缩至几乎可以忽略不计的水平。
对于高度依赖反复调用模型进行多轮检索的智能体应用而言,这种成本结构的改变具有革命性意义。它不仅降低了应用部署的经济门槛,还为大规模智能体搜索场景的落地提供了可行性保障。
