腾讯优图实验室凭借前沿的RAG(检索增强生成)技术体系,打造了一套覆盖语义检索、结构化表检索、图检索的全栈解决方案,突破了传统检索与生成的局限,助力AI精准获取知识。本文将从Embedding模型与Reranker模型的精细化训练、结构化数据的智能解析与查询、以及自研GraphRAG框架在构图与推理上的创新三个方面,为你深度解析这项技术的核心架构与创新实践。
一、语义检索:提升检索的精准度与效率
语义检索是RAG技术的基础。优图实验室通过升级Embedding模型和Reranker模型,大幅提升了从海量数据中召回相关文档的能力。
1.1、Embedding模型:多阶段训练与大模型驱动
为了提升基于大语言模型(LLM)的向量模型的检索能力,我们采用了多阶段训练策略,逐步增强向量模型的泛化能力和检索效果。
1.1.1、多阶段训练管线
训练管线概览图如下:

- 弱监督对比学习训练:通过批次内负样本共享和跨设备负样本共享技术,每个查询文本对应多达6万个负样本,极大增强向量模型的判别能力。
- 有监督对比学习训练:通过优化数据采样方法,保证跨设备共享的负样本来源于同一个子数据集,提升难负样本的质量和多样性。同时,在输入文本中加入特定任务的指令词,进行指令感知的对比学习,使模型能够根据任务动态调整语义匹配策略。
