游乐游手机版
首页/AI热点日报/热点详情

UniNote多模态检索:内容表征与排序一体化

类型:热点整理2026-07-25
UniNote提出统一多模态嵌入模型,融合表示学习与排序能力,采用对比SFT与强化学习渐进式训练,实现单次嵌入传递完成多粒度检索与排序,大幅降低延迟。经Matryoshka机制支持弹性维度压缩,在Item2Item任务上超越现有基线,平衡了全局表征与细粒度检索需求。

多模态检索:UniNote 让内容表征与排序“合二为一”

一张图片、一个标题、一段正文、几行OCR文字……当这些信号混杂在一条笔记里,如何让模型在一次检索中既挖掘局部元素,又细粒度刻画候选与查询之间的相关性?这是工业级多模态检索Item-to-Item(Item2Item)面临的真实挑战。传统方案普遍采用“召回-重排”两阶段流水线,嵌入表示和排序各自为政,导致系统效率低下、延迟高,精度与计算成本之间也难有理想的平衡点。

UniNote正是为了解决这个矛盾而来。它是一个统一的多模态嵌入模型,将表示学习与排序能力融合于单一模型之中。通过创新的两阶段训练范式——对比SFT强化表示,再叠加强化学习优化排序——UniNote在单次嵌入传递内实现了与复杂两阶段检索-排序范式相当的性能,同时大幅降低了计算延迟。相关研究已被KDD 2026录用。

小红书平台的用户生成内容(UGC)构成了典型的复杂多模态目标(笔记Note,可拓展为Item)。每一篇笔记不仅包含文本(标题与正文)和视觉序列(多张图像),还囊括了跨模态的细粒度元素,比如图像中的关键OCR信息。要实现这类复杂内容的精准多模态表征与相似度检索,难点在哪?两个方面。

  • 嵌入与排序的两阶段处理机制。传统检索系统依赖“召回-重排”流水线架构,两个阶段各自优化不同目标,信息无法流通,检索的资源/时间成本也随之增加。
  • 全局表示与细粒度需求的冲突。以MLLM为代表的backbone架构将全局内容压缩成单一表示,对Item2Item检索场景的细粒度需求并未特殊适配。多模态内容包含丰富的多层次语义信息,如何在不同粒度级别上进行有效的表示学习,既能捕获全局语义又能保留细粒度特征,是一个关键挑战。

核心问题很明确:能否设计一个统一模型,在单次前向传递中同时完成多粒度嵌入和精准排序,并且良好适配Item2Item检索场景?

UniNote的核心思路,是从统一Embedding的维度让模型同时具备良好的表示能力与排序能力。为此,我们设计了“SFT学习表示 → 强化学习重排”的渐进式两阶段训练范式,并辅以Matryoshka Representation Learning(MRL)实现多粒度弹性表示,支持不同需求的业务。

UniNote的核心逻辑如下:

1. 统一表示:用多模态大语言模型(MLLM)作为骨干网络,对Item(Note)图文多模态数据进行压缩表示,以实现Item2Item检索任务的统一表示。这些任务包括:

  • 原子对齐(Atomic Alignment):I2T,T2I
  • 从属检索(Subordinate Retrieval):I2Note,T2Note
  • 语义提取(Semantic Extraction):Note2I,Note2T
  • OCR感知(OCR Perception):OCR2Note,I2OCR,OCR2I
  • 内容相关性检索(Content Relevance):Note2Note

2. 统一架构:消除“Embedder + Reranker”的两阶段管道,用一次嵌入传递替代复杂的多模型级联。

3. 弹性部署:通过MRL“俄罗斯套娃”机制,在训练时对不同粒度表征联合优化损失函数,确保向量在任意维度截断时都保持高质量语义区分能力,支持不同场景业务下的高性价比需求。

SFT学习表示:构建坚实的嵌入基础

第一阶段的目标,是将MLLM从生成模型改造为高质量的嵌入模型。相比CLIP等双塔结构,MLLM架构提供了跨模态融合的表征优势。我们取最后一层的last token作为表征,图像与文本在自注意力过程中实现跨模态交换,通过prompt引导的方式将输入上下文压缩至最后一个token。

对比SFT的核心是构建高质量的pair对。在这一目标下,数据和训练策略主要包括三个关键部分:

  • 模态替换防“走捷径”:训练“局部-全局”检索时,如图像到笔记,正样本笔记本身包含该查询图像。为强制模型通过高层语义理解来建立图文关联,我们将笔记中的查询图像替换为同语义的文本描述,防止模型依赖低级像素匹配完成检索。
  • 多粒度难负样本挖掘:以相似度计算为基础筛选方式,在此基础上进行Item拆分,以便过滤样本重叠等伪负样本。另外,人工设计了基于规则的反事实难负样本合成策略:通过删去正候选样本中的目标元素,得到与正样本内容重叠极大的负样本。
  • JS散度对称优化:参考UniME-v2等方法的设计,采用Jensen-Shannon散度替代传统的KL散度作为损失函数,保证了优化方向的对称性和训练稳定性,为后续RL阶段提供均衡稳健的嵌入初始化。

强化学习重排:从“找到相似”到“排好顺序”

对比学习优化的是全局向量空间结构,对局部排序的精细性关注不足。第二阶段引入强化学习,直接以排序质量作为优化目标。

  • 强化学习的引入:排序本质上是一个组合优化问题,评估的是整个排列的质量,而非单个样本的独立打分。RL的奖励函数可以直接度量整个排序列表的质量,通过策略梯度实现端到端优化。
  • 数据构造方式:在Item2Item任务中,我们关注内容语义层面的重叠度。具体做法是将一条笔记分割为内容不重叠的两部分A和B,A作为查询,B与A中不同数量的图片组合构成相关性递减的候选列表,再混入噪声笔记。这种方式无需人工标注即可获得高质量的排序监督信号。
  • 分层奖励函数:采用Group Relative Policy Optimization(GRPO)算法,并设计了独特的分层奖励函数,兼顾“惩罚坏排序”与“奖励好排序”的精细奖励机制:
    • 无关笔记惩罚与相关笔记奖励:对于召回结果,依据相关性判定给予基础惩罚/奖励。
    • 排序优化:由绝对位置奖励与相对位置顺序组成,分别刻画预测排序位置和多样本的相关性分数顺序。
    • 上述奖励函数维度分别从召回覆盖率和召回精准性两个原则出发,通过随机排序证明了奖励函数的单调递增性。

MRL多粒度表示:向量里的“俄罗斯套娃”

受Matryoshka Representation Learning启发,UniNote让同一个嵌入向量在不同维度截断时都保持有意义的语义信息,提供64/512/1024/4096四档压缩模式。

主实验:I2I任务的良好表现

从实验结果来看,在几乎所有定义的Item2Item任务上,UniNote均超越了当前的强基线模型RzenEmbed和Qwen3VL-Embedding-8B。基线模型在从属检索与语义提取任务上表现较差,原因在于现有模型训练所面对的场景单一,缺乏对多模态内容中“全局-局部”细粒度关系的建模能力。而UniNote通过数据驱动和两阶段训练,平衡了全局表征与局部检索的需求。

另一个值得注意的发现是,UniNote在I2OCR任务上的收益较为微弱。这源于模型设计优先考虑高层语义映射,牺牲了OCR所需的底层细粒度字符识别能力。未来我们将引入针对性的数据集来提升模型对文字特征的敏感度,进而补齐这一短板。

注:由于Note2Note任务的正候选样本不唯一,因此指标计算方式不同于其余几项任务,R*@1反映了multi-label nature(定义见论文附录)下的查全率。

消融实验

我们分别针对难负样本挖掘策略和两阶段训练方法进行了消融实验。

  • 难负样本挖掘策略:从随机负样本到完整的多粒度挖掘策略,模型获得了最高23.3%的提升,证明随机采样难以学到高区分度的表示。引入基于规则的反事实难负样本挖掘,则在基础难负样本筛选(基于相似度)的基础上进一步得到提升,验证了反事实规则的设计能够强迫模型区分细微语义差异。
  • 两阶段训练方法:通过引入RL过程,模型的R@5和P@5指标分别提升了1.4%和3.4%。通过考虑相关性和分层奖励函数,RL阶段有效刻画了模型对内容相关性的感知排序能力。

MRL多粒度压缩效果验证

我们评估了模型在4种嵌套特征维度(64, 512, 1024, 4096)下的检索表现。检索性能总体上随着特征维度的增加而呈现上升趋势。当维度压缩到512维时,绝大多数检索任务的性能已经非常接近满维度(4096维)的表现;而当维度被极限压缩到64维时,虽然性能不可避免地出现下降,但模型在图文对齐、从属检索和语义提取等任务上依然保留了约70%的检索能力。

上述结果验证了UniNote生成的表征具有良好的信息密度分布。这使得在实际工业部署中,业务方可以根据不同场景的需求,灵活选择特征维度。

UniNote提出了一种全新的统一嵌入范式,将多模态表示学习与排序优化融合于单一模型,为工业界Item2Item检索提供了一种新的解决思路。为实现这一目标,我们设计出对比学习与强化学习有机结合为渐进式训练范式,并用分层奖励函数优化内容相关性感知排序。未来,我们将继续探索“相关性”这一主题,将Item2Item的检索拓展到Any2Any场景,支持任意场景下的检索需求。

来源:https://www.bestblogs.dev/article/a2d9db8900?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。