HyperAIHyperAI

Command Palette

Search for a command to run...

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song Mingxin Li Yanzhao Zhang Dingkun Long Pengjun Xie Zhijie Nie Yilun Zhao Shu Wu

摘要

稀疏检索是现代搜索系统(从网页搜索到检索增强生成)的基础。现有工作引入了学习型稀疏检索(LSR),以超越精确的词法匹配,获取更丰富的语义。然而,LSR 至今仍局限于编码器式的双向架构,其向多模态场景的扩展也严重依赖辅助的跨模态模块。为解决这些局限,我们提出 UEmbed(统一嵌入),这是一个仅解码器的多模态嵌入模型,可在一次因果前向传播中同时生成稀疏词法和稠密表示。UEmbed 将 N 个可学习的特殊 token 附加到输入中,并将词表划分为 N 个不相交的子集。每个 token 的因果隐藏状态预测其对应子集上的稀疏权重,N 个子集的权重拼接后构成完整的稀疏向量。基于公开数据训练,我们发布了 2B、4B 和 9B 规模的 UEmbed 模型。UEmbed-9B 在 MMEB-v2 上的稠密检索得分为 71.8,稀疏检索得分为 71.0,在基于公开数据训练的模型中稠密检索领先,并为稀疏检索设立了新的最优水平。在 BEIR 上,UEmbed 同样与强大的稠密和稀疏基线保持竞争力。此外,我们从有效性、效率和智能体应用三个维度展示了 UEmbed 的实用价值。总体而言,UEmbed 提供了一种新范式:它在单一模型中统一了稠密与稀疏嵌入,同时进一步将稀疏检索扩展至统一文本与多模态输入。

一句话总结

来自中国科学院自动化研究所、阿里巴巴集团等机构的研究者提出 UEmbed,一种仅解码器多模态嵌入模型,在单次因果前向传播中统一稀疏词法与稠密表示,通过将词汇表划分为 NNN 个不相交子集并使用 N 个可学习特殊 token。UEmbed-9B 在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏),在稀疏检索上取得最优结果,并在公开数据训练的稠密模型中领先,同时在 BEIR 上保持竞争力,支持高效且可应用于 agent 场景。

核心贡献

  • 论文提出 UEmbed,一种仅解码器模型,通过划分词汇表并使用可学习特殊 token,在单次因果前向传播中同时生成稠密和稀疏检索表示。UEmbed 在 MMEB-v2 上达到稠密 71.8 和稀疏 71.0,并在 BEIR 上与 SPLADE-v3 保持竞争力。
  • UEmbed 无需辅助跨模态模块即统一文本与多模态检索,在 MMEB-v2 上首次建立稀疏检索最优结果,并展示捕获语义的跨模态词法激活。
  • 稀疏模式提升效率,保持与高吞吐服务栈和倒排索引的兼容性,并在 BrowseComp-Plus 上降低工具调用成本同时保持召回率。混合稠密-稀疏评分进一步提升检索质量。

引言

学习型稀疏检索(LSR)通过使用神经模型生成上下文化的稀疏词法表示,相比 BM25 有所提升,但现有 LSR 方法局限于双向编码器,缺乏原生多模态支持,且很少在实际效率方面进行评估。作者提出 UEmbed,一种仅解码器多模态模型,在单次因果前向传播中同时生成稠密和稀疏嵌入。通过追加可学习特殊 token,每个 token 经 k-means 聚类分配一个不相交的词汇子集,UEmbed 规避了从单一 token 投影的表示瓶颈。该设计使因果骨干网络原生支持稀疏检索,无缝扩展至多模态,并在稀疏多模态检索上取得新的最优结果,同时带来实际优势,如混合稠密-稀疏评分和 agent 搜索中工具调用成本的降低。

数据集

作者构建了一个包含 394 万查询-文档对的训练数据集,来自三个公开来源。

  • Echo-embedding 训练数据:大规模查询-文档对,涵盖广泛领域。
  • MLDR 训练数据:提供长文档训练样本。
  • MMEB 训练集:多模态数据,涵盖多样的视觉和跨模态检索任务。

处理与使用:

  • 多模态子集(MMEB)原本缺少负样本。为此,作者使用教师模型 Qwen3-VL-Embedding-8B 挖掘难负样本。对于每个查询,教师模型从语料库中检索 top-k 最相似但不相关的文档,这些文档作为难负样本。
  • 整理后的数据集(包含新增的难负样本)用于训练学习型稀疏检索器。提供的文本中未提及进一步的过滤、裁剪或元数据构建细节。

方法

作者提出 UEmbed,一种统一嵌入模型,在单一仅解码器架构中同时支持稠密和稀疏检索。如下图所示:

该框架通过引入划分式稀疏头机制和统一训练目标,解决了将传统学习型稀疏检索应用于因果语言模型的局限性。

在详细介绍架构之前,有必要理解基础组件。模型依赖 InfoNCE 损失来最大化查询与正样本文档之间的相似度,同时最小化与批次内负样本的相似度。对于稀疏检索,传统方法如 SPLADE 将 token 隐藏状态投影到词汇表上,并使用带饱和激活的最大池化来聚合,生成稀疏权重。然而,仅解码器模型中的单向注意力机制阻碍了对所有隐藏状态的有效最大池化,需要一种新的方法。

为克服依赖单一 token 进行稀疏表示的信息瓶颈,作者引入词汇压缩与划分策略。首先,通过去除重音符号、小写化和合并空格来压缩词汇表,合并冗余 token 以减少整体词汇表大小。

接下来,模型在输入序列末尾追加 NNN 个可学习特殊 token。在因果注意力下,每个特殊 token 可以关注所有前面的 token,有效总结整个输入。为确保每个特殊 token 捕获不同的语义子空间,使用 k-means 聚类将词汇表划分为 NNN 个大小大致相等的不相交子集。每个特殊 token 分配一个子集特定的稀疏头,通过线性投影后接 ReLU 和 log 变换,为其分配的词汇项计算稀疏权重。最终稀疏表示由所有特殊 token 的子集向量拼接而成。

对于稠密检索,模型利用特殊 token 之前的 EOS token 的隐藏状态。该设计允许在不需要稀疏检索时提取稠密嵌入,而无需额外的前向计算。

模型使用统一目标进行训练,结合两种检索模式的损失。总损失包含稠密检索(使用余弦相似度)和稀疏检索(使用内积)的 InfoNCE 损失。此外,对查询和文档稀疏权重应用 FLOPS 正则化器,通过惩罚平方均值项权重来鼓励稀疏性。标量系数在训练期间平衡这四个损失分量。

为有效训练模型,作者整理了一个多样化数据集,包含来自三个公开来源的 394 万样本,覆盖通用领域、长文档和多模态任务。认识到难负样本对训练学习型稀疏检索器的重要性,尤其是对于缺乏难负样本的多模态数据集,作者使用教师模型挖掘难负样本。对于每个查询,教师模型从语料库中检索 top-k 最相似但不相关的文档,这些文档随后在训练中用作难负样本。

实验

UEmbed 从 2B 扩展至 9B 参数,在多模态(MMEB-v2)和文本(BEIR)基准上针对一系列嵌入基线进行评估。模型的稠密模式与最佳开源多模态嵌入器相比具有竞争力,而其稀疏模式几乎同样有效,尤其是在文档密集型任务上。在文本检索方面,稀疏模式与专用模型匹敌,同时保留稠密和多模态能力。消融实验验证了因果设计、联合训练和语义词汇划分的有效性,实际实验展示了改进的混合评分、部署效率和 agent 搜索性能。

UEmbed 稠密模型在公开训练的多模态嵌入器中取得领先结果,9B 变体超越 RzenEmbed-V2-7B 等同类模型。稀疏检索与稠密性能紧密匹配,差距小于 1 分,并在视觉丰富的文档任务上表现优异,使其成为实用的替代方案。UEmbed-9B(稠密)超越所有在公开数据上训练的其他模型,包括 RzenEmbed-V2-7B 和 Ops-MM-Embed-7B。稀疏嵌入与稠密不相上下:9B 稀疏模型仅落后 0.8 分,4B 稀疏模型超过稠密 Ops-MM-Embed-7B。稀疏模型在 VisDoc 上尤为有效,9B 稀疏相比其稠密对应模型仅下降 0.1 分。在 4B 规模上,UEmbed-4B(稠密)以明显优势超越 Embed-RL-4B,2B 稠密模型仍与更大模型保持竞争力。

UEmbed 模型在 BEIR 上取得强稠密检索结果,UEmbed-9B 达到最高平均 nDCG@10 56.3,领先于 Qwen3-VL-Embedding-8B 和 GME-7B 等近期基线。在稀疏检索中,UEmbed-9B 与专用模型 Echo-Mistral-SPLADE 持平,均为 55.2,同时在单一骨干网络中保留多模态和稠密能力。模型在 Quora 和 NFCorpus 上表现尤为突出。UEmbed-9B 以平均 nDCG@10 56.3 领先所有稠密模型,超越 Qwen3-VL-Embedding-8B(55.5)和 GME-7B(53.5)。在稀疏检索中,UEmbed-9B 与专用模型 Echo-Mistral-SPLADE 持平,平均 55.2,证明其统一多模态和稠密设计没有性能妥协。

在 MMEB-v1 的图像子集上,UEmbed 超越共享相同骨干网络、训练数据和正则化的双向 SPLADE 基线。稠密模式在 QA 任务上取得最大增益,稀疏模式在大多数指标上也有所提升,表明统一因果公式本质上增强了嵌入质量。稠密 UEmbed 在 QA 上相比基线实现显著性能提升,表明更好地利用了自回归骨干网络的能力。稀疏 UEmbed 也带来一致的改进,QA 上提升最大,确认了因果方法的双模优势。

语义词汇划分在图像子集上达到最高的平均稀疏性能,在 grounding 和 QA 上的增益被分类上的小幅下降部分抵消。最大距离划分在检索和分类上领先,而随机划分整体排名最低。语义划分在 GRD 和 QA 上相比随机划分提升近 1 分,但 CLS 略有落后。最大距离划分在 RET 和 CLS 上取得最佳分数,在这些任务上超越语义方法。

混合评分在单次前向传播中结合稠密和稀疏检索,为文本和视觉丰富文档提供适度增益,其中词法匹配提供了互补信号,但对自然图像或视频没有提升。稀疏模式单独几乎在各模态上匹敌稠密性能,使其在需要倒排索引兼容性时成为实用的独立选项。混合评分将文本检索提升 0.3 分,视觉丰富文档检索提升 0.5 分,而图像和视频指标基本持平。稀疏检索落后稠密检索的幅度很小,视频上最大差距为 2.3 分,在视觉丰富文档上与稠密差距在 0.3 分以内。

在包括 MMEB-v1 和 BEIR 在内的多模态检索基准上,UEmbed 模型在公开训练的嵌入器中取得领先的稠密和稀疏结果,稀疏检索与稠密性能紧密匹配,并在视觉丰富文档上表现优异。统一因果公式相比双向 SPLADE 基线提升了稠密和稀疏嵌入质量,语义词汇划分取得最佳平均稀疏检索结果。混合稠密-稀疏评分为文本和文档提供适度增益,但稀疏模式单独仍是实用的独立替代方案。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供