Command Palette
Search for a command to run...
EviRank:面向多模态图像重排序的结构化相关性证据
EviRank:面向多模态图像重排序的结构化相关性证据
摘要
现实世界中的图像搜索查询是多模态且组合式的:“找这件衬衫的粉色款”既指定了需要保留的实体,又指定了需要修改的属性,还指定了需要忽略的语境。然而,现有的重排序器要么将这种多层面的相关性压缩为不透明的嵌入,要么依赖自由形式的思维链,容易遗漏或虚构细粒度约束。借鉴自然语言处理中基于评分量规和清单的评估方法,我们将多模态图像重排序重新表述为语义约束满足问题,并提出 EviRank。该方法将任意查询——纯文本、纯图像或组合式——解析为统一的证据包:覆盖六个语义槽位(如实体、属性、关系)的类型化准则,每个准则被标注为必需、禁止或可忽略。随后,重排序被归结为以证据为条件的验证过程,在无需训练的单一流程中结合确定性量规评分与基于证据的列表式比较。显式证据还可作为结构化监督,用于可选地蒸馏一个轻量级学生模型。在涵盖文本到图像、图像到图像和组合式图像检索的五个基准上,EviRank 取得了最先进的性能,蒸馏后的学生模型以显著更低的成本保留了教师模型 90% 以上的能力。代码见 https://github.com/EnjunDu/EviRank。
一句话总结
香港科技大学(广州)、腾讯元宝和香港大学提出 EviRank,这是一种免训练的多模态重排序器,将排序建模为语义约束满足问题:将查询解析为包含六个语义槽的证据包,每个槽标记为必需、禁止或可忽略,结合确定性评分准则与基于证据的列表式比较,在五个检索基准上达到最优性能,并可选择蒸馏一个轻量学生模型,以大幅降低的成本保留教师模型 90% 以上的能力。
核心贡献
- EviRank 将多模态图像重排序重新表述为语义约束满足问题,将纯文本、纯图像或组合查询解析为统一的类型化证据,覆盖六个语义槽,并带有必需、禁止或可忽略标签。
- 该免训练、以证据为条件的过程结合确定性评分准则与基于证据的列表式比较,分析表明结构化证据具有鲁棒性和可解释性,且禁止性约束能改善细粒度区分。
- 在涵盖文本到图像、图像到图像和组合图像检索的五个基准上,EviRank 达到最优性能,结构化证据可作为蒸馏紧凑学生模型的监督信号,使学生模型以大幅降低的成本保留教师模型 90% 以上的能力。
引言
现实世界中的图像搜索查询通常同时包含文本和图像线索,并施加多个细粒度约束,例如在保留某个实体的同时修改特定属性,并忽略背景或光照等偶然因素。这一点很重要,因为相关性取决于验证候选图像是否满足这些语义约束,而不仅仅是全局相似性。以往的多模态重排序器要么将所有查询维度压缩为单一稠密表示,无法暴露细粒度约束违反情况,要么依赖自由形式的思维链推理,可能遗漏隐式约束、产生幻觉证据,并以不一致的方式覆盖语义维度。作者将多模态图像重排序表述为以证据为条件的语义验证,并提出 EviRank,该方法将查询解析为类型化证据框架,在六个语义槽上生成必需、禁止和可忽略的描述,然后通过免训练的两阶段过程挖掘和验证这些证据,并利用结构化信号蒸馏紧凑的学生重排序器。
方法
作者提出 EviRank,一个将多模态图像重排序重新表述为语义约束满足的框架。该系统不依赖简单的相似度分数,而是将查询解析为统一的结构化证据准则包,并通过评估候选图像满足或违反哪些准则来进行重排序。
请参考下方框架图以了解完整流程。
该方法的核心是证据表示。无论输入查询是纯文本、纯图像还是组合形式,都会被映射到与模态无关的证据包 E(q)=(g,{(Rs,Fs,Is)}s∈S)。其中 g 是对查询意图的简洁全局摘要,S 表示包含六个语义槽的默认模式:ENTITIES、ATTRIBUTES、ACTIONS、RELATIONS、SCENE 和 KEYDETAILS。对于每个槽,系统提取三个由简短、可验证句子组成的列表:必须成立的必需约束 Rs、必须不成立的禁止约束 Fs 以及不应影响决策的可忽略约束 Is。
为构建该证据包,作者采用免训练的查询到证据挖掘过程,使用单个多模态大语言模型(MLLM)教师模型。首先,对查询进行归一化,以统一暴露其语义内容。文本查询会被语言化,使隐式的视觉细节显式化;图像查询会被转换为文字描述;组合查询则通过将参考图像视为需保留的约束、将修改文本视为更新或禁止的约束来映射。归一化之后,MLLM 在单次结构化生成中输出完整证据包,为所有约束类型生成正面陈述,以确保匹配一致。
挖掘到证据后,框架通过两阶段过程执行以证据为条件的验证和重排序。第一阶段是确定性评分准则,独立评估各候选图像。令 m(⋅,c) 为匹配算子,用于衡量约束句子对候选图像 c 是否成立。槽满足率和违反率计算如下:
Matchs(c)=∣Rs∣1r∈Rs∑m(r,c) Viols(c)=∣Fs∣1f∈Fs∑m(f,c)评分准则将上述比率与禁止性惩罚以及可选的跨模态一致性项聚合:
Srub(c)=s∈S∑ws(Matchs(c)−βViols(c))+γCons(c)其中 β 控制惩罚强度,Cons(c) 衡量组合查询的对齐程度。可忽略约束充当不变性掩码,防止非判别性变化主导分数。
为区分视觉相似候选图像之间的接近判断,第二阶段采用基于证据的列表式细化。向 MLLM 教师模型输入查询、全局意图、必需约束和禁止约束以及排名靠前的候选图像,由其联合处理。教师模型返回细化后的排列,其中满足必需约束的候选排名上升,明显的禁止性不匹配则受到严厉惩罚。实际中,候选图像先按评分准则排序,教师仅对前 M 个候选进行验证和局部重排,以降低计算成本。
除推理外,结构化证据包还可作为可分解的监督信号,用于蒸馏轻量学生重排序器。训练期间,学生模型接收以查询为条件的监督包,其中包括证据包、每个候选的逐槽满足率、校准后的列表式分数 r、自评置信度 p 以及困难样本对集合 H。关键的是,在推理时学生模型仅使用原始查询和候选图像,预测相关性分数 si,无需教师 MLLM 或证据缓存。
蒸馏过程优化三个目标,它们对应监督包中的结构化组成。分数蒸馏通过 KL 散度损失将学生分数 s 与标准化教师分数 r^ 对齐:
Lscore=KL(softmax(r^/τ)∥softmax(s/τ))困难样本对监督对教师标记的样本对施加间隔 δ,并按教师分数差的反比加权,以聚焦于分数接近的竞争者:
Lpair=(i,j)∈H∑wijmax(0,δ−(si−sj))其中 wij=1/(∣ri−rj∣+ϵ)。可选地,逐槽监督通过二元交叉熵训练轻量辅助头,以预测逐槽标签 ys,i:
Lslot=−K∣S∣1i,s∑[ys,ilogy^s,i+(1−ys,i)log(1−y^s,i)]最终训练损失综合这些项,并由教师置信度 p 调节,以降权不确定的监督信号:
L=p⋅(Lscore+λLpair+ηLslot)辅助头在训练后丢弃,确保部署的学生模型保持较低推理开销。
实验
EviRank 在文本到图像、图像到图像和组合检索基准上进行了评估,将结构化证据提取与列表式重排序相结合。结果表明,基于评分准则的证据与列表式比较是互补的,每种槽类型(必需、禁止、可忽略)都有助于细粒度消歧,而证据提取在不同教师模型和提示扰动下保持稳定。蒸馏学生模型高效地继承了这种推理能力,整体提升源于结构化证据模式,而非提示工程。
EviRank 是唯一提供固定、可复用槽分类法的方法,该分类法带有类型化的必需、禁止和可忽略证据,支持确定性的可审计评分以及无需教师模型的蒸馏学生模型。结构化模式在重复运行、提示变化和不同教师模型下产生稳定排序,大部分重排序提升来自逐槽表述,而非提示措辞。六个证据槽几乎正交且互补,捕捉不同的语义维度。只有 EviRank 定义了固定、可复用的槽分类法,并显式包含 FORBIDDEN 和 IGNORABLE 证据类型,使逐槽确定性评分和审计成为可能。结构化证据提取保持高度稳定性:在重复运行、提示扰动和不同教师模型下,Kendall's τ ≥ 0.89,Top-1 一致性 ≥ 91%。逐槽 R/F/I 表述贡献了大部分重排序提升(在 COCO 上 R@1 提升 6.5 个百分点),而自由形式推理仅带来边际收益。六个证据槽之间成对相似度较低(均值 0.18),证实它们捕捉的是互补而非冗余的语义方面。蒸馏学生模型实现高效重排序(每次查询约 800 毫秒),在无需教师模型或证据缓存的运行时条件下,相比 CLIP 检索获得大幅提升。
在 Flickr30k 上,EviRank 各变体相比无重排序基线和以往重排序方法均提升了检索性能,其中 EviRank-plus 在所列出结果中取得最高的 R@1 和 MRR@5。仅使用评分准则的 EviRank-mini 在测试时无需 MLLM 推理仍具竞争力,而完整 EviRank 与 EviRank-plus 进一步带来提升。在相关报告结果中,采用 BLIP-2 骨干的 EviRank-pro 达到 95.61% 的 R@1,比 CoTMR 高 6.32 个百分点。EviRank-plus 取得 Flickr30k 上所列最佳检索性能,R@1 和 MRR@5 均超过所有对比方法。即使仅使用评分准则的 EviRank-mini 也优于测试时未使用 MLLM 推理的先前方法,而更强的 EviRank 变体进一步扩大领先优势。采用 BLIP-2 骨干的 EviRank-pro 在 Flickr30k 上达到 95.61% 的 R@1,比 CoTMR 提高 6.32 个百分点。
在 COCO 上使用 CLIP-ViT-B/32 时,EviRank 各变体一致优于无重排序基线和以往重排序方法。EviRank-pro 达到 64.6% 的 R@1,比 CoTRR 高 6.3 个百分点,即使仅使用评分准则的 EviRank-mini 也在测试时无需 MLLM 推理的情况下超过 CoTRR,表明仅结构化证据就能提供强重排序信号。EviRank-pro 达到 64.6% 的 R@1,比无重排序基线提高 25.2 个百分点,比 CoTRR 提高 6.3 个百分点。仅使用固定评分准则且测试时无 MLLM 的 EviRank-mini 达到 59.9% 的 R@1,优于 CoTRR(58.3%)。
在 SoP 和 CUB-200 上使用 DINOv2 时,重排序和查询扩展方法均比无重排序基线提升了检索 mAP,其中 LoCoRE-small 在报告基线中取得最强 mAP。CUB-200 上以召回为导向的指标在多个重排序器的更深截断处提升更大,而所列基线的 R@1 改进相对有限。所引用的 EviRank-pro 结果在两个数据集上都取得更高 R@1,以显著优势超过 LoCoRE-base。LoCoRE-small 在报告基线方法中于两个数据集上均取得最佳 R@1 和 mAP。所有重排序或查询扩展方法在 SoP 和 CUB-200 上均比无重排序提升了 mAP。在 CUB-200 上,多个基线的更深召回截断(如 R@4)比 R@1 提升更大。据报告,EviRank-pro 在 SoP 和 CUB-200 的 R@1 上以明显优势超过 LoCoRE-base。
在 FashionIQ 上,EviRank 在所有类别中取得最高检索精度,相比先前方法在 Toptee 和 Dress 上的 R@10 提升最大。仅使用评分准则的 EviRank-mini 在无测试时 MLLM 调用的情况下已超过以往基线,而完整 EviRank 进一步带来提升,表明结构化证据与列表式推理是互补的。稳定性实验确认,证据提取在重复运行、提示变化和教师替换下保持鲁棒,仅在使用更便宜教师模型时精度适度下降。EviRank 在 FashionIQ 全部三个类别上取得最佳 R@10,在 Toptee 上比 ImageScope 提高 7.1 个百分点。仅依赖基于评分准则证据的 EviRank-mini 优于 ImageScope,说明无需 MLLM 推理的结构化证据具有价值。将教师模型替换为更便宜模型会使 Toptee R@10 从 42.9 降至 38.3,但仍保持高排序稳定性(Kendall's τ=0.90,Top-1 一致性 91.1%)。EviRank-mini 与 EviRank 之间的差距证实,列表式 MLLM 推理在结构化证据之外提供了互补增益。
在包括 Flickr30k、COCO、SoP、CUB-200 和 FashionIQ 的图像文本检索基准上的实验表明,EviRank 带有必需、禁止和可忽略证据类型的固定槽分类法捕捉到互补的语义维度,结构化逐槽表述贡献了大部分重排序提升,仅使用评分准则的变体在无测试时 MLLM 推理的情况下已优于多个基线。证据提取在重复运行、提示变化和教师替换下表现出高度稳定性,蒸馏学生模型无需在运行时访问教师模型或证据缓存即可实现高效重排序。这些发现证实,确定性的、可审计的基于槽的推理与列表式 MLLM 评分相结合,能够持续提高相对于先前方法的检索精度。