HyperAIHyperAI

Command Palette

Search for a command to run...

基于目标感知数据对齐的细粒度食物图像理解

Jui-Feng Chi Wei-Lun Chu Bruce Coburn Jinge Ma Fengqing Zhu

摘要

细粒度食物视觉–语义理解要求模型能够捕捉食材、烹饪方式、熟度、颜色、纹理和摆盘等方面的细微差异。尽管 CLIP 风格的视觉–语言模型为这一任务提供了自然的框架,但当训练依赖于从网络收集的异构图文对时,其效果会受到限制。这类数据往往存在网络域到目标域的差距以及跨模态错位问题,即图像偏离目标分布,而文本描述则充满噪声、多语言混杂或与视觉内容关联薄弱。本文提出一种面向细粒度食物描述与识别的数据中心化多模态对齐方法。该方法首先执行目标感知的数据筛选,以识别视觉相关的训练子集,随后应用基于视觉–语言模型的文本精炼,生成视觉锚定且符合目标风格的描述。利用这些经过整理的图文对,我们训练互补的 CLIP 风格检索专家,并进一步通过一种分层的视觉–语言模型辅助的多专家决策级融合策略来整合它们的判断,该策略仅在专家意见不一致时才调用视觉–语言模型。实验表明,与简单的网络监督相比,我们的数据精炼策略显著提升了检索性能,仅基于视觉–语言模型的文本精炼就带来了约 19% 的平均性能增益。我们的完整方法还取得了超过纯视觉–语言模型检索两倍的检索得分,同时保持了显著更高的效率。

一句话总结

普渡大学的研究人员提出了一种以数据为中心的多模态对齐方法,用于细粒度食物图像理解。该方法利用目标感知数据选择和基于VLM的标题细化来训练互补的CLIP式检索专家,然后通过层级化的VLM辅助多专家决策级融合策略融合它们的决策,仅在专家意见不一致时调用VLM,检索得分达到纯VLM检索的两倍以上,同时保持显著的效率优势。

核心贡献

  • 目标感知数据选择识别出接近目标分布的网络图像,并且在原始网络监督下,精心挑选的5k子集优于简单的25k子集。
  • 基于VLM的标题细化将嘈杂的网络标题替换为具有视觉依据、目标风格的描述,平均检索性能提升约19%。
  • 一种层级化的多专家决策级融合策略结合互补的检索专家,并在预测不一致时才调用VLM,检索得分达到纯VLM检索的两倍以上,同时显著降低VLM资源消耗。

引言

食物图像理解要求对食材、烹饪方法、质地和摆盘组成进行细粒度识别,这对饮食监测、营养分析和食品安全至关重要。尽管像CLIP这样的对比视觉-语言模型可以对齐图像和描述性文本,但它们在食物数据上的表现受到嘈杂、异构的网络收集训练对的严重限制,这些训练对存在跨模态不对齐以及源域与目标域之间的分布差异。作者通过优先考虑数据质量而非模型架构来解决这一问题,提出了一个三阶段以数据为中心的多模态对齐策略:目标感知数据选择,用于筛选紧凑且相关的网络图像子集;基于VLM的标题细化,将嘈杂的标题替换为具有视觉依据的描述,带来约19%的性能提升;以及层级化的多专家决策级融合,结合互补的检索专家,仅在预测不一致时调用VLM,检索得分达到纯VLM方法的两倍以上,同时大幅降低资源消耗。

数据集

作者从网络图像中构建训练数据集,使用目标感知选择和VLM标题细化来弥合源网络数据与目标检索分布之间的差距。

  • 数据集组成与来源:基础池是网络图像(可能是食物图像)的集合。未标注的测试集(目标图像)仅用于计算目标原型,不用于训练。最终数据集由两个各含5k张图像的精选子集组成,并使用VLM生成了细化的标题。

  • 子集1:Nearest-5k

    • 规模:5,000张图像。
    • 来源:根据与目标原型的余弦相似度排序的网络图像。
    • 筛选:CLIP图像编码器计算所有目标图像的归一化嵌入,形成平均质心(目标原型)。每张网络图像通过其与该原型的余弦相似度进行评分,保留前5k张图像。
    • 目的:使训练数据与目标视觉分布紧密对齐,减少域偏移。
  • 子集2:Random-5k

    • 规模:5,000张图像。
    • 来源:从同一网络图像池中均匀采样。
    • 筛选:不进行目标相似度优化,保留更广泛的多样性。
    • 目的:为后续融合提供互补的专家预测。
  • 标题细化:对于每个选定的图像(在两个子集中),作者使用VLM Gemma 4生成新的英文标题。该VLM以未配对的目标域标题作为上下文示例,并指示仅描述可观察的食物细节(食材、质地、颜色等)。输出经过清理(去除前缀、引号、格式伪影),得到简洁的食物标题。

  • 数据使用方式:精选的图像-标题对用于训练单独的检索专家——一个在Nearest-5k上训练,一个在Random-5k上训练。随后通过多专家决策级融合组合这些专家。未详细说明裁剪或额外元数据构建;关键处理是目标感知选择和标题重新生成。

方法

作者提出了一种三阶段以数据为中心的多模态对齐方法,旨在减少网络收集训练数据中的源-目标视觉分布差异和图像-文本语义不对齐,并针对食物图像到文本检索进行了实例化。

参考框架图:

在第一阶段,目标感知数据选择中,作者选择在视觉上更接近测试时检索分布的网络图像。他们使用图像原型概括目标视觉分布。给定一个固定的预训练CLIP图像编码器 gI()g_I(\cdot)gI() 和未标注的测试图像 {xjtar}j=1N\{x_j^{\mathrm{tar}}\}_{j=1}^N{xjtar}j=1N,他们计算平均归一化目标原型:

ptar=1Nj=1NgI(xjtar)gI(xjtar)2.p_{\mathrm{tar}} = \frac{1}{N} \sum_{j=1}^{N} \frac{g_I(x_j^{\mathrm{tar}})}{\|g_I(x_j^{\mathrm{tar}})\|_2}.ptar=N1j=1NgI(xjtar)2gI(xjtar).

对于每张网络图像 xiwebx_i^{\mathrm{web}}xiweb,其与目标原型的相似度按如下方式计算:

ri=(gI(xiweb)gI(xiweb)2)ptarptar2.r_i = \left(\frac{g_I(x_i^{\mathrm{web}})}{\|g_I(x_i^{\mathrm{web}})\|_2}\right)^\top \frac{p_{\mathrm{tar}}}{\|p_{\mathrm{tar}}\|_2}.ri=(gI(xiweb)2gI(xiweb))ptar2ptar.

根据 rir_iri 降序排列网络图像,保留前5k张图像作为Nearest-5k子集。此外,通过随机采样5k张图像构建Random-5k子集,以保留更广泛的多样性并提供互补信号。

在第二阶段,基于VLM的标题细化中,作者通过使用VLM重新生成标题来解决嘈杂的网络标题问题。利用未配对的目标标题作为上下文示例,提示VLM描述可观察的食物细节,从而生成精选的图像-标题对 (xiweb,t^ivlm)(x_i^{\mathrm{web}}, \hat{t}_i^{\mathrm{vlm}})(xiweb,t^ivlm)

在第三阶段,检索专家构建中,使用两个骨干网络(DFN5B 和 MetaCLIP 2)在两个精选子集(Nearest-5k 和 Random-5k)上训练四个CLIP式检索专家。每个专家均使用对称的InfoNCE损失进行训练。

最后,在层级化VLM辅助多专家决策级融合阶段,作者将四个专家的预测进行组合。不是简单的投票,而是由VLM解决预测分歧。如果两个专家的预测一致,则保留该共同预测;否则,VLM会审查图像和分歧。对于单标题检索,VLM选择更匹配的标题。对于多标签食材识别,保留共同食材,而争议食材通过视觉是/否问题进行解决。这种融合是层级化进行的:两个DFN5B专家的预测融合为一个输出,两个MetaCLIP 2专家的预测融合为另一个输出。然后使用相同的VLM辅助规则组合这两个融合输出,得到最终预测。

实验

在Dishcovery挑战测试集上的评估结合了多食材识别和标题检索,比较了CLIP微调策略,并表明基于VLM的标题细化对于克服嘈杂的网络标题至关重要,同时紧凑的目标对齐数据集(Nearest-5k)提供了足够的监督。完整方法层级化融合四个检索专家,并使用VLM进行决策级分歧解决,将官方得分提升至0.653,超越了最佳单一专家和直接VLM检索,同时大幅降低了token使用量。定性分析确认,数据选择和标题细化有效地弥合了源域和目标域之间的视觉和语义差距。

基于VLM的标题细化在所有微调方法中都大幅提升了性能,而结合细化标题后,最近邻数据选择进一步带来了增益。对于DFN5B骨干,使用最近5k样本和VLM标题进行最后几层微调取得了最佳结果,一旦标题清理完毕,紧凑的5k子集就已足够。在MetaCLIP 2上,完全微调的性能与LoRA相当,使其成为简单且可复现的选择。用VLM生成的标题替换原始网络标题在所有微调方法中均持续改善得分,每种设置下都观察到较大的绝对提升。Nearest-5k数据选择优于随机采样,将最近选择与VLM标题结合可获得最高的单专家得分。在VLM细化标题的情况下,5k子集就已足够,数据量增加到25k没有带来进一步改善,表明标题质量是主要驱动因素。对于DFN5B,最后几层微调是最有效的方法;而在原始标题下表现优异的WiSE-FT,在标题清理后则被完全微调和最后几层微调所超越。在MetaCLIP 2上,完全微调与LoRA性能相当,因此出于简单性和可复现性选择完全微调。

完整方法取得了0.653的检索得分,比纯VLM检索提高了0.427分,同时仅需610万VLM token,而纯VLM需要4.312亿token。这种有针对性的VLM专家使用带来了更高的准确率和显著的token效率,尽管硬件不同,推理时间也降低了一个数量级。完整方法将检索得分从0.226提高到0.653,绝对提升了0.427分。VLM token消耗从4.312亿降至610万,降幅超过98%。

选择与目标分布视觉上最相似的5k训练图像(Nearest-5k)并结合VLM生成的标题,为两个骨干网络带来了最佳的检索性能,超越了随机采样和更大的25k选择。结果表明,紧凑的目标对齐子集提供了足够的监督,而将选择扩展到25k没有带来任何好处,甚至可能降低性能。Nearest-5k选择策略将DFN5B的得分从0.599(随机)提高到0.607,而MetaCLIP 2从0.584小幅提升至0.587。使用视觉相似度最高的25k子集并未改善性能,对于DFN5B甚至下降至0.581,表明小规模精选数据集就足够了。目标驱动的视觉相似度选择对DFN5B的收益比对MetaCLIP 2更大,后者在随机采样下已经表现不错。

VLM生成的标题持续改善微调性能,选择与目标分布视觉上最相似的5k训练图像并结合这些细化标题能获得最佳结果。对于DFN5B模型,在这个紧凑子集上最后几层微调最为有效;而对于MetaCLIP 2,采用完全微调,因为它与LoRA性能相当且更易于复现。完整方法在取得大幅检索精度提升的同时,VLM token消耗减少了98%以上,证实了标题质量和有针对性的数据策划是主要驱动因素,并且一个小型精选数据集就足够了,无需使用更大的数据。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供