HyperAIHyperAI

Command Palette

Search for a command to run...

HAM-RAG:层次感知的多模态 RAG,实现结构忠实的交错生成

Yin Li Ziyang Hu Zhiyu Guo Xiangyu Liu Wenbin Li Boo-Ho Yang Rav Lawana Ziyue Li Wei Zeng Fugee Tsung

摘要

现有的多模态 RAG 方法通常会将结构化文档扁平化处理,将其拆分为彼此孤立的文本和图像单元,从而削弱文档原有的组织结构,以及实现忠实证据选择与准确放置所需的局部图文逻辑。 为此,我们提出 HAM-RAG,一种面向结构忠实交错生成(structure-faithful interleaved generation)的层次感知多模态 RAG(Hierarchy-Aware Multimodal RAG)框架。HAM-RAG 将文档层次结构作为贯穿检索与生成过程的 grounding 信号,为文本和视觉证据补充上下文信息,并在提示词中保留证据在原文中的位置以及局部图文关系。此外,我们还提出了 HAM-Bench 基准,涵盖 Wukong、Wiki、arXiv 和 Recipe 四类数据,分别覆盖游戏攻略、网页、科学论文以及分步骤的食谱文档等场景。在多个基础模型(backbone)上的实验结果表明,与表现最强的非层次化基线相比,HAM-RAG 在主要多模态平均指标上提升了 17.3%。在 Wukong 数据集上,HAM-RAG 的 Img-CBS 指标提升了 24.2%,表明其在局部图文对齐方面取得了显著改善。 主要实验与消融实验共同表明,文档层次结构是实现忠实图像选择、准确图像放置以及局部图文对齐的关键 grounding 信号。这些研究结果进一步凸显了层次感知 grounding 对构建可靠多模态助手的价值:这类助手能够生成忠实于原始文档组织结构、流程结构以及局部图文证据的回答,尤其适用于技术手册、维护指南和工业标准作业程序(SOP)等结构化文档场景。

一句话总结

来自香港科技大学(广州)、慕尼黑工业大学及合作者的研究人员提出了 HAM-RAG,一个层次感知的多模态检索增强生成框架,利用文档层次作为贯穿检索与生成的定位信号以保留来源位置和局部文本-图像关系,并引入了 HAM-Bench;HAM-RAG 在多个骨干模型上将技术手册和工业 SOP 的主要多模态平均值相较于最强的非层次化基线提高了 17.3%17.3\%17.3%

核心贡献

  • 本文提出了 HAM-RAG,一个层次感知的多模态检索增强生成框架,利用文档层次为文本和视觉证据提供上下文,并在交错生成中保留来源位置和局部文本-图像关系。
  • 本文构建了 HAM-Bench,涵盖 Wukong、Wiki、arXiv 和 Recipe,分别对应游戏攻略、网页、科学论文和分步骤菜谱文档,并带有局部文本-图像对齐元数据。
  • 本文设计了一套评估协议,并报告 HAM-RAG 将主要多模态平均值相较于最强的非层次化基线提升了 17.3%,并在 Wukong 上将 Img-CBS 提升了 24.2%,显示出更强的图像选择、放置和局部文本-图像对齐能力。

引言

多模态检索增强生成(RAG)将语言模型建立于外部文本和视觉来源之上,但许多真实来源是结构化文档,例如科学论文、菜谱和游戏攻略,其中章节层次、步骤顺序以及局部文本-图像关系决定证据是否被正确使用。先前的多模态 RAG 方法主要检索扁平化的段落和图像,因此通常只保留全局语义相关性,可能选择局部对齐较弱或位置不正确的图像。作者通过定义结构忠实的多模态 RAG 并提出 HAM-RAG 来解决这一问题:该框架为文本证据编码标题和章节上下文,为图像保留文档位置、图注、附近文本以及上下文感知的视觉描述;他们还引入了 HAM-Bench,用于评估结构化文档上的检索充分性、图像选择、图像-上下文对齐和答案质量。

数据集

数据集:HAM-Bench

  • 组成和来源

    • HAM-Bench 是一个保留层次的多模态基准,包含四个结构化文档子集:Wukong、Wiki、arXiv 和 Recipe。
    • Wukong 由公开可获取的 Black Myth: Wukong 游戏攻略构建而成。它自然包含章节级层次、密集的交错视觉证据,并需要多文档推理。
    • Wiki 可追溯至 WikiWeb2M 页面。其层次较浅,图像较少。
    • arXiv 由使用 MinerU 解析为按章节组织的 Markdown 的原始 PDF 构建而成。它具有较深的章节层次和密集的视觉内容。
    • Recipe 由原始菜谱文档重组为分步骤的层次化流程构建而成。它强调步骤顺序和局部文本-图像对齐。
  • 处理与结构恢复

    • 作者显式保留文档层次,而不是将文档扁平化。
    • 对于重建的子集,恢复了原始来源中已有的结构,包括标题、章节边界、图注链接和操作步骤。
    • 当来源文档在先前资源中原本被扁平化时,HAM-Bench 会重建文档边界、章节结构以及局部文本-图像对齐。
    • 该基准支持层次感知检索和交错文本-图像生成。
  • 数据使用方式

    • HAM-Bench 用于评估多模态检索增强生成是否能够在结构化文档中保持上下文组织和文本-图像逻辑。
    • 它面向共享检索与生成设置下的结构感知多模态 RAG 评估而设计。
    • 所提供的材料未指定训练划分或混合比例;其将 HAM-Bench 描述为评估基准,而非训练数据集。

方法

作者提出了 HAM-RAG,一个面向层次化多模态文档的检索增强生成框架。与将段落和图像视为孤立块的扁平化 RAG 流程不同,HAM-RAG 将文档层次作为证据表示、检索和提示构建中的共享信号。该框架主要分为两个阶段:离线层次感知索引阶段,以及在线多模态检索与生成阶段。

层次感知的文档表示

D={D1,...,DN}\mathcal{D} = \{D_1, ..., D_N\}D={D1,...,DN} 表示结构化多模态文档的语料库。每个文档被解析为层次树 TD=(VD,ED)T_D = (V_D, E_D)TD=(VD,ED),其中内部节点表示文档、节、小节或操作步骤,叶节点表示可检索的文本和图像单元。边编码父子关系。层次从文档标记、标题级别、编号模式、图注链接、布局线索和来源顺序中恢复。

对于每个可检索的叶单元,框架构建一个结构化证据对象:

ei={xi,mi,pi,ai,li,ri}e_i = \{x_i, m_i, p_i, a_i, l_i, r_i\}ei={xi,mi,pi,ai,li,ri}

其中 xix_ixi 是原始文本或图像内容,mim_imi 是其模态,pip_ipi 是从文档根节点到该单元的路径,aia_iai 包含祖先标题和章节上下文,lil_ili 包含附近的文本-图像上下文,rir_iri 记录该单元与周围证据的局部关系。例如,rir_iri 可以表示某张图像说明了当前操作步骤,或支持前一段落。这种表示在检索前显式给出了每个证据单元的语义范围和局部角色。

离线证据构建与索引

在离线阶段,框架处理文本和图像单元以构建层次感知向量库。对于文本单元,HAM-RAG 将原始内容与文档标题、标题路径、章节上下文和邻近证据一起序列化为层次感知的文本表示。这保留了原始措辞,同时暴露出区分主题相似但属于不同章节或步骤的段落所需的结构上下文。

对于图像单元,框架保留其来源位置、标题路径、图注或替代文本,以及附近的文本上下文。它还生成一种上下文感知的视觉描述,该描述同时以图像及其周围文档证据为条件。该描述补充稀疏或缺失的图注,并帮助将视觉内容与其所在章节或流程连接起来。随后,文本和图像证据被序列化为按字段组织的嵌入提示,进行嵌入,并存储在共享向量库中,同时带有文档标识符、来源位置、模态和图像引用等来源元数据。因此,层次通过索引表示作用于检索,而不是仅在检索后附加。

在线检索与交错生成

在在线阶段,框架接收用户查询,并在独立预算 ktk_tktkvk_vkv 下检索排名靠前的文本和视觉证据。HAM-RAG 保留每个命中项的相关性分数、来源标识符、文档位置、层次感知内容以及局部文本-图像关系。保留这些字段使来自不同文档或章节的证据在生成过程中保持可区分。

选定的证据被组装为结构化提示:

Pham=Assemble(q,E)P_{\text{ham}} = \text{Assemble}(q, \mathcal{E}^*)Pham=Assemble(q,E)

其中 E\mathcal{E}^*E 包含排序后的文本和图像证据。文本块暴露基于来源的标题和邻近上下文,图像块包括图像引用、图注或替代文本、来源位置以及上下文感知描述。因此,生成器不仅获得相关内容,还获得所需的局部组织结构,以决定哪张图像支持哪条陈述,以及该图像应放置在哪里。这样,层次参与两次:在离线阶段塑造检索表示,在在线阶段指导证据组织和交错的文本-图像生成。

实验

实验在 HAM-Bench 基准上评估 HAM-RAG,该基准涵盖四种结构化文档类型并具有互补挑战,并在相同的检索与生成预算下与基于 LLM、基于 MLLM 和基于规则的基线进行比较。HAM-RAG 在多个骨干模型上持续改善检索和多模态生成,视觉定位和局部文本-图像对齐的收益最明显,同时消融实验显示图像侧和文本侧的层次都有贡献。鲁棒性结果进一步表明,相较于其他生成流程,层次感知结构化实现极少失败且推理成本合理。

HAM-Bench 是比较中唯一完全支持多模态证据、交错文本-图像答案生成、显式文档结构保留、从扁平化来源重建以及层次感知评估的基准。现有多模态 QA 和 RAG 基准要么缺乏这些特性,要么仅部分支持结构和重建,且没有一个包含层次感知评估。所引用的实验结果还表明,层次感知检索和生成相较于非层次化基线改善了视觉定位和局部文本-图像对齐。HAM-Bench 是比较中唯一完全支持结构保留、从扁平化来源重建和层次感知评估的基准。先前基准至多具有部分结构或重建支持,且没有层次感知评估;层次感知生成还改善了视觉定位和局部文本-图像对齐。

HAM-Bench 涵盖四种文档类型,具有互补的结构特征。学术文档具有较深的章节层次和密集的视觉内容,游戏攻略将多文档推理与步骤对齐相结合,菜谱提供大规模的分步骤示例,网页的视觉证据相对稀疏。学术子集的视觉密度最高、结构层次最深,每篇文档包含许多内嵌图像和大量较低层标题。游戏攻略子集需要多文档和步骤推理,并在每个答案中提供最多的图像证据。菜谱子集贡献了最多的文档和问题,同时保持适度的面向流程的图像使用。网页子集每篇文档的图像最稀疏,每个答案大约只有一张图像,因此图像选择的区分度较低。

HAM-RAG 在所有匹配的生成器骨干上都改善了相较于非层次化基线的多模态生成,平均 MM Avg. 从 54.68 提升到 64.12,相对提升 17.3%。局部图像-上下文对齐的收益最大,尤其在 Wukong 上,而 Wiki 在图像选择上区分度较低,因为单参考图像问题常常使 Img-F1 饱和。总体而言,层次感知的证据组织增强了视觉定位和局部文本-图像对齐。在所有九个匹配骨干上,HAM-RAG 实现了比基于 LLM 的对应方法更高的 MM Avg.,平均相对提升 17.3%。最强的局部对齐收益出现在 Wukong 上,最佳 Img-CBS 相较于最强的非层次化基线提升了 24.2%。Recipe 和 arXiv 上的收益表明,结构上下文有助于将图像与相关的流程文本或章节文本关联起来,而不仅仅是检索主题相关图。Wiki 在图像选择上区分度较低,因为单参考图像问题常常使 Img-F1 饱和,因此其结果应结合 Img-CBS 和质量分数来解读。

HAM-RAG 在所有评估子集上都改善了相较于共享基线的文本检索,并在四个子集中的三个上改善了图像检索。唯一的例外是 arXiv,在图像密集环境中,扁平检索保留更多图并能获得更高的图像召回率;这并不削弱该方法更强的局部文本-图像对齐。Wiki 的图像检索区分度较低,因为单参考图像常常使图像级覆盖率饱和,因此其结果更适合结合其他视觉定位指标来解读。HAM-RAG 在全部四个子集上均优于共享文本检索基线,同时在 Wukong、Wiki 和 Recipe 上也取得了更好的图像检索。唯一的图像检索例外是 arXiv,共享基线的扁平检索返回更多图,但召回率并不衡量这些图是否与正确的局部文本对应。

在所有被评估基准中,HAM-Bench 是唯一完全支持多模态证据、交错文本-图像答案、文档结构保留、从扁平化来源重建和层次感知评估的基准,并涵盖四种互补的文档类型。实验在这些子集上比较了层次感知 HAM-RAG 和非层次化基线,并显示多模态生成和视觉定位持续提升,特别是在局部文本-图像对齐以及流程或章节图像关联方面。文本检索在每个子集上都有改善,图像检索在四个子集中的三个上有所改善;唯一的例外是图像密集的 arXiv,扁平检索返回更多图,但不能确保这些图与正确的局部文本对齐。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供