Command Palette
Search for a command to run...
超越相关性中心的检索:面向评分标准的文档集选择与排序
超越相关性中心的检索:面向评分标准的文档集选择与排序
摘要
随着大语言模型和 AI 智能体成为搜索结果的主要消费者,文档集质量决定了后续生成效果的上限。然而,现有评测体系仍局限于独立地对文档打分并通过 nDCG 进行聚合,忽略了文档间的交互(如冗余、冲突、互补),也无法回答是什么让一个文档集优于另一个文档集。针对这些问题,我们提出了一个完整的“评测—诊断—优化”框架。我们设计了 SETWISEEVALKIT,一个涵盖短文本和长文本场景的三层级、九维度文档集评测基准,包含约 28K 条高质量评测评分标准。我们对 12 种重排序方法进行了系统评测:即使是最优方法,其覆盖率也不超过 45%,跨文档协调维度普遍薄弱,且没有一种方法能在两种场景下同时保持顶尖性能。在此基础上,我们提出了 RUBRIC4SETWISE,一种无需训练的方法,它将基于评分标准的评测准则转化为文档集选择信号,以更少的文档和搜索轮次实现了最优的下游生成性能。它是唯一在两种场景下均保持领先结果的方法,验证了从评测到优化闭环的有效性。
一句话总结
来自中国科学技术大学、腾讯等机构的研究者提出了一个完整的评估-诊断-优化框架,引入了 SETWISEEVALKIT 基准和 RUBRIC4SETWISE,这是一种无需训练的方法,将基于评分标准的评估准则转化为文档集选择信号,在短格式和长格式场景下均以更少的文档实现了最先进的下游生成。
核心贡献
- SETWISEEVALKIT 是一个三级九维的文档集评估基准,覆盖短格式和长格式场景,提供约 28,000 个高质量评估标准。
- 对 12 个重排序器的系统评估表明,最佳方法的覆盖率最高仅为 45%,跨文档协调维度普遍较弱,且没有单一方法在两种设置下都能保持顶级性能。
- RUBRIC4SETWISE 是一种无需训练的方法,将基于评分标准的评估准则转化为文档集选择信号,在更少文档和搜索轮次下实现最佳下游生成,且是唯一在两种场景中均达到最先进水平的方法。
引言
随着检索增强生成(RAG)的广泛采用,检索到的文档集被直接送入大型语言模型,因此文档集的质量决定了生成的上限。然而,现有的评估基准将文档孤立处理,仅评分相关性并用 nDCG 聚合,忽略了冗余、冲突和互补性等关键的文档间交互。作者针对这一缺口提出了 SETWISEEVALKIT,这是一个多维评估框架,在三个粒度层级和九个维度上评估文档集,并证明其基于评分标准的信号可以转化为一种无需训练的选择方法(RUBRIC4SETWISE),以更少的文档和搜索轮次实现更好的生成。
数据集
作者构建 SETWISEEVALKIT 作为评估文档集质量的基准数据集,而非用于模型训练。它提供 query-answer 对和多维评分标准,判断一个文档集对回答查询的支持程度。
数据集构成与来源
- 短格式子集: 2,061 个 QA 样本,来自多跳 QA 数据集。
- 来源:HotpotQA、2WikiMultihopQA、MuSiQue(各 2,000 个)和 Bamboogle(全部 125 个实例)。
- 候选检索:对于每个查询,BM25 检索前 20 篇维基百科文档作为候选池。若 BM25 未能检索到足够相关文档,则丢弃该查询,最终得到 2,061 个高质量实例。
- 长格式子集: 从 ResearchQA 中随机选取的 200 个样本。
- 候选检索:一个开源搜索 agent(DR.Tulu-8B)使用 Google 搜索 API 进行多轮轨迹;重排序器作为工具包裹,每次检索轮次后应用。
评分标准构建(元数据)
- 每个 query-answer 对搭配一组评估评分标准,覆盖三个层级九个维度:
- 文档级: 相关性、真实性、质量。
- 集合级: 互补性、冗余性、冲突性。
- 全局级: 完整性、密集度、可达性。
- 生成过程:两个前沿 LLM(GPT 5.1 和 Gemini 3.1-Pro-Preview)独立生成候选评分标准问题,必须引用查询和答案中的特定实体、事实或数值。第三个模型(DeepSeek-V4 Pro)聚合并过滤这些候选,去除重复和低质量项。
- 最终评分标准数量:短格式子集约 24,000 个,长格式子集约 4,000 个。
数据使用方式
- 数据集用于评估不同重排序器产生的文档集。对于给定查询,多个重排序器各自从候选池中选取子集,评分标准系统整体衡量集合质量,而非独立评分文档。
- 人工验证(每个场景随机抽取 50 个样本)确认聚合评分标准具有高区分度:约 70% 被评为高区分度或关键区分度,约 77% 在移除后引起中等或显著排序变化,证明评分标准能可靠地区分文档集的优劣。
- 没有训练集划分;数据仅作为文档集质量指标的评估基准。
实验
评估设置定义了一个多维评分标准框架,覆盖文档级、集合级和全局级质量,应用于短格式多跳 QA 和长格式多轮搜索场景,使用基于 LLM 的评分标准生成和评判。实验验证,集合级重排序方法在短格式设置中占主导,而推理增强方法在长格式中领先,但所有重排序器在互补性和完整性等文档间协调维度上都表现困难。所提出的无需训练的集合选择方法 RUBRIC4SETWISE,将评分标准作为选择信号,在两种场景下均实现最佳下游生成性能,同时所需文档更少。案例研究进一步表明,基于评分标准的评估能捕捉到传统成对相关性指标遗漏的集合级协调弱点。
所有现有的检索评估基准都只在单轮文档级操作,且仅覆盖相关性维度。它们缺乏集合级粒度、多轮评估以及互补性、冗余性或冲突性等任何跨文档维度,在检索评估中留下结构性盲点。每一个基准(TREC-DL、BEIR、MTEB、RAGAS、ARES、BRIGHT)都以 nDCG 或 LLM 评判进行文档级评分,忽略文档在集合内的交互方式。仅覆盖相关性维度;互补性、冗余性、冲突性、完整性和密集度等维度在现有评估框架中完全缺失。没有任何基准支持多轮或集合级评估,使得它们无法捕捉对下游生成有影响的质量特征。
即时重排序器在纯 BM25 检索基础上有所改进,但在互补性和完整性等集合级协调维度上得分仍很低,冲突性是它们唯一相对较强的维度。集合级重排序方法 SetR 和 Rank4Gen 在短格式性能上领先,但没有任何重排序器在所有评分标准维度上一致表现优异,揭示了短格式与长格式场景间泛化的差距。集合级重排序方法 SetR 和 Rank4Gen 达到短格式整体最高分,优于所有即时和推理增强重排序器。即时重排序器相对于 BM25 检索只有适度提升,但在互补性和完整性等跨文档协调维度上表现出明显弱点,而冲突性仍是得分最高的集合级维度。所有评估的重排序器在除冲突性外的大多数维度上表现不佳,没有单一方法在短格式和长格式设置中都出色,表明存在泛化缺陷。
在长格式场景中,推理增强重排序器取得最高的整体覆盖率分数,优于即时和集合级方法。所有评估方法在大多数维度上得分都很低,冲突性是唯一得分相对较高的维度,而互补性和完整性等集合级协调维度仍显著不足。推理增强重排序器在长格式场景领先,集合级方法在短格式设置中占主导,暴露出泛化差距,即没有单一方法在两种场景中均表现优异。所有重排序器的冲突性得分一致较高(范围 86.49 至 90.77),而互补性得分保持低位(范围 23.41 至 25.20),突显了对跨文档协调建模的系统性失败。整体覆盖率分数与下游生成性能之间的强正相关(皮尔逊 r=0.92)验证了更高的评分标准覆盖率能转化为更好的答案质量。
RUBRIC4SETWISE,一种评分标准引导的文档选择方法,在短格式和长格式两种场景下都取得了最佳下游回答性能,优于所有现有重排序器。它选择紧凑且充分的文档子集,在短格式任务中使用的文档远少于传统重排序器固定的 top-5,在长格式任务中使用的独特文档也显著少于第二优方法,同时提升回答质量。在短格式场景中,RUBRIC4SETWISE 取得了最高的完全匹配和 F1 分数,以明显优势超过次优的 SetR,平均仅使用 2.66 个文档,远少于其他重排序器使用的标准五个文档。在长格式场景中,RUBRIC4SETWISE 获得最高的 LLM 评判分数,优于 ReasonRank 和 Rearank,仅使用 20.52 个独特文档,明显少于 SetR 的 29.23。
现有的检索基准仅评估单轮文档级相关性,忽略互补性和冲突性等集合级维度。实验表明,即时、集合级和推理增强重排序器在跨文档协调方面都表现困难,且没有单一方法能在短格式和长格式设置间泛化。一种评分标准引导的选择方法 RUBRIC4SETWISE 在两种场景下始终取得最佳下游回答质量,同时使用更少的文档。