Command Palette
Search for a command to run...
CLaRa 连续潜变量推理数据集
数据集概述
CLaRa 连续潜变量推理数据集是由 Apple 于 2025 年发布的一个用于检索增强生成与连续潜变量推理的数据集,相关论文成果为「CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning」,旨在提供训练和评估数据以支持模型在压缩文档表示下的问答能力。
该数据集包含预训练、指令微调以及端到端微调三大类别的数据,涵盖多种主流问答基准(如 2WikiMultihopQA, HotpotQA, MuSiQue, Natural Questions)的构建与评估集。 数据规模较大(10G-100G区间),格式统一为 JSONL,支持正例文档(Oracle)与正常检索场景,适用于研究检索增强生成(RAG)、文档压缩及复杂问答任务。
数据集组成
数据集主要包含以下三个部分,所有数据均以 JSONL 格式存储:
预训练数据 (Pretraining)
用于学习文档压缩器的预训练数据。包含字段:
- data_type: 数据类型(如 qa)
- question: 问题列表
- answers: 答案列表
- docs: 文档上下文列表
微调数据 (Fine-Tuning Data)
用于基于压缩文档表示进行问答训练的指令微调数据。包含字段:
- question: 问题字符串
- docs: 检索到的文档列表
- gold_answer: 标准答案
- answer: 模型生成的答案
此外,还包含针对不同基准测试(2wiki, hotpotqa, musique, nq)的评估集,分为包含正例文档的 Oracle 设置(inst_eval_with_pos)和正常设置(inst_eval_no_pos)。
端到端微调数据 (End-to-End Tuning Data):用于端到端模型训练的完整流程数据。包含字段:- question: 问题字符串
- answer: 答案字符串
- docs: 检索到的文档列表
- pos_index: 正例文档在 docs 列表中的索引
同样分为训练集和评估集,且针对不同的基准测试(ours_2wiki, ours_hotpotqa, ours_musique, ours_nq)提供了包含正例(with_pos)和不包含正例(no_pos)两种设置。
数据集示例
Citation
@misc{he2025clarabridgingretrievalgeneration,
title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning},
author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
year={2025},
eprint={2511.18659},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2511.18659},
}