HyperAIHyperAI

Command Palette

Search for a command to run...

CLaRa 连续潜变量推理数据集

日期

数据集组织

论文 URL

2511.18659

许可证

MIT

数据集概述

CLaRa 连续潜变量推理数据集是由 Apple 于 2025 年发布的一个用于检索增强生成与连续潜变量推理的数据集,相关论文成果为「CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning」,旨在提供训练和评估数据以支持模型在压缩文档表示下的问答能力。

该数据集包含预训练、指令微调以及端到端微调三大类别的数据,涵盖多种主流问答基准(如 2WikiMultihopQA, HotpotQA, MuSiQue, Natural Questions)的构建与评估集。 数据规模较大(10G-100G区间),格式统一为 JSONL,支持正例文档(Oracle)与正常检索场景,适用于研究检索增强生成(RAG)、文档压缩及复杂问答任务。

数据集组成

数据集主要包含以下三个部分,所有数据均以 JSONL 格式存储:

预训练数据 (Pretraining)

用于学习文档压缩器的预训练数据。包含字段:

  • data_type: 数据类型(如 qa)
  • question: 问题列表
  • answers: 答案列表
  • docs: 文档上下文列表

微调数据 (Fine-Tuning Data)

用于基于压缩文档表示进行问答训练的指令微调数据。包含字段:

  • question: 问题字符串
  • docs: 检索到的文档列表
  • gold_answer: 标准答案
  • answer: 模型生成的答案

此外,还包含针对不同基准测试(2wiki, hotpotqa, musique, nq)的评估集,分为包含正例文档的 Oracle 设置(inst_eval_with_pos)和正常设置(inst_eval_no_pos)。

端到端微调数据 (End-to-End Tuning Data):用于端到端模型训练的完整流程数据。包含字段:- question: 问题字符串

  • answer: 答案字符串
  • docs: 检索到的文档列表
  • pos_index: 正例文档在 docs 列表中的索引

同样分为训练集和评估集,且针对不同的基准测试(ours_2wiki, ours_hotpotqa, ours_musique, ours_nq)提供了包含正例(with_pos)和不包含正例(no_pos)两种设置。

数据集示例
数据集示例

数据集示例

Citation

@misc{he2025clarabridgingretrievalgeneration,
      title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning}, 
      author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
      year={2025},
      eprint={2511.18659},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2511.18659}, 
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供