Command Palette
Search for a command to run...
CLaRa: RAGと連続潜在推論
データセット概要
CLaRa Continuous Latent Reasoning Dataset は、Apple が 2025年に公開した、検索強化生成と連続潜在変数推論のためのデータセットです。関連論文は「CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning」で、圧縮されたドキュメント表現下での質問応答タスクにおけるモデルのトレーニングおよび評価データを支援することを目的としています。
このデータセットには、事前学習、指示微調整、エンドツーエンド微調整という3つのカテゴリが含まれており、2WikiMultihopQA、HotpotQA、MuSiQue、Natural Questions など複数の主要な QA ベンチマークの構築用および評価用データを含みます。 データ規模は大きく(10GB〜100GBの範囲)、形式は一貫して JSONL で統一されており、ポジティブサンプルを含む文書(Oracle)と通常の検索シナリオをサポートしています。これは、検索強化生成(RAG)、ドキュメント圧縮、複雑な QA タスクの研究に適しています。
データセット構成
データセットは主に以下の3つのパートで構成され、すべてのデータは JSONL フォーマットで保存されます:
事前学習データ (Pretraining)
ドキュメント圧縮器を学ぶための事前学習データです。含まれるフィールドは次の通りです:
- data_type: データタイプ(例:qa)
- question: 問題リスト
- answers: 回答リスト
- docs: ドキュメントコンテキストリスト
微調整データ (Fine-Tuning Data)
圧縮されたドキュメント表現に基づく QA トレーニング用の指示微調整データです。含まれるフィールドは次の通りです:
- question: 問題文字列
- docs: 取得されたドキュメントリスト
- gold_answer: 正解答え
- answer: モデルが生成した答え
さらに、異なるベンチマークテスト(2wiki, hotpotqa, musique, nq)向けの評価セットも含まれています。これらは、ポジティブサンプルを含む Oracle セッティング(inst_eval_with_pos)と通常の設定(inst_eval_no_pos)に分かれます。
エンドツーエンド微調整データ (End-to-End Tuning Data):エンドツーエンドのモデルトレーニング用の完全なフローデータです。含まれるフィールドは次の通りです:
- question: 問題文字列
- answer: 答え文字列
- docs: 取得されたドキュメントリスト
- pos_index: docs リスト内でのポジティブサンプルインデックス
これもまた訓練セットと評価セットに分かれており、異なるベンチマークテスト(ours_2wiki, ours_hotpotqa, ours_musique, ours_nq)向けに、ポジティブサンプルを含む設定(with_pos)と含まない設定(no_pos)の両方が提供されています。
データセット例
引用
@misc{he2025clarabridgingretrievalgeneration,
title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning},
author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
year={2025},
eprint={2511.18659},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2511.18659},
}