Command Palette
Search for a command to run...
CLaRa : RAG Et Raisonnement Latent Continu
Date
URL du document
Licence
MIT
Aperçu du jeu de données
Le jeu de données CLaRa pour le raisonnement sur les variables latentes continues est publié par Apple en 2025. Il s’agit d’un ensemble dédié au Raisonnement Assisté par la Récupération (Retrieval-Augmented Generation, RAG) et au raisonnement sur des variables latentes continues. La publication scientifique associée se trouve ici : « CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning ». L’objectif principal est de fournir des données d’entraînement et d’évaluation afin de soutenir les capacités de réponse aux questions des modèles lorsque les représentations documentaires sont compressées.
Ce jeu de données comprend trois grandes catégories de données : pré-entraînement, ajustement fin supervisé (instruction tuning) et ajustement fin de bout en bout. Il couvre plusieurs benchmarks majeurs de réponses aux questions (tels que 2WikiMultihopQA, HotpotQA, MuSiQue et Natural Questions), tant pour leur construction que pour l’évaluation.
La taille des données est importante (comprise entre 10 Go et 100 Go). Le format est uniformément JSONL. Les jeux incluent à la fois des documents positifs (référence absolue ou Oracle) et des scénarios de récupération classiques. Ils conviennent idéalement à la recherche dans les domaines du RAG, de la compression documentaire et des tâches complexes de réponse aux questions.
Composition du jeu de données
Le jeu de données se compose principalement des trois parties suivantes, toutes stockées au format JSONL :
Données de pré-entraînement (Pré-training)
Ces données servent à apprendre le compresseur de documents. Elles contiennent les champs suivants :
data_type: type de donnée (par exemple,qa)question: liste de questionsanswers: liste de réponsesdocs: liste de contextes documentaires
Données d’ajustement fin (Fine-Tuning Data)
Données d’ajustement fin basées sur des instructions, destinées à entraîner les modèles à répondre aux questions à partir de représentations documentaires compressées. Champs inclus :
question: chaîne contenant la questiondocs: liste de documents récupérésgold_answer: réponse de référence (vérité terrain)answer: réponse générée par le modèle
En outre, ce volet intègre également des sous-ensembles d’évaluation conçus pour différents benchmarks (2wiki, hotpotqa, musique, nq). Ces évaluations distinguent deux configurations : une configuration avec documents positifs (dite "Oracle", marquée inst_eval_*_with_pos) et une configuration standard sans ces documents positifs explicites (marquée inst_eval_*_no_pos).
Ajustement fin de bout en bout (End-to-End Tuning Data) : Données complètes couvrant tout le flux nécessaire à l’entraînement de modèles de bout en bout. Champs inclus :
question: chaîne contenant la questionanswer: chaîne contenant la réponsedocs: liste de documents récupéréspos_index: index du document positif dans la listedocs
Cette catégorie est elle aussi divisée en ensembles d’entraînement et d’évaluation. Elle propose deux configurations selon qu’il y ait inclusion ou non de documents positifs (with_pos / no_pos) pour divers benchmarks spécifiques développés dans cette étude (ours_2wiki, ours_hotpotqa, ours_musique, ours_nq).
Exemple de jeu de données
Référence bibliographique
@misc{he2025clarabridgingretrievalgeneration,
title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning},
author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
year={2025},
eprint={2511.18659},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2511.18659},
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.