HyperAIHyperAI

Command Palette

Search for a command to run...

CLaRa : RAG Et Raisonnement Latent Continu

Date

Organisation

URL du document

2511.18659

Licence

MIT

Aperçu du jeu de données

Le jeu de données CLaRa pour le raisonnement sur les variables latentes continues est publié par Apple en 2025. Il s’agit d’un ensemble dédié au Raisonnement Assisté par la Récupération (Retrieval-Augmented Generation, RAG) et au raisonnement sur des variables latentes continues. La publication scientifique associée se trouve ici : « CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning ». L’objectif principal est de fournir des données d’entraînement et d’évaluation afin de soutenir les capacités de réponse aux questions des modèles lorsque les représentations documentaires sont compressées.

Ce jeu de données comprend trois grandes catégories de données : pré-entraînement, ajustement fin supervisé (instruction tuning) et ajustement fin de bout en bout. Il couvre plusieurs benchmarks majeurs de réponses aux questions (tels que 2WikiMultihopQA, HotpotQA, MuSiQue et Natural Questions), tant pour leur construction que pour l’évaluation.

La taille des données est importante (comprise entre 10 Go et 100 Go). Le format est uniformément JSONL. Les jeux incluent à la fois des documents positifs (référence absolue ou Oracle) et des scénarios de récupération classiques. Ils conviennent idéalement à la recherche dans les domaines du RAG, de la compression documentaire et des tâches complexes de réponse aux questions.

Composition du jeu de données

Le jeu de données se compose principalement des trois parties suivantes, toutes stockées au format JSONL :

Données de pré-entraînement (Pré-training)

Ces données servent à apprendre le compresseur de documents. Elles contiennent les champs suivants :

  • data_type : type de donnée (par exemple, qa)
  • question : liste de questions
  • answers : liste de réponses
  • docs : liste de contextes documentaires

Données d’ajustement fin (Fine-Tuning Data)

Données d’ajustement fin basées sur des instructions, destinées à entraîner les modèles à répondre aux questions à partir de représentations documentaires compressées. Champs inclus :

  • question : chaîne contenant la question
  • docs : liste de documents récupérés
  • gold_answer : réponse de référence (vérité terrain)
  • answer : réponse générée par le modèle

En outre, ce volet intègre également des sous-ensembles d’évaluation conçus pour différents benchmarks (2wiki, hotpotqa, musique, nq). Ces évaluations distinguent deux configurations : une configuration avec documents positifs (dite "Oracle", marquée inst_eval_*_with_pos) et une configuration standard sans ces documents positifs explicites (marquée inst_eval_*_no_pos).

Ajustement fin de bout en bout (End-to-End Tuning Data) : Données complètes couvrant tout le flux nécessaire à l’entraînement de modèles de bout en bout. Champs inclus :

  • question : chaîne contenant la question
  • answer : chaîne contenant la réponse
  • docs : liste de documents récupérés
  • pos_index : index du document positif dans la liste docs

Cette catégorie est elle aussi divisée en ensembles d’entraînement et d’évaluation. Elle propose deux configurations selon qu’il y ait inclusion ou non de documents positifs (with_pos / no_pos) pour divers benchmarks spécifiques développés dans cette étude (ours_2wiki, ours_hotpotqa, ours_musique, ours_nq).

数据集示例
数据集示例

Exemple de jeu de données

Référence bibliographique

@misc{he2025clarabridgingretrievalgeneration,
      title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning}, 
      author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
      year={2025},
      eprint={2511.18659},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2511.18659}, 
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp