HyperAIHyperAI

Command Palette

Search for a command to run...

CLaRa: RAG Und Kontinuierliches Latentes Denken

Datum

Organisation

Paper-URL

2511.18659

Lizenz

MIT

Überblick über den Datensatz

Der CLaRa Continuous Latent Reasoning Dataset wurde von Apple im Jahr 2025 veröffentlicht und ist ein Datensatz für retrieval-augmentierte Generierung (Retrieval-Augmented Generation, RAG) sowie kontinuierliche latente Schlussfolgerungen. Die zugehörige wissenschaftliche Publikation finden Sie unter „CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning“. Ziel des Datensatzes ist es, Trainings- und Evaluierungsdaten bereitzustellen, um die Fähigkeit von Modellen zur Beantwortung von Fragen basierend auf komprimierten Dokumentenrepräsentationen zu unterstützen.

Der Datensatz umfasst drei Hauptkategorien von Daten: Pretraining-, Instruction-Fine-Tuning- und End-to-End-Fine-Tuning-Daten. Er deckt Aufbau und Evaluation verschiedener gängiger Frage-Antwort-Benchmarks ab (z. B. 2WikiMultihopQA, HotpotQA, MuSiQue, Natural Questions). Mit einer Datengröße zwischen 10 GB und 100 GB liegt das Format einheitlich als JSONL vor und unterstützt sowohl positive Dokumente (Oracle-Szenario) als auch normale Retrievelandschaften. Der Datensatz eignet sich ideal für Forschungszwecke im Bereich der retrieval-augmentierten Generierung (RAG), der Dokumentkompression sowie komplexer Question-Answering-Aufgaben.

Zusammensetzung des Datensatzes

Der Datensatz besteht hauptsächlich aus folgenden drei Teilen; alle Daten werden im JSONL-Format gespeichert:

Pretraining-Daten

Dienen dem Erlernen eines Dokumenten-Kompressors. Enthält folgende Felder:

  • data_type: Art der Daten (z. B. qa)
  • question: Liste mit Fragen
  • answers: Liste mit Antworten
  • docs: Liste mit Dokumentkontexten

Fine-Tuning-Daten

Instruction-tuned Daten zum Trainieren von Frage-Antwort-Modellen basierend auf komprimierten Dokumentenrepräsentationen. Enthält folgende Felder:

  • question: Zeichenfolge mit der Frage
  • docs: Liste der abgerufenen Dokumente
  • gold_answer: Standardantwort
  • answer: Vom Modell generierte Antwort

Zudem enthält er Evalutionssets für verschiedene Benchmarks (2wiki, hotpotqa, musik, nq), unterteilt in Oracle-Einstellungen mit positiven Dokumenten (inst_eval_*_mit_pos) und reguläre Einstellungen ohne diese (inst_eval_*_ohne_pos).

End-to-End-Fine-Tuning-Daten: Umfassende Prozessdaten für das Training end-zu-end Modelle. Folgende Felder sind enthalten:

  • question: Zeichenfolge mit der Frage
  • answer: Zeichenfolge mit der Antwort
  • docs: Liste der abgerufenen Dokumente
  • pos_index: Index des positiven Dokuments innerhalb der Liste docs

Auch hier gibt es getrennte Trainings- und Evaluationssets. Für unterschiedliche Benchmarks (unsere_eigenen_2wiki, unsere_eigenen_hotpotqa, unsere_eigenen_music, unsere_eigenen_nq) stehen zwei Varianten bereit: eine Variante mit positiven Dokumenten („mit_pos") und eine ohne positive Dokumente („ohne_pos").

数据集示例
数据集示例

Datensatzbeispiel

Zitierweise

@misc{he2025clarabridgingretrievalgeneration,
      title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning}, 
      author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
      year={2025},
      eprint={2511.18659},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2511.18659}, 
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp