Command Palette
Search for a command to run...
CLaRa: RAG Und Kontinuierliches Latentes Denken
Datum
Paper-URL
Lizenz
MIT
Überblick über den Datensatz
Der CLaRa Continuous Latent Reasoning Dataset wurde von Apple im Jahr 2025 veröffentlicht und ist ein Datensatz für retrieval-augmentierte Generierung (Retrieval-Augmented Generation, RAG) sowie kontinuierliche latente Schlussfolgerungen. Die zugehörige wissenschaftliche Publikation finden Sie unter „CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning“. Ziel des Datensatzes ist es, Trainings- und Evaluierungsdaten bereitzustellen, um die Fähigkeit von Modellen zur Beantwortung von Fragen basierend auf komprimierten Dokumentenrepräsentationen zu unterstützen.
Der Datensatz umfasst drei Hauptkategorien von Daten: Pretraining-, Instruction-Fine-Tuning- und End-to-End-Fine-Tuning-Daten. Er deckt Aufbau und Evaluation verschiedener gängiger Frage-Antwort-Benchmarks ab (z. B. 2WikiMultihopQA, HotpotQA, MuSiQue, Natural Questions). Mit einer Datengröße zwischen 10 GB und 100 GB liegt das Format einheitlich als JSONL vor und unterstützt sowohl positive Dokumente (Oracle-Szenario) als auch normale Retrievelandschaften. Der Datensatz eignet sich ideal für Forschungszwecke im Bereich der retrieval-augmentierten Generierung (RAG), der Dokumentkompression sowie komplexer Question-Answering-Aufgaben.
Zusammensetzung des Datensatzes
Der Datensatz besteht hauptsächlich aus folgenden drei Teilen; alle Daten werden im JSONL-Format gespeichert:
Pretraining-Daten
Dienen dem Erlernen eines Dokumenten-Kompressors. Enthält folgende Felder:
data_type: Art der Daten (z. B.qa)question: Liste mit Fragenanswers: Liste mit Antwortendocs: Liste mit Dokumentkontexten
Fine-Tuning-Daten
Instruction-tuned Daten zum Trainieren von Frage-Antwort-Modellen basierend auf komprimierten Dokumentenrepräsentationen. Enthält folgende Felder:
question: Zeichenfolge mit der Fragedocs: Liste der abgerufenen Dokumentegold_answer: Standardantwortanswer: Vom Modell generierte Antwort
Zudem enthält er Evalutionssets für verschiedene Benchmarks (2wiki, hotpotqa, musik, nq), unterteilt in Oracle-Einstellungen mit positiven Dokumenten (inst_eval_*_mit_pos) und reguläre Einstellungen ohne diese (inst_eval_*_ohne_pos).
End-to-End-Fine-Tuning-Daten: Umfassende Prozessdaten für das Training end-zu-end Modelle. Folgende Felder sind enthalten:
question: Zeichenfolge mit der Frageanswer: Zeichenfolge mit der Antwortdocs: Liste der abgerufenen Dokumentepos_index: Index des positiven Dokuments innerhalb der Listedocs
Auch hier gibt es getrennte Trainings- und Evaluationssets. Für unterschiedliche Benchmarks (unsere_eigenen_2wiki, unsere_eigenen_hotpotqa, unsere_eigenen_music, unsere_eigenen_nq) stehen zwei Varianten bereit: eine Variante mit positiven Dokumenten („mit_pos") und eine ohne positive Dokumente („ohne_pos").
Datensatzbeispiel
Zitierweise
@misc{he2025clarabridgingretrievalgeneration,
title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning},
author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
year={2025},
eprint={2511.18659},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2511.18659},
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.