Command Palette
Search for a command to run...
ChatQA 2 Long SFT Datensatz
Datum
Paper-URL
Lizenz
CC BY NC 2.0
Überblick über den Datensatz
ChatQA 2 Long SFT Data ist ein von NVIDIA im Jahr 2024 veröffentlichter Datensatz, der sich auf die Fähigkeiten zum Dialog-Fragenbeantworten mit langem Kontext und zur retrievalverstärkten Generierung (RAG) konzentriert. Die zugehörige wissenschaftliche Publikation lautet „ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities“. Ziel des Datensatzes ist es, die Leistung großer Sprachmodelle bei Aufgaben zu verbessern, die lange Kontextfenster sowie komplexe Mehrinteraktions-Dialoge erfordern.
Der Subset long_sft leitet sich aus Langalpa12k, GPT-4-Proben aus Open Orca sowie Sammlungen langer Daten ab; der Subset NarrativeQA_131072 wurde basierend auf NarrativeQA synthetisch generiert, indem Absätze hinzugefügt wurden, die mit dem jeweiligen echten Zusammenfassungstext korrespondieren. Dieser Datensatz stellt die vollständigen Trainingsdaten für das Full-Length Context Supervised Fine-Tuning (SFT) des Modells ChatQA-2 dar und umfasst hauptsächlich zwei Subsets: long_sft und NarrativeQA_131072. Das Datenformat ist JSON und enthält sowohl einen Trainings- als auch einen Testdatensatz, die für die Phase des Instruktionssupervised Fine-Tunings verwendet werden.
Zusammensetzung des Datensatzes
Der Datensatz beinhaltet folgende zwei Hauptkonfigurationen (Subsets):
long_sft
Langkontext-Supervised-Fine-Tuning-Daten, die aus bestehenden Datensätzen stammen und dazu dienen, die Verständnis- und Generierungsfähigkeiten des Modells bei langen Textdialogen zu steigern.
- Trainingset: long_sft/long_sft_QA_train.json
- Testset: long_sft/long_sft_QA_dev.json
NarrativeQA_131072
Auf Basis des NarrativeQA-Datensatzes synthetisch erzeugte Fragen-Antwort-Daten mit langem Kontext, wobei durch Hinzufügen relevanter Absätze die Kontextinformationen erweitert werden.
- Trainingset: NarrativeQA_131072/NarrativeQA_131072_QA_train.json
- Testset: NarrativeQA_131072/NarrativeQA_131072_QA_dev.json
Zitation
@article{xu2024chatqa,
title={ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities},
author={Xu, Peng and Ping, Wei and Wu, Xianchao and Liu, Zihan and Shoeybi, Mohammad and Catanzaro, Bryan},
journal={arXiv preprint arXiv:2407.14482},
year={2024}
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.