HyperAIHyperAI

Command Palette

Search for a command to run...

ChatQA 2 Long SFT Datensatz

Datum

Organisation

NVIDIA

Paper-URL

2407.14482

Lizenz

CC BY NC 2.0

Überblick über den Datensatz

ChatQA 2 Long SFT Data ist ein von NVIDIA im Jahr 2024 veröffentlichter Datensatz, der sich auf die Fähigkeiten zum Dialog-Fragenbeantworten mit langem Kontext und zur retrievalverstärkten Generierung (RAG) konzentriert. Die zugehörige wissenschaftliche Publikation lautet „ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities“. Ziel des Datensatzes ist es, die Leistung großer Sprachmodelle bei Aufgaben zu verbessern, die lange Kontextfenster sowie komplexe Mehrinteraktions-Dialoge erfordern.

Der Subset long_sft leitet sich aus Langalpa12k, GPT-4-Proben aus Open Orca sowie Sammlungen langer Daten ab; der Subset NarrativeQA_131072 wurde basierend auf NarrativeQA synthetisch generiert, indem Absätze hinzugefügt wurden, die mit dem jeweiligen echten Zusammenfassungstext korrespondieren. Dieser Datensatz stellt die vollständigen Trainingsdaten für das Full-Length Context Supervised Fine-Tuning (SFT) des Modells ChatQA-2 dar und umfasst hauptsächlich zwei Subsets: long_sft und NarrativeQA_131072. Das Datenformat ist JSON und enthält sowohl einen Trainings- als auch einen Testdatensatz, die für die Phase des Instruktionssupervised Fine-Tunings verwendet werden.

Zusammensetzung des Datensatzes

Der Datensatz beinhaltet folgende zwei Hauptkonfigurationen (Subsets):

long_sft

Langkontext-Supervised-Fine-Tuning-Daten, die aus bestehenden Datensätzen stammen und dazu dienen, die Verständnis- und Generierungsfähigkeiten des Modells bei langen Textdialogen zu steigern.

  • Trainingset: long_sft/long_sft_QA_train.json
  • Testset: long_sft/long_sft_QA_dev.json

NarrativeQA_131072

Auf Basis des NarrativeQA-Datensatzes synthetisch erzeugte Fragen-Antwort-Daten mit langem Kontext, wobei durch Hinzufügen relevanter Absätze die Kontextinformationen erweitert werden.

  • Trainingset: NarrativeQA_131072/NarrativeQA_131072_QA_train.json
  • Testset: NarrativeQA_131072/NarrativeQA_131072_QA_dev.json

Zitation

@article{xu2024chatqa,
  title={ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities},
  author={Xu, Peng and Ping, Wei and Wu, Xianchao and Liu, Zihan and Shoeybi, Mohammad and Catanzaro, Bryan},
  journal={arXiv preprint arXiv:2407.14482},
  year={2024}
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp