Command Palette
Search for a command to run...
Données SFT Longues ChatQA 2
Date
URL du document
Licence
CC BY NC 2.0
Aperçu du jeu de données
Les données d’entraînement supervisé à long contexte (Long SFT) de ChatQA 2 sont publiées par NVIDIA en 2024 et se concentrent sur les capacités de dialogue-question-réponse avec un contexte long ainsi que la génération assistée par recherche (Retrieval-Augmented Generation, RAG). Les résultats associés ont été présentés dans l'article « ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities », visant à améliorer les performances des grands modèles de langage lors du traitement de contextes longs et de tâches conversationnelles complexes comportant plusieurs tours.
Le sous-ensemble long_sft est dérivé des échantillons GPT-4 issus de LongAlpaca12k, Open Orca et des collections de données longues ; le sous-ensemble NarrativeQA_131072, quant à lui, est généré synthétiquement à partir de NarrativeQA en ajoutant des paragraphes liés au résumé réel donné.
Ce jeu de données constitue l’intégralité des données d’entraînement pour le fine-tuning supervisé (SFT) à long contexte du modèle ChatQA-2, comprenant principalement deux sous-ensembles : long_sft et NarrativeQA_131072.
Il est au format JSON, incluant des ensembles d’apprentissage et de test, destinés à l’étape de fine-tuning instructionnel des modèles.
Composition du jeu de données
Le jeu de données comprend les deux configurations principales suivantes (sous-ensembles) :
long_sft
Données de fine-tuning supervisé à long contexte issues de jeux de données existants, utilisées afin d’améliorer la compréhension et la capacité de génération du modèle dans les dialogues portant sur de longs textes.
- Ensemble d'apprentissage : long_sft/long_sft_QA_train.json
- Ensemble de validation/test : long_sft/long_sft_QA_dev.json
NarrativeQA_131072
Données de question-réponse à long contexte générées synthétiquement à partir du jeu de données NarrativeQA, enrichies par l’ajout de paragraphes pertinents afin de renforcer l’information contextuelle.
- Ensemble d'apprentissage : NarrativeQA_131072/NarrativeQA_131072_QA_train.json
- Ensemble de validation/test : NarrativeQA_131072/NarrativeQA_131072_QA_dev.json
Référence bibliographique
@article{xu2024chatqa,
title={ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities},
author={Xu, Peng and Ping, Wei and Wu, Xianchao and Liu, Zihan and Shoeybi, Mohammad and Catanzaro, Bryan},
journal={arXiv preprint arXiv:2407.14482},
year={2024}
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.