HyperAIHyperAI

Command Palette

Search for a command to run...

Données SFT Longues ChatQA 2

Date

Organisation

NVIDIA

URL du document

2407.14482

Licence

CC BY NC 2.0

Aperçu du jeu de données

Les données d’entraînement supervisé à long contexte (Long SFT) de ChatQA 2 sont publiées par NVIDIA en 2024 et se concentrent sur les capacités de dialogue-question-réponse avec un contexte long ainsi que la génération assistée par recherche (Retrieval-Augmented Generation, RAG). Les résultats associés ont été présentés dans l'article « ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities », visant à améliorer les performances des grands modèles de langage lors du traitement de contextes longs et de tâches conversationnelles complexes comportant plusieurs tours.

Le sous-ensemble long_sft est dérivé des échantillons GPT-4 issus de LongAlpaca12k, Open Orca et des collections de données longues ; le sous-ensemble NarrativeQA_131072, quant à lui, est généré synthétiquement à partir de NarrativeQA en ajoutant des paragraphes liés au résumé réel donné.
Ce jeu de données constitue l’intégralité des données d’entraînement pour le fine-tuning supervisé (SFT) à long contexte du modèle ChatQA-2, comprenant principalement deux sous-ensembles : long_sft et NarrativeQA_131072.
Il est au format JSON, incluant des ensembles d’apprentissage et de test, destinés à l’étape de fine-tuning instructionnel des modèles.

Composition du jeu de données

Le jeu de données comprend les deux configurations principales suivantes (sous-ensembles) :

long_sft

Données de fine-tuning supervisé à long contexte issues de jeux de données existants, utilisées afin d’améliorer la compréhension et la capacité de génération du modèle dans les dialogues portant sur de longs textes.

  • Ensemble d'apprentissage : long_sft/long_sft_QA_train.json
  • Ensemble de validation/test : long_sft/long_sft_QA_dev.json

NarrativeQA_131072

Données de question-réponse à long contexte générées synthétiquement à partir du jeu de données NarrativeQA, enrichies par l’ajout de paragraphes pertinents afin de renforcer l’information contextuelle.

  • Ensemble d'apprentissage : NarrativeQA_131072/NarrativeQA_131072_QA_train.json
  • Ensemble de validation/test : NarrativeQA_131072/NarrativeQA_131072_QA_dev.json

Référence bibliographique

@article{xu2024chatqa,
  title={ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities},
  author={Xu, Peng and Ping, Wei and Wu, Xianchao and Liu, Zihan and Shoeybi, Mohammad and Catanzaro, Bryan},
  journal={arXiv preprint arXiv:2407.14482},
  year={2024}
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp