Command Palette
Search for a command to run...
Données D'entraînement Du Modèle De Récompense AceMath
Date
URL du document
Licence
Non-Commercial
Les données d’entraînement de l’ACE Math RM sont un ensemble de données publié par NVIDIA en 2024 pour entraîner des modèles de récompense basés sur les résultats mathématiques (Outcome Reward Modeling), avec comme article scientifique associé « AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling ». L’objectif est d’améliorer la performance des grands modèles dans les tâches de raisonnement mathématique.
Cet ensemble de données contient 356 058 problèmes uniques de mathématiques et totalise 2 136 348 échantillons, chaque problème correspondant à six réponses différentes.
Il sert principalement à entraîner les modèles de récompense ACE Math‑7B et ACE Math‑72B, en optimisant leurs capacités de raisonnement mathatique grâce à une évaluation de l’exactitude des réponses fournies.
Dans plusieurs tests de référence, les modèles entraînés sur ces données ont démontré des performances exceptionnelles en raisonnement mathématique, surpassant divers modèles open-source et propriétaires couramment utilisés.
Composition du jeu de données
Le jeu de données comprend principalement les champs suivants :
- qid : identifiant unique du problème.
- message : liste de messages contenant le prompt système, la question utilisateur ainsi que la solution détaillée fournie par l’assistant. Chaque message inclut
role(rôle, tel que system, user ou assistant) etcontent(contenu). - label : étiquette binaire indiquant si la réponse est correcte/excellente (1 = correct, 0 = incorrect).
La donnée se présente sous forme de listes d’objets JSON, directement utilisables pour le chargement et l’entraînement. Chaque exemple représente un problème mathématique accompagné de plusieurs solutions candidates afin de permettre leur comparaison.
Aperçu du jeu de données
Référence bibliographique
@article{acemath2024,
title={AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
author={Liu, Zihan and Chen, Yang and Shoeybi, Mohammad and Catanzaro, Bryan and Ping, Wei},
journal={arXiv preprint},
year={2024}
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.