HyperAIHyperAI

Command Palette

Search for a command to run...

Données D'entraînement Du Modèle De Récompense AceMath

Date

Organisation

NVIDIA

URL du document

2412.15084

Licence

Non-Commercial

Les données d’entraînement de l’ACE Math RM sont un ensemble de données publié par NVIDIA en 2024 pour entraîner des modèles de récompense basés sur les résultats mathématiques (Outcome Reward Modeling), avec comme article scientifique associé « AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling ». L’objectif est d’améliorer la performance des grands modèles dans les tâches de raisonnement mathématique.

Cet ensemble de données contient 356 058 problèmes uniques de mathématiques et totalise 2 136 348 échantillons, chaque problème correspondant à six réponses différentes.
Il sert principalement à entraîner les modèles de récompense ACE Math‑7B et ACE Math‑72B, en optimisant leurs capacités de raisonnement mathatique grâce à une évaluation de l’exactitude des réponses fournies.
Dans plusieurs tests de référence, les modèles entraînés sur ces données ont démontré des performances exceptionnelles en raisonnement mathématique, surpassant divers modèles open-source et propriétaires couramment utilisés.

Composition du jeu de données

Le jeu de données comprend principalement les champs suivants :

  • qid : identifiant unique du problème.
  • message : liste de messages contenant le prompt système, la question utilisateur ainsi que la solution détaillée fournie par l’assistant. Chaque message inclut role (rôle, tel que system, user ou assistant) et content (contenu).
  • label : étiquette binaire indiquant si la réponse est correcte/excellente (1 = correct, 0 = incorrect).

La donnée se présente sous forme de listes d’objets JSON, directement utilisables pour le chargement et l’entraînement. Chaque exemple représente un problème mathématique accompagné de plusieurs solutions candidates afin de permettre leur comparaison.

数据集示例
数据集示例

Aperçu du jeu de données

Référence bibliographique

@article{acemath2024,
  title={AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
  author={Liu, Zihan and Chen, Yang and Shoeybi, Mohammad and Catanzaro, Bryan and Ping, Wei},
  journal={arXiv preprint},
  year={2024}
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp