HyperAIHyperAI

Command Palette

Search for a command to run...

Ensemble De Données De Référence AceMath-RewardBench Pour Les Récompenses Mathématiques

Date

URL du document

2412.15084

Balises

AceMath-RewardBench est un jeu de données de référence permettant d'évaluer les performances des modèles de récompense mathématiques. Ce jeu de données utilise une configuration « meilleur sur N » (N = 8) et couvre les sept jeux de données d'inférence mathématique suivants : GSM8K, Math500, Minerva Math, Gaokao 2023 En, OlympiadBench, College Math et MMLU STEM. Ces jeux de données sont conçus pour mesurer la capacité des modèles de récompense à sélectionner la solution correcte parmi plusieurs solutions candidates. Chaque exemple contient un problème mathématique et 64 tentatives de résolution issues de 8 modèles de langage différents, de qualité variable. L'ensemble de données fournit un score exact pour chaque solution, ainsi que des métadonnées supplémentaires telles que la difficulté du problème et le domaine concerné. Les critères d'évaluation reposent sur deux axes : la diversité (64 réponses par problème provenant de 8 modèles différents) et la robustesse (évaluée en calculant la moyenne des résultats obtenus avec 100 initialisations aléatoires).

Composition de l'ensemble de données

  • L'ensemble de données contient 7 sous-ensembles, chacun correspondant à une tâche de raisonnement mathématique différente. Le nombre précis de questions est le suivant :
  • GSM8K : 1319 questions
  • Math500 : 500 questions
  • Minerva Math : 272 questions
  • Gaokao 2023 (en anglais) : 385 questions
  • OlympiadBench : 675 questions
  • Mathématiques universitaires : 2818 questions
  • MMLU STEM : 3018 questions Le format de données de chaque exemple comprend les champs suivants : question (texte du problème mathématique), code (une liste complète des solutions modèles), gt (la réponse standard), pred (une liste des réponses prédites extraites de chaque solution), score (une liste de valeurs booléennes indiquant si chaque solution correspond à la réponse standard), idx (index), report (rapport) et gt_cot (le processus de réflexion de la réponse standard). L'ensemble de données présente une grande diversité (64 réponses issues de 8 modèles différents) et une robustesse certaine (8 candidats sont sélectionnés aléatoirement parmi 64 à l'aide de 100 valeurs initiales aléatoires, et le résultat moyen est calculé). Cet ensemble de données est adapté à l'évaluation des performances des modèles mathématiques de récompense, notamment dans le cadre optimal N-à-1. Informations relatives à la licence : Cet ensemble de données est distribué sous licence Creative Commons Attribution Non-Commercial 4.0 International (CC-BY-NC-4.0) et est destiné à un usage non commercial uniquement.

Citation

@article{acemath2024,
title={AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
author={Liu, Zihan and Chen, Yang and Shoeybi, Mohammad and Catanzaro, Bryan and Ping, Wei},
journal={arXiv preprint},
year={2024}
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp