Command Palette
Search for a command to run...
AceMath RewardBench
Date
URL du document
Licence
Non-Commercial
Le jeu de données AceMath RewardBench est publié par NVIDIA en 2024 pour évaluer les capacités des modèles de récompense mathématiques ; le résultat associé à la recherche se trouve dans « AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling », visant à mesurer de manière exhaustive les performances des modèles de récompense pour le raisonnement mathématique grâce au paramétrage best-of-N (avec N=8).
Ce jeu de données comprend des exemples provenant de sept autres jeux : GSM8K (1319 questions), Math500 (500 questions), Minerva Math (272 questions), Gaokao 2023 en (385 questions), OlympiadBench (675 questions), College Math (2818 questions) et MMLU STEM (3018 questions).
Chaque exemple contient une question mathématique, soixante-quatre tentatives d’ réponses générées par huit différents grands modèles linguistiques tels que Qwen2/2.5-Math, LLama3.1, Mathtral et deepseek-math — offrant ainsi divers niveaux de qualité — ainsi qu’une évaluation exacte correspondant aux bonnes réponses attendues (« ground truth »), accompagnée de métadonnées telles que la difficulté du problème ou son domaine thématique.
Cette benchmark met l’accent sur la diversité et la robustesse, avec un tirage aléatoire basé sur cent graines différentes afin d’évaluer les résultats moyens.
Composition du jeu de données
Les champs suivants sont inclus dans ce jeu :
- question : description textuelle de la problématique mathématique posée
- code : liste complète des solutions/résultats produits par chaque modèle testé
- gt : réponse correcte officielle ("ground truth")
- pred : liste contenant toutes prédictions extraites depuis chacune des réponses fournies par les modèles évalués
- score : tableau booléen indiquant si chaque prédiction correspond bien à celle officiellement reconnue comme juste (“gt”)
- report : rapport relatif analysant ces éléments ensemble
- idx : numéro identifiant unique attribué
- gt_cot : chaîne logique explicative servant également référence finale validée scientifiquement parlant
Référence bibliographique
@article{acemath2024,
title={AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
author={Liu, Zihan and Chen, Yang and Shoeybi, Mohammad and Catanzaro, Bryan and Ping, Wei},
journal={arXiv preprint},
year={2024}
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.