Command Palette
Search for a command to run...
AceMath-RewardBench 수학적 보상 벤치마크 데이터셋
날짜
AceMath-RewardBench는 수학적 보상 모델의 성능을 평가하기 위한 벤치마크 데이터셋입니다. 이 벤치마크는 최적해 선택(N=8) 방식을 사용하며, GSM8K, Math500, Minerva Math, Gaokao 2023 En, OlympiadBench, College Math, MMLU STEM 등 7개의 수학적 추론 데이터셋을 포함합니다. 이 데이터셋들은 보상 모델이 여러 후보해 중에서 정답을 선택하는 능력을 측정하도록 설계되었습니다. 각 예제에는 수학 문제와 8개의 서로 다른 언어 모델에서 생성된 64개의 시도 솔루션이 포함되어 있으며, 솔루션의 품질은 모델마다 다릅니다. 데이터 세트는 각 솔루션에 대한 실제 점수와 문제 난이도, 주제 분야 등의 추가 메타데이터를 제공합니다. 평가 기준은 다양성(8개의 서로 다른 모델에서 생성된 문제당 64개의 답변)과 견고성(100개의 난수 생성 시드를 사용하여 평균화)이라는 두 가지 기준에 중점을 둡니다.
데이터 세트 구성
- 데이터 세트는 각각 다른 수학적 추론 과제에 해당하는 7개의 하위 집합으로 구성되어 있습니다. 각 하위 집합의 구체적인 문항 수는 다음과 같습니다.
- GSM8K: 1319개의 질문
- Math500: 500문제
- 미네르바 수학: 272문제
- 2023년 가오카오(영어): 385문항
- 올림피아드벤치: 675문항
- 대학 수학: 2818문제
- MMLU STEM: 3018문항 각 예제의 데이터 형식에는 다음 필드가 포함됩니다. question(수학 문제 텍스트), code(모델 솔루션의 전체 목록), gt(표준 답안), pred(각 솔루션에서 추출한 예측 답안 목록), score(각 솔루션이 표준 답안과 일치하는지 여부를 나타내는 부울 값 목록), idx(인덱스), report(보고서) 및 gt_cot(표준 답안의 사고 과정). 이 데이터셋은 다양성(8개의 서로 다른 모델에서 얻은 64개의 답변)과 견고성(100개의 난수 시드를 사용하여 64개의 후보 중에서 8개를 무작위로 선택하고 평균 결과를 보고함)을 특징으로 합니다. 이 데이터셋은 특히 최적의 N 대 1 설정에서 수학적 보상 모델의 성능을 평가하는 데 적합합니다. 라이선스 정보: 이 데이터 세트는 크리에이티브 커먼즈 저작자표시 비상업적 이용 4.0 국제(CC-BY-NC-4.0) 라이선스에 따라 사용이 허가되었으며 비상업적 용도로만 사용할 수 있습니다.
소환
@article{acemath2024,
title={AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
author={Liu, Zihan and Chen, Yang and Shoeybi, Mohammad and Catanzaro, Bryan and Ping, Wei},
journal={arXiv preprint},
year={2024}
}