HyperAI
Command Palette
Search for a command to run...
MMLU-CF 汚染のないマルチタスク言語理解ベンチマークデータセット
MMLU-CF は、Microsoft が 2024 年に公開した、汚染がなく、より挑戦的な多肢選択問題ベンチマークデータセットであり、関連する論文成果は「MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark」で、大規模言語モデルのトレーニングデータ漏洩によるオープンソースベンチマークの評価信頼性の問題を解決することを目的としています。
このデータセットには 20,000 問の選択問題が含まれており、生物学、数学、化学、物理学、法律、工学など、複数の学術分野をカバーしています。 厳格な汚染除去ルールとクローズドテストセット設計により、MMLU-CF はモデルの記憶効果を効果的に回避し、大規模言語モデルの真実性推論能力を評価するための、よりクリーンなベンチマークを提供します。
データセット構成
-
検証セット(val):10,000 問の選択問題が含まれ、学科に基づいて Biology、Math、Chemistry、Physics、Law、Engineering、Other、Economics、Health、Psychology、Business、Philosophy、Computer Science、History などのサブセットに分けられています。
-
開発セット(dev):対応する開発データが含まれ、同じ学科カテゴリに基づいて複数のサブセットに分けられ、モデル評価と実験に使用されます。
Citation
@misc{zhao2024mmlucfcontaminationfreemultitasklanguage,
title={MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark},
author={Qihao Zhao and Yangyu Huang and Tengchao Lv and Lei Cui and Qinzheng Sun and Shaoguang Mao and Xin Zhang and Ying Xin and Qiufeng Yin and Scarlett Li and Furu Wei},
year={2024},
eprint={2412.15194},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2412.15194},
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。