ProcessBench-Benchmark-Datensatz Für Mathematisches Denken
Datum
Größe
Veröffentlichungs-URL
Kategorien
ProcessBench ist ein Benchmark-Datensatz, der sich auf die Identifizierung von Fehlern im mathematischen Denken konzentriert. Ziel ist es, die Fähigkeit von Sprachmodellen zu messen, falsche Schritte beim mathematischen Denken zu erkennen. Es wurde 2024 vom Qwen-Team der Alibaba Group eingeführt. Die zugehörigen Ergebnisse des Papiers lauten:ProcessBench: Prozessfehler beim mathematischen Denken identifizieren".
Dieser Datensatz enthält 3,4.000 Testbeispiele, wobei der Schwerpunkt auf mathematischen Problemen mit Wettbewerbs- und Olympia-Schwierigkeit liegt. Jedes Beispiel enthält eine Schritt-für-Schritt-Lösung und eine präzise Fehlermarkierung durch Fachexperten. Beim Erstellen dieses Datensatzes wählte das Forschungsteam Fragen aus mehreren öffentlichen Datenquellen aus, verwendete verschiedene Open-Source-Sprachmodelle zur Generierung von Antworten und ließ die Daten schließlich von Experten überprüfen, um hohe Qualitätsstandards sicherzustellen.
