HyperAI

ProcessBench-Benchmark-Datensatz Für Mathematisches Denken

Datum

vor 5 Monaten

Größe

1.92 MB

Organisation

Veröffentlichungs-URL

huggingface.co

ProcessBench ist ein Benchmark-Datensatz, der sich auf die Identifizierung von Fehlern im mathematischen Denken konzentriert. Ziel ist es, die Fähigkeit von Sprachmodellen zu messen, falsche Schritte beim mathematischen Denken zu erkennen. Es wurde 2024 vom Qwen-Team der Alibaba Group eingeführt. Die zugehörigen Ergebnisse des Papiers lauten:ProcessBench: Prozessfehler beim mathematischen Denken identifizieren".

Dieser Datensatz enthält 3,4.000 Testbeispiele, wobei der Schwerpunkt auf mathematischen Problemen mit Wettbewerbs- und Olympia-Schwierigkeit liegt. Jedes Beispiel enthält eine Schritt-für-Schritt-Lösung und eine präzise Fehlermarkierung durch Fachexperten. Beim Erstellen dieses Datensatzes wählte das Forschungsteam Fragen aus mehreren öffentlichen Datenquellen aus, verwendete verschiedene Open-Source-Sprachmodelle zur Generierung von Antworten und ließ die Daten schließlich von Experten überprüfen, um hohe Qualitätsstandards sicherzustellen.

Beispieldaten für PROCESSBENCH. Die Bezeichnung 2 gibt an, dass der älteste Fehler bei Schritt 2 aufgetreten ist (indexiert beginnend bei 0). Für Testfälle ohne Fehler ist das Label -1.
ProcessBench.torrent
Seeding 2Herunterladen 0Abgeschlossen 50Gesamtdownloads 41
  • ProcessBench/
    • README.md
      1.58 KB
    • README.txt
      3.15 KB
      • data/
        • ProcessBench.zip
          1.92 MB