Command Palette
Search for a command to run...
ProcessBench-Benchmark-Datensatz Für Mathematisches Denken
Date
Size
Paper URL
ProcessBench ist ein Benchmark-Datensatz, der sich auf die Identifizierung von Fehlern im mathematischen Denken konzentriert. Ziel ist es, die Fähigkeit von Sprachmodellen zu messen, falsche Schritte beim mathematischen Denken zu erkennen. Es wurde 2024 vom Qwen-Team der Alibaba Group eingeführt. Die zugehörigen Ergebnisse des Papiers lauten:ProcessBench: Prozessfehler beim mathematischen Denken identifizieren".
Dieser Datensatz enthält 3,4.000 Testbeispiele, wobei der Schwerpunkt auf mathematischen Problemen mit Wettbewerbs- und Olympia-Schwierigkeit liegt. Jedes Beispiel enthält eine Schritt-für-Schritt-Lösung und eine präzise Fehlermarkierung durch Fachexperten. Beim Erstellen dieses Datensatzes wählte das Forschungsteam Fragen aus mehreren öffentlichen Datenquellen aus, verwendete verschiedene Open-Source-Sprachmodelle zur Generierung von Antworten und ließ die Daten schließlich von Experten überprüfen, um hohe Qualitätsstandards sicherzustellen.

Build AI with AI
From idea to launch — accelerate your AI development with free AI co-coding, out-of-the-box environment and best price of GPUs.