Command Palette
Search for a command to run...
Reasoning Corpus Large Model Mind Chain Dataset
Reasoning Corpus ist ein großer Datensatz zum modellbasierten Denken, der von SupraLabs veröffentlicht wurde und hauptsächlich für überwachtes Feinabstimmen (SFT), Modelldestillation und das Training von Lehrmethoden verwendet wird. Dieser Datensatz umfasst ca. 5 Millionen Beispiele mit jeweils maximal 5.000 Tokens. Jedes Beispiel enthält die ursprüngliche Benutzereingabe, den Inferenzverlauf, die abschließende Antwort des Assistenten, Quellinformationen, die geschätzte Tokenlänge und eine vorformatierte ChatML-Darstellung. Die Daten stammen aus über 60 öffentlichen Datenbanken für Inferenzdaten und decken verschiedene Bereiche wie Naturwissenschaften, Mathematik, Programmierung, logisches Denken, Finanzen und Wirtschaft, Medizin sowie mehrsprachige MINT-Fächer ab. Er integriert Denkkettendaten, die von gängigen großen Modellen wie DeepSeek-v4, DeepSeek-r1, Qwen3 und Gemma4 generiert wurden.
Datenfelder:
- repo_id: Kennung des Upstream-Datenquellen-Repositorys
- tok_len: Vorab berechnete Schätzung der Länge des Beispieltokens
- Benutzer: Ursprüngliche Benutzereingabeaufforderung oder Aufgabenbefehl
- thought_trace: Die vom Modell generierte Zwischenkette des Denkprozesses.
- Assistent: Die endgültige Antwort ergibt sich aus dem Denkprozess.
- ChatML: Vorformatierter Standard-ChatML-Text
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.