HyperAIHyperAI

Command Palette

Search for a command to run...

Reasoning Corpus Large Model Mind Chain Dataset

Datum

vor 7 Stunden

Lizenz

Apache 2.0

Reasoning Corpus ist ein großer Datensatz zum modellbasierten Denken, der von SupraLabs veröffentlicht wurde und hauptsächlich für überwachtes Feinabstimmen (SFT), Modelldestillation und das Training von Lehrmethoden verwendet wird. Dieser Datensatz umfasst ca. 5 Millionen Beispiele mit jeweils maximal 5.000 Tokens. Jedes Beispiel enthält die ursprüngliche Benutzereingabe, den Inferenzverlauf, die abschließende Antwort des Assistenten, Quellinformationen, die geschätzte Tokenlänge und eine vorformatierte ChatML-Darstellung. Die Daten stammen aus über 60 öffentlichen Datenbanken für Inferenzdaten und decken verschiedene Bereiche wie Naturwissenschaften, Mathematik, Programmierung, logisches Denken, Finanzen und Wirtschaft, Medizin sowie mehrsprachige MINT-Fächer ab. Er integriert Denkkettendaten, die von gängigen großen Modellen wie DeepSeek-v4, DeepSeek-r1, Qwen3 und Gemma4 generiert wurden.

Datenfelder:

  • repo_id: Kennung des Upstream-Datenquellen-Repositorys
  • tok_len: Vorab berechnete Schätzung der Länge des Beispieltokens
  • Benutzer: Ursprüngliche Benutzereingabeaufforderung oder Aufgabenbefehl
  • thought_trace: Die vom Modell generierte Zwischenkette des Denkprozesses.
  • Assistent: Die endgültige Antwort ergibt sich aus dem Denkprozess.
  • ChatML: Vorformatierter Standard-ChatML-Text

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp