HyperAIHyperAI

Command Palette

Search for a command to run...

Corpus De Raisonnement, Grand Modèle Mind Chain

Date

il y a 7 heures

Licence

Apache 2.0

Reasoning Corpus est un vaste ensemble de données de modélisation de la pensée publié par SupraLabs, principalement utilisé pour le réglage fin supervisé (SFT), la distillation de modèles et la formation aux instructions. Cet ensemble de données contient environ 5 millions d'échantillons, chaque séquence étant limitée à 5 000 jetons. Chaque échantillon comprend la requête utilisateur initiale, la trajectoire d'inférence, la réponse finale de l'assistant, les informations sur la source, la longueur estimée des jetons et une représentation ChatML préformatée. Les données proviennent de plus de 60 entrepôts de données d'inférence publics, couvrant de nombreux domaines tels que les sciences, les mathématiques, la programmation, le raisonnement logique, la finance et l'économie, la médecine et les disciplines STEM multilingues. Il intègre des données de chaînes de pensée générées par des modèles de grande envergure reconnus comme DeepSeek-v4, DeepSeek-r1, Qwen3 et Gemma4.

Champs de données :

  • repo_id : Identifiant du dépôt de données source en amont
  • tok_len : Estimation précalculée de la longueur du jeton de l'échantillon
  • utilisateur : invite de commande utilisateur ou commande de tâche d'origine
  • thought_trace : La chaîne de raisonnement intermédiaire générée par le modèle
  • assistant : La réponse finale découle du raisonnement.
  • ChatML : Texte préformaté au format ChatML standard

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp