HyperAIHyperAI

Command Palette

Search for a command to run...

Ensemble De Données d'enseignement Et d'entraînement Préalables Sutra 10B

Date

il y a 2 heures

Licence

Apache 2.0

Sutra 10B Pretraining 是一个用于大语言模型预训练的高质量教学数据集,由 Sutra 框架生成,创建了结构化的教育内容,优化了语言模型的预训练。这是 Sutra 系列中最大的一个数据集,旨在展示密集、精心策划的数据集如何为小型语言模型提供最佳的预训练性能。

该数据集共包含 10,193,029 条教学记录,总规模超过 100 亿个 token,涵盖跨学科、技术、科学、社会研究、数学、生活技能、艺术与创意、语言艺术以及哲学与伦理学等九大领域。数据内容遵循成熟的教学范式设计,难度由基础到高级划分为 10 个等级,具备良好的层次性与系统性。

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp