Command Palette
Search for a command to run...
LCC_python : Un Vaste Ensemble De Données De Code Python
LCC_python est un ensemble de données de code Python publié par Microsoft en 2023, issu du projet Large Code Corpus (LCC), conçu pour fournir un corpus de code de haute qualité pour des tâches telles que la génération de code, la complétion de code et la compréhension du code.
Cet ensemble de données, d'environ 2 Go, contient 120 000 échantillons de code Python, provenant de grands dépôts de code open source, et est divisé en ensembles d'entraînement, de validation et de test. Chaque échantillon contient principalement le code contextuel et le fragment de code cible correspondant, pouvant être utilisé pour l'apprentissage supervisé et le pré-entraînement de modèles liés au code.
Composition de l'ensemble de données
L'ensemble de données comprend les trois parties suivantes :
- Ensemble d'entraînement (train) : 100 000 échantillons, environ 1,76 Go.
- Ensemble de validation (validation) : 10 000 échantillons, environ 146 Mo.
- Ensemble de test (test) : 10 000 échantillons, environ 149 Mo.
Chaque échantillon contient principalement les champs suivants :
- context : informations sur le contexte du code.
- gt : Ground Truth, c'est-à-dire le code ou l'étiquette cible.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.