Command Palette
Search for a command to run...
LCC Java 大型代码库数据集
LCC Java est un ensemble de données de code Java publié par Microsoft en 2023, issu du projet The Large Code Corpus (LCC), conçu pour fournir un corpus de code de haute qualité pour des tâches telles que la compréhension du code, la génération de code et la complétion de code.
Cet ensemble de données, d'environ 1,87 Go, contient 120 000 échantillons de code Java, provenant de code source Java réel de projets open source, et est divisé en ensembles d'entraînement, de validation et de test. Chaque échantillon comprend principalement du code contextuel et le fragment de code cible correspondant, stocké au format JSON, pouvant être utilisé pour l'apprentissage supervisé et l'entraînement de séquence à séquence (Seq2Seq) de modèles liés au code.
Composition de l'ensemble de données
L'ensemble de données comprend les trois parties suivantes :
- Ensemble d'entraînement (train) : 100 000 échantillons, environ 1,61 Go.
- Ensemble de validation (validation) : 10 000 échantillons, environ 131 Mo.
- Ensemble de test (test) : 10 000 échantillons, environ 129 Mo.
Chaque échantillon comprend principalement les champs suivants :
- context : code contextuel, fournissant des informations de fond sur le code au modèle.
- gt : fragment de code cible, c'est-à-dire le code que le modèle doit prédire ou générer.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.