Command Palette
Search for a command to run...
Ensemble De Données Metacognition-Bench
Metacognition-Bench, publié par ginigen-ai, est un jeu de données de référence permettant d'évaluer les capacités métacognitives des grands modèles de langage. Son objectif est de mesurer la capacité métacognitive fonctionnelle du modèle à détecter et corriger ses propres erreurs de raisonnement, plutôt que de simplement évaluer la précision de la réponse finale. Parmi les articles de recherche associés, on peut citer… Banc d'essai final : Mesure du raisonnement métacognitif fonctionnel dans les grands modèles de langage . Ce jeu de données contient 300 questions pièges métacognitives, couvrant 121 domaines tels que les mathématiques, la physique, la biologie, le droit, la médecine, l'économie, les statistiques, l'éthique et l'informatique. Les niveaux de difficulté sont répartis en trois catégories : A (de pointe), B (expert) et C (fondamental), englobant huit types de comportements métacognitifs : autocorrection, échappement aux pièges, détection de transitions, résolution de conflits, découverte incrémentale, gestion de contraintes multiples, panel d'experts et prise de décision en situation d'incertitude. Chaque question intègre un piège caché afin de tester la performance du modèle face à des raisonnements inertiels mais erronés. Le jeu de données utilise deux formats de tâches – choix multiple et génération de questions ouvertes – pour une notation indépendante permettant de mesurer objectivement la vulnérabilité du modèle aux pièges de raisonnement adverses et le gain de correction d'erreurs de l'adaptateur.
Champs de données :
- task_id : Un identifiant unique (format META-001 à META-300)
- domaine : le domaine auquel appartient la question
- Note : Niveau de difficulté (A/B/C)
- ticos_type : Types comportementaux métacognitifs (8 types au total)
- Difficulté : Description qualitative de la difficulté
- consigne : Mot de consigne de la tâche
- Comportement_attendu : Le processus de raisonnement correct et les points précis où l’intuition est sujette à l’erreur.
- hidden_trap : Chemins de raisonnement d'erreur cachés
- ticos_required : Code métacognitif TICOS requis
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.