Command Palette
Search for a command to run...
Eureka Bench Logs 数据集 De Journalisation D'évaluation
Date
URL du document
Licence
Apache 2.0
Eureka Bench Logs 评测日志 est un ensemble de données publié par Microsoft en 2024, contenant des journaux d'évaluation de grands modèles de fondation, avec les résultats de recherche associés présentés dans « Eureka: Evaluating and Understanding Large Foundation Models », visant à fournir une compréhension et une évaluation approfondies des capacités de raisonnement des grands modèles de fondation dans des tâches complexes.
Cet ensemble de données comprend les journaux d'exécution du framework Eureka ML Insights, documentant les performances détaillées de différentes familles de modèles et de modèles spécifiques dans divers benchmarks. Les données sont organisées par benchmark, famille de modèles et nom de modèle, couvrant les résultats de recherche sur l'extension du temps de raisonnement pour des modèles tels que Phi-4-reasoning. Ces informations aident les chercheurs à analyser les différences de performance et les axes d'optimisation des modèles dans des tâches telles que l'image-texte.
Composition de l'ensemble de données
- Benchmarks : les journaux sont classés selon les benchmarks d'évaluation spécifiques, couvrant des tâches multimodales telles que l'image-texte.
- Familles de modèles : les données sont regroupées par famille de modèles, facilitant la comparaison des progrès entre différents modèles de la même architecture.
- Noms de modèles : chaque entrée de journal correspond à une instance de modèle spécifique, enregistrant des données détaillées de raisonnement et d'évaluation.
Ces données de journaux fournissent un matériel empirique riche pour évaluer et comprendre les grands modèles de fondation.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.