SVG Benchmark est un vaste ensemble de données d'évaluation de la génération d'images statiques, publié par Rapidata en 2025. Il vise à comparer la capacité de 30 modèles de langage de pointe à générer des SVG statiques à partir d'invites textuelles, grâce à une évaluation humaine.
Les données ont été recueillies par comparaisons par paires, incluant 500 énoncés en anglais issus de bases de données rédigées par des humains ou accessibles au public, 188 754 exemples de comparaison d'images et 1 355 161 réponses de préférence basées sur un vote humain. Les modèles d'évaluation portaient sur 30 modèles courants, dont Claude, GPT, Gemini, DeepSeek, Qwen et Kimi. Les dimensions d'évaluation étaient l'alignement, la cohérence et la préférence, toutes basées sur l'agrégation des votes humains, sans recours à des métriques automatisées.
Composition de l'ensemble de données:
L'ensemble de données a reçu un total de 1 355 161 votes humains, dont :
Préférences subjectives : 451 452 fois
Taux de correspondance : 451 603 fois
Continuité : 452 106 fois
Champs de données:
prompt : Chaîne de caractères, le texte d'invite original utilisé pour générer l'image.
image1 / image2 : Images, modèles 1 et 2 générés sous forme de fichiers PNG rasterisés SVG.
model1 / model2 : Chaînes de caractères représentant les identifiants des modèles pour les images correspondantes (model1 est toujours le modèle dont le nom apparaît en premier par ordre alphabétique).
weighted_results_image*_preference / coherence / alignment : Un nombre à virgule flottante représentant le score agrégé du modèle (de 0 à 1) sur les trois dimensions.
detailed_results_*: Chaîne de caractères, format JSON, contenant des enregistrements détaillés de chaque vote manuel et des informations démographiques sur les électeurs pour cette dimension.
Remarque : Certains échantillons peuvent ne participer qu'à une évaluation unidimensionnelle ou bidimensionnelle ; les champs ne participant pas à l'évaluation peuvent avoir des valeurs nulles.
Exemple d'ensemble de donnéesCitation
@dataset{yupp_svg_2025,
title={Yupp SVG Dataset: Exploration of the Reasoning and Coding Abilities of Frontier Models},
author={Yupp AI},
year={2025},
url={https://huggingface.co/datasets/yupp/yupp-svg-20251204}
}
Ce jeu de données est fourni par les utilisateurs de la communauté et est destiné uniquement à des fins éducatives et informatives. Si un contenu enfreint des droits d'auteur, veuillez nous contacter à [email protected] pour examen et retrait rapides.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.
SVG Benchmark est un vaste ensemble de données d'évaluation de la génération d'images statiques, publié par Rapidata en 2025. Il vise à comparer la capacité de 30 modèles de langage de pointe à générer des SVG statiques à partir d'invites textuelles, grâce à une évaluation humaine.
Les données ont été recueillies par comparaisons par paires, incluant 500 énoncés en anglais issus de bases de données rédigées par des humains ou accessibles au public, 188 754 exemples de comparaison d'images et 1 355 161 réponses de préférence basées sur un vote humain. Les modèles d'évaluation portaient sur 30 modèles courants, dont Claude, GPT, Gemini, DeepSeek, Qwen et Kimi. Les dimensions d'évaluation étaient l'alignement, la cohérence et la préférence, toutes basées sur l'agrégation des votes humains, sans recours à des métriques automatisées.
Composition de l'ensemble de données:
L'ensemble de données a reçu un total de 1 355 161 votes humains, dont :
Préférences subjectives : 451 452 fois
Taux de correspondance : 451 603 fois
Continuité : 452 106 fois
Champs de données:
prompt : Chaîne de caractères, le texte d'invite original utilisé pour générer l'image.
image1 / image2 : Images, modèles 1 et 2 générés sous forme de fichiers PNG rasterisés SVG.
model1 / model2 : Chaînes de caractères représentant les identifiants des modèles pour les images correspondantes (model1 est toujours le modèle dont le nom apparaît en premier par ordre alphabétique).
weighted_results_image*_preference / coherence / alignment : Un nombre à virgule flottante représentant le score agrégé du modèle (de 0 à 1) sur les trois dimensions.
detailed_results_*: Chaîne de caractères, format JSON, contenant des enregistrements détaillés de chaque vote manuel et des informations démographiques sur les électeurs pour cette dimension.
Remarque : Certains échantillons peuvent ne participer qu'à une évaluation unidimensionnelle ou bidimensionnelle ; les champs ne participant pas à l'évaluation peuvent avoir des valeurs nulles.
Exemple d'ensemble de donnéesCitation
@dataset{yupp_svg_2025,
title={Yupp SVG Dataset: Exploration of the Reasoning and Coding Abilities of Frontier Models},
author={Yupp AI},
year={2025},
url={https://huggingface.co/datasets/yupp/yupp-svg-20251204}
}
Ce jeu de données est fourni par les utilisateurs de la communauté et est destiné uniquement à des fins éducatives et informatives. Si un contenu enfreint des droits d'auteur, veuillez nous contacter à [email protected] pour examen et retrait rapides.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.