Command Palette
Search for a command to run...
Ensemble De Données De Référence Sur Les sous-titres Vidéo AutoCaption
L'ensemble de données AutoCaption est un ensemble de données de référence de sous-titrage vidéo publié par Tjunlp Lab en 2025. Les résultats de l'article associé sont «Évaluation de modèles linguistiques multimodaux de grande taille pour le sous-titrage vidéo via la recherche arborescente de Monte-Carlo", qui vise à promouvoir la recherche de grands modèles linguistiques multimodaux dans le domaine de la génération de sous-titres vidéo.
Structure du jeu de données :
L'ensemble de données contient 2 sous-ensembles, avec un total de 11 184 échantillons :
- sft_data : réglage fin supervisé pour les modèles de sous-titres (9 419 échantillons pour les données de réglage fin supervisé)
- mcts_vcb : évalué à l'aide des légendes et des points clés générés par MCTS (1 765 échantillons pour évaluer le benchmark MCTS-VCB)
Citation
@misc{yu2025évaluation du langage multimodal et étendu, titre={Évaluation de grands modèles de langage multimodaux pour la légende vidéo via la recherche arborescente Monte Carlo}, author={Linhao Yu et Xinguang Ji et Yahui Liu et Fanheng Kong et Chenxi Sun et Jingyuan Zhang et Hongzhi Zhang et VW et Fuzheng Zhang et Deyi Xiong}, année={2025}, eprint={2506.11155}, préfixe d'archive={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2506.11155}, }
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.