Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Une revue sur les modèles Vision-Langage-Action : Une perspective de tokenisation des actions

Profondeur : Tout à Toute Condition































Une revue sur les modèles Vision-Langage-Action : Une perspective de tokenisation des actions

Profondeur : Tout à Toute Condition






























LongAnimation : Génération d'animations longues avec une mémoire globale-locale dynamique
Rapport technique Kwai Keye-VL
Une revue des modèles Vision-Langage-Action pour la conduite autonome
MoCa : Formation continue modale améliore les plongements multimodaux bidirectionnels
FreeLong++ : Génération de vidéos longues sans entraînement via la fusion spectrale multi-bande
Penser au-delà des tokens : de l’intelligence inspirée par le cerveau aux fondements cognitifs de l’intelligence artificielle générale et son impact sociétal
Les Raisonnements Mathématiques Améliorent-ils les Capacités Générales des LLM ? Compréhension de la Transférabilité du Raisonnement des LLM
SciArena : Une plateforme d'évaluation ouverte pour les modèles de base dans les tâches de littérature scientifique
Intelligence Artificielle Holistique en Médecine ; Amélioration des Performances et de l'Explicabilité
Évolution des prompts en contexte : une perspective ouverte et auto-répliquante
SPIRAL : L'auto-jeu dans les jeux à somme nulle incite à la réflexion par le biais de l'apprentissage par renforcement multi-agents et multi-tours
Pensée Récompensée par l'Auditeur dans les VLMs pour les Préférences d'Images
Calligrapher : Personnalisation d'images textuelles en style libre
VMoBA : Mélange d'Attention par Blocs pour les Modèles de Diffusion Vidéo
SMMILE : Un Benchmark Dirigé par des Experts pour l'Apprentissage Multimodal Médical en Contexte
Le Benchmark Automatisé de Speedrunning pour les LLM : Reproduction des Améliorations de NanoGPT
Shape-for-Motion : Édition vidéo précise et cohérente avec un proxy 3D
De l’idéal au réel : Prédiction dense unifiée et efficace en données pour des scénarios du monde réel
ShotBench : Compréhension Cinématographique de Niveau Expert dans les Modèles Vision-Langue
XVerse : Contrôle cohérent de l'identité et des attributs sémantiques de plusieurs sujets par modulation DiT
Conception d'anticorps à zéro coup d'essai dans une plaque à 24 puits
KinFormer : Régression symbolique dynamique généralisable pour la cinématique des réactions organiques catalytiques
MiCo : Contraste multi-image pour le raisonnement visuel renforcé
L'optimisation fine-grainée des préférences améliore le raisonnement spatial dans les VLMs.
ARK : Un cadre open-source basé sur Python pour l'apprentissage robotique
Pangu Pro MoE : Mélange d'Experts Groupés pour une Éparsité Efficace
LLaVA-Scissor : Compression de jetons avec des composantes sémantiques connexes pour les LLMs vidéo
BlenderFusion : Édition visuelle basée sur le 3D et composition générative
UniMate : Un Modèle Unifié pour la Génération de Matériaux Mécaniques Métamériques, la Prédiction de leurs Propriétés et la Confirmation de leur État
Apprendre à Omettre les Couches Intermédiaires des Transformers
LongAnimation : Génération d'animations longues avec une mémoire globale-locale dynamique
Rapport technique Kwai Keye-VL
Une revue des modèles Vision-Langage-Action pour la conduite autonome
MoCa : Formation continue modale améliore les plongements multimodaux bidirectionnels
FreeLong++ : Génération de vidéos longues sans entraînement via la fusion spectrale multi-bande
Penser au-delà des tokens : de l’intelligence inspirée par le cerveau aux fondements cognitifs de l’intelligence artificielle générale et son impact sociétal
Les Raisonnements Mathématiques Améliorent-ils les Capacités Générales des LLM ? Compréhension de la Transférabilité du Raisonnement des LLM
SciArena : Une plateforme d'évaluation ouverte pour les modèles de base dans les tâches de littérature scientifique
Intelligence Artificielle Holistique en Médecine ; Amélioration des Performances et de l'Explicabilité
Évolution des prompts en contexte : une perspective ouverte et auto-répliquante
SPIRAL : L'auto-jeu dans les jeux à somme nulle incite à la réflexion par le biais de l'apprentissage par renforcement multi-agents et multi-tours
Pensée Récompensée par l'Auditeur dans les VLMs pour les Préférences d'Images
Calligrapher : Personnalisation d'images textuelles en style libre
VMoBA : Mélange d'Attention par Blocs pour les Modèles de Diffusion Vidéo
SMMILE : Un Benchmark Dirigé par des Experts pour l'Apprentissage Multimodal Médical en Contexte
Le Benchmark Automatisé de Speedrunning pour les LLM : Reproduction des Améliorations de NanoGPT
Shape-for-Motion : Édition vidéo précise et cohérente avec un proxy 3D
De l’idéal au réel : Prédiction dense unifiée et efficace en données pour des scénarios du monde réel
ShotBench : Compréhension Cinématographique de Niveau Expert dans les Modèles Vision-Langue
XVerse : Contrôle cohérent de l'identité et des attributs sémantiques de plusieurs sujets par modulation DiT
Conception d'anticorps à zéro coup d'essai dans une plaque à 24 puits
KinFormer : Régression symbolique dynamique généralisable pour la cinématique des réactions organiques catalytiques
MiCo : Contraste multi-image pour le raisonnement visuel renforcé
L'optimisation fine-grainée des préférences améliore le raisonnement spatial dans les VLMs.
ARK : Un cadre open-source basé sur Python pour l'apprentissage robotique
Pangu Pro MoE : Mélange d'Experts Groupés pour une Éparsité Efficace
LLaVA-Scissor : Compression de jetons avec des composantes sémantiques connexes pour les LLMs vidéo
BlenderFusion : Édition visuelle basée sur le 3D et composition générative
UniMate : Un Modèle Unifié pour la Génération de Matériaux Mécaniques Métamériques, la Prédiction de leurs Propriétés et la Confirmation de leur État
Apprendre à Omettre les Couches Intermédiaires des Transformers