Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

VIKI-R : Coordination de la coopération multi-agent incarnée par apprentissage par renforcement

PAROAttention : Réorganisation Consciente des Modèles pour une Attention Efficace et Économique en Termes de Ressources dans les Modèles de Génération Visuelle































VIKI-R : Coordination de la coopération multi-agent incarnée par apprentissage par renforcement

PAROAttention : Réorganisation Consciente des Modèles pour une Attention Efficace et Économique en Termes de Ressources dans les Modèles de Génération Visuelle






























Vision-Guided Chunking Is All You Need : Amélioration de RAG avec la Compréhension Multimodale des Documents
Glisser-Déposer les LLM : Passez des Prompts aux Poids sans Supervision Préalable
Mise en cache évolutionnelle pour accélérer votre modèle de diffusion prêt à l'emploi
RE-IMAGINE : Synthèse de Benchmark Symbolique pour l'Évaluation de la Raisonnement
SonicVerse : Apprentissage multi-tâches pour la légendisation guidée par les caractéristiques musicales
Tout n'est pas perdu : la récupération des LLM sans points de contrôle
Sundial : Une Famille de Modèles Fondamentaux de Série Temporelle Hautement Performants
ADRD : Conduite Autonome Pilotée par des Systèmes de Décision Basés sur des Règles et les Modèles Linguistiques de Grande Envergure
Amélioration de l'affinage itératif pour la génération de code à partir de diagrammes via des instructions structurées
Show-O2 : Amélioration des Modèles Multimodaux Unifiés Natifs
Réexaminer l'apprentissage par renforcement pour la raisonnement des LLM sous une perspective interdomaine
Raptor : Embeddings évolutifs sans entraînement pour des volumes médicaux 3D en exploitant des modèles préentraînés 2D
EmoNet-Voice : Une Benchmark Fine-Grainée Vérifiée par des Experts pour la Détection des Émotions dans la Parole
s1 : Échelle simple au moment du test
Search-o1 : Modèles de raisonnement massifs améliorés par une recherche agente
LLaVA-Mini : Modèles multimodaux grands efficaces pour l’image et la vidéo avec un seul jeton visuel
MAmmoTH-VL : Extraire le raisonnement multimodal par calibration d'instructions à grande échelle
ShowUI : Un modèle vision-langage-action unique pour un agent visuel GUI
OS-ATLAS : un modèle d'action fondamental pour des agents GUI généralistes
Fiche système GPT-4o
SAM2Long : Amélioration de SAM 2 pour la segmentation vidéo longue à l’aide d’un arbre mémoire sans entraînement
Aria : un modèle ouvert multimodal natif à mélange d'experts
Qwen2-VL : Amélioration de la perception du monde par les modèles vision-langage à toute résolution
VGGT : Visual Geometry Grounded Transformer
Génération de Code Multi-Tours par Récompenses en Un Étape
Réexaminer la capacité de généralisation compositionnelle des grands modèles de langage en tenant compte de leur aptitude à suivre les instructions
Agents Web Incarnés : Pont entre les Règnes Physique et Numérique pour une Intelligence d'Agent Intégrée
Récompenses Semantiquement Conscientes pour une Formation R1 Ouverte en Génération Libre
Système BUT pour le Défi MLC-SLM
GenRecal : Génération après recalage des modèles langage-vision de grande à petite taille
Vision-Guided Chunking Is All You Need : Amélioration de RAG avec la Compréhension Multimodale des Documents
Glisser-Déposer les LLM : Passez des Prompts aux Poids sans Supervision Préalable
Mise en cache évolutionnelle pour accélérer votre modèle de diffusion prêt à l'emploi
RE-IMAGINE : Synthèse de Benchmark Symbolique pour l'Évaluation de la Raisonnement
SonicVerse : Apprentissage multi-tâches pour la légendisation guidée par les caractéristiques musicales
Tout n'est pas perdu : la récupération des LLM sans points de contrôle
Sundial : Une Famille de Modèles Fondamentaux de Série Temporelle Hautement Performants
ADRD : Conduite Autonome Pilotée par des Systèmes de Décision Basés sur des Règles et les Modèles Linguistiques de Grande Envergure
Amélioration de l'affinage itératif pour la génération de code à partir de diagrammes via des instructions structurées
Show-O2 : Amélioration des Modèles Multimodaux Unifiés Natifs
Réexaminer l'apprentissage par renforcement pour la raisonnement des LLM sous une perspective interdomaine
Raptor : Embeddings évolutifs sans entraînement pour des volumes médicaux 3D en exploitant des modèles préentraînés 2D
EmoNet-Voice : Une Benchmark Fine-Grainée Vérifiée par des Experts pour la Détection des Émotions dans la Parole
s1 : Échelle simple au moment du test
Search-o1 : Modèles de raisonnement massifs améliorés par une recherche agente
LLaVA-Mini : Modèles multimodaux grands efficaces pour l’image et la vidéo avec un seul jeton visuel
MAmmoTH-VL : Extraire le raisonnement multimodal par calibration d'instructions à grande échelle
ShowUI : Un modèle vision-langage-action unique pour un agent visuel GUI
OS-ATLAS : un modèle d'action fondamental pour des agents GUI généralistes
Fiche système GPT-4o
SAM2Long : Amélioration de SAM 2 pour la segmentation vidéo longue à l’aide d’un arbre mémoire sans entraînement
Aria : un modèle ouvert multimodal natif à mélange d'experts
Qwen2-VL : Amélioration de la perception du monde par les modèles vision-langage à toute résolution
VGGT : Visual Geometry Grounded Transformer
Génération de Code Multi-Tours par Récompenses en Un Étape
Réexaminer la capacité de généralisation compositionnelle des grands modèles de langage en tenant compte de leur aptitude à suivre les instructions
Agents Web Incarnés : Pont entre les Règnes Physique et Numérique pour une Intelligence d'Agent Intégrée
Récompenses Semantiquement Conscientes pour une Formation R1 Ouverte en Génération Libre
Système BUT pour le Défi MLC-SLM
GenRecal : Génération après recalage des modèles langage-vision de grande à petite taille