Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

Les modèles de langage ont besoin de sommeil : apprendre à s’auto-modifier et à consolider les souvenirs

HunyuanOCR-1.5 : Rendre les modèles OCR légers de type VLM plus rapides et plus performants






























De la génération RVB à la lecture de champs denses : prédiction dense dans l'espace pixel avec des modèles texte-image
KronQ : Quantification des LLM via la Hessienne factorisée de Kronecker
Distillation de politique par région de confiance
Les modèles de génération vidéo sont des apprenants visuels généralistes
Pré-entraînement visuel évolutif pour l'intelligence linguistique
Long-Horizon-Terminal-Bench : tester les limites des agents sur des tâches terminales à long horizon avec une évaluation dense basée sur les récompenses
LLM-comme-tuteur : Adaptation des invites consciente de la politique pour l'apprentissage par renforcement non vérifiable
Graphe de Tâches Atomiques : Un Cadre Unifié pour la Planification et l'Exécution Agentiques
LongE2V : Reconstruction, prédiction et interpolation d'images vidéo à long horizon basées sur les événements avec des modèles de diffusion vidéo
UniClawBench : un banc d’essai universel pour les agents proactifs sur des tâches du monde réel
Les idées ont des génomes : évaluation du raisonnement sur les lignées scientifiques et de la génération d'idées fondée sur les lignées
Pourquoi ne puis-je pas ouvrir mon tiroir ? Atténuer les raccourcis orientés objet dans la reconnaissance compositionnelle d'actions en zero-shot
Video-Oasis : Repenser l'évaluation de la compréhension vidéo
Vidu S1 : un modèle de génération vidéo interactive en temps réel
Mesurer l'écart entre les idées de recherche humaines et celles générées par les LLM
L'effet Harness : Comment la conception de l'orchestration définit l'économie des tokens de l'IA agentique d'entreprise
Mondes Infinis aux Interactions Polyvalentes
Mise à l'échelle du pré-entraînement vidéo par mélange d'experts pour l'intelligence incarnée
LAME M-VLA : MÉMOIRE LATENTE DOUBLE DANS LES MODÈLES VISION-LANGAGE-ACTION POUR LA MANIPULATION ROBOTIQUE
Compréhension précise, interdisciplinaire et transparente des relations structure-propriété grâce au raisonnement structurel natif profond
Décodage autorégressif parallélisé pour le sous-titrage dense de vidéos omni-modales
Light-Omni : Réflexe plutôt que raisonnement dans la compréhension vidéo agentique avec mémoire à long terme
La vision comme génération multimodale unifiée
Attention Hiérarchique Éparse Bien Faite : Vers une Modélisation de Contexte Infini
AlayaWorld : Génération de mondes vidéo jouables à long horizon
RynnWorld-4D : Modèles du monde incarnés en 4D pour la manipulation robotique
Nemotron-Labs-3-Puzzle-75B-A9B : Compression des LLMs hybrides à mélange d'experts
Distillation sur politique multi-tours avec rejeu de préfixes
Rapport technique Gemma 4
UI-MOPD : Distillation multi-plateforme on-policy pour l’apprentissage continu d’agents d’interface graphique