Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

OmniCast : un modèle de diffusion latente masquée pour la prévision météorologique à différentes échelles de temps

Diffusion discrète uniforme avec chemin métrique pour la génération vidéo































OmniCast : un modèle de diffusion latente masquée pour la prévision météorologique à différentes échelles de temps

Diffusion discrète uniforme avec chemin métrique pour la génération vidéo






























Game-TARS : Modèles fondamentaux préentraînés pour des agents multimodaux généralistes évolutifs
RoboOmni : Manipulation proactive de robot dans un contexte omni-modal
AgentFold : Agents web à horizon long avec gestion proactive du contexte
Rapport technique sur Tongyi DeepResearch
InteractComp : Évaluation des agents de recherche avec des requêtes ambiguës
VLM-SlideEval : Évaluation des VLM sur la compréhension structurée et la sensibilité aux perturbations dans les présentations PowerPoint
TeraSim-World : Synthèse de données mondiales à enjeux de sécurité pour la conduite autonome par apprentissage end-to-end
Anchorage en avance : préserver l'identité du personnage dans l'animation humaine pilotée par l'audio
VITA-E : Interaction incarnée naturelle avec perception simultanée, audition, parole et action
FARMER : Transformateur autoregressif par flux sur les pixels
Un état de l'art sur les agents de données : un nouveau paradigme émergent ou une hype exagérée ?
ReCode : Unifier planification et action pour un contrôle universel de la granularité
Concerto : L'apprentissage auto-supervisé conjoint 2D-3D émerge des représentations spatiales
Magellan : Exploration guidée de l'espace latent et génération de nouveauté par MCTS
DEEDEE : Détection rapide et évolutif des dynamiques hors distribution
Attention blocs creux par permutation de jetons
Une définition de l'IAG
Du débruitage au raffinement : un cadre correctif pour les modèles de diffusion vision-langage
Échantillonnage par étape, optimisation par morceau : GRPO au niveau des morceaux pour la génération d'images à partir de texte
Video-As-Prompt : Contrôle sémantique unifié pour la génération de vidéos
DeepAgent : un agent de raisonnement généraliste à ensemble d'outils évolutif
Modèles de diffusion guidés par apprentissage par renforcement multi-objectifs prenant en compte l’incertitude pour la conception de molécules 3D de novo
Reac-Discovery : une plateforme pilotée par intelligence artificielle pour la découverte et l'optimisation de réacteurs catalytiques en flux continu
BoltzGen : Vers une conception universelle des liants
HSCodeComp : Un benchmark réaliste et de niveau expert pour les agents de recherche profonde dans l'application de règles hiérarchiques
DyPE : Extrapolation de position dynamique pour la diffusion à très haute résolution
HoloCine : Génération holistique de récits vidéo longs en plusieurs plans cinématographiques
Open-o3 Video : Raisonnement vidéo fondé sur des preuves spatio-temporelles explicites
AdaSPEC : Distillation sélective des connaissances pour des décodeurs spéculatifs efficaces
Rédaction collaborative homme-agent de documents en page pour moins de 0,1 $
Game-TARS : Modèles fondamentaux préentraînés pour des agents multimodaux généralistes évolutifs
RoboOmni : Manipulation proactive de robot dans un contexte omni-modal
AgentFold : Agents web à horizon long avec gestion proactive du contexte
Rapport technique sur Tongyi DeepResearch
InteractComp : Évaluation des agents de recherche avec des requêtes ambiguës
VLM-SlideEval : Évaluation des VLM sur la compréhension structurée et la sensibilité aux perturbations dans les présentations PowerPoint
TeraSim-World : Synthèse de données mondiales à enjeux de sécurité pour la conduite autonome par apprentissage end-to-end
Anchorage en avance : préserver l'identité du personnage dans l'animation humaine pilotée par l'audio
VITA-E : Interaction incarnée naturelle avec perception simultanée, audition, parole et action
FARMER : Transformateur autoregressif par flux sur les pixels
Un état de l'art sur les agents de données : un nouveau paradigme émergent ou une hype exagérée ?
ReCode : Unifier planification et action pour un contrôle universel de la granularité
Concerto : L'apprentissage auto-supervisé conjoint 2D-3D émerge des représentations spatiales
Magellan : Exploration guidée de l'espace latent et génération de nouveauté par MCTS
DEEDEE : Détection rapide et évolutif des dynamiques hors distribution
Attention blocs creux par permutation de jetons
Une définition de l'IAG
Du débruitage au raffinement : un cadre correctif pour les modèles de diffusion vision-langage
Échantillonnage par étape, optimisation par morceau : GRPO au niveau des morceaux pour la génération d'images à partir de texte
Video-As-Prompt : Contrôle sémantique unifié pour la génération de vidéos
DeepAgent : un agent de raisonnement généraliste à ensemble d'outils évolutif
Modèles de diffusion guidés par apprentissage par renforcement multi-objectifs prenant en compte l’incertitude pour la conception de molécules 3D de novo
Reac-Discovery : une plateforme pilotée par intelligence artificielle pour la découverte et l'optimisation de réacteurs catalytiques en flux continu
BoltzGen : Vers une conception universelle des liants
HSCodeComp : Un benchmark réaliste et de niveau expert pour les agents de recherche profonde dans l'application de règles hiérarchiques
DyPE : Extrapolation de position dynamique pour la diffusion à très haute résolution
HoloCine : Génération holistique de récits vidéo longs en plusieurs plans cinématographiques
Open-o3 Video : Raisonnement vidéo fondé sur des preuves spatio-temporelles explicites
AdaSPEC : Distillation sélective des connaissances pour des décodeurs spéculatifs efficaces
Rédaction collaborative homme-agent de documents en page pour moins de 0,1 $