Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Attribution du mouvement pour la génération vidéo

VLingNav : Navigation incarnée avec raisonnement adaptatif et mémoire linguistique assistée par la vision































Attribution du mouvement pour la génération vidéo

VLingNav : Navigation incarnée avec raisonnement adaptatif et mémoire linguistique assistée par la vision






























Ministral 3
Le dilemme de la confiance : analyse et atténuation de la mauvaise calibration chez les agents utilisant des outils
ShowUI-π : Modèles génératifs basés sur les flux comme mains habiles GUI
Apprentissage de modèles mondiaux d’actions latentes dans le monde réel
Dr. Zero : des agents de recherche auto-évoluant sans données d'entraînement
MHLA : Restauration de l'expressivité de l'attention linéaire via une approche multi-têtes au niveau des tokens
GlimpRouter : Inférence collaborative efficace par l’aperçu d’un token de pensées
X-Coder : Progresser en programmation compétitive grâce à des tâches, des solutions et des tests entièrement synthétiques
PaCoRe : Apprendre à échelonner le calcul en temps de test grâce au raisonnement coordonné parallèle
BabyVision : Raisonnement visuel au-delà du langage
Regarder, raisonner et chercher : un benchmark de recherche approfondie vidéo sur le Web ouvert pour le raisonnement vidéo agencent
Mémoire conditionnelle par recherche évolutif : un nouvel axe de parcimonie pour les grands modèles linguistiques
EnvScaler : Outil d'extension d'environnements interactifs pour les agents LLM par synthèse programmée
Enchaînement des preuves : apprentissage par renforcement robuste pour des agents de recherche profonde avec des récompenses fondées sur une grille de notation consciente des citations
CaricatureGS : Exagérer les visages en Splatting Gaussien 3D par la courbure gaussienne
La Structure Moléculaire de la Pensée : Cartographie de la Topologie du Raisonnement en Chaîne Longue
MMFormalizer : Autoformalisation multimodale dans le wild
Réfléchir avec une carte : un agent parallèle renforcé augmenté par carte pour la géolocalisation
Briser la barrière de tri pour les plus courts chemins à origine unique dirigés
Rapport technique GR-Dexter
VideoAuto-R1 : Raisonnement vidéo automatique par une pensée unique, une réponse double
RelayLLM : Raisonnement efficace grâce au décodage collaboratif
Collaboration de LLM au niveau des tokens par FusionRoute
RL-AWB : apprentissage par renforcement profond pour la correction de l’équilibrage des blancs automatique dans les scènes nocturnes à faible éclairage
Multiplieurs apprenables : libérer l'échelle des couches matricielles des modèles linguistiques
GDPO : Optimisation de politique à normalisation déconnectée par récompense groupée pour l'optimisation de RL à multi-récompenses
MemRL : Agents auto-évoluant par apprentissage par renforcement en temps réel sur une mémoire épisodique
Du échec à la maîtrise : génération d'échantillons difficiles pour les agents utilisant des outils
Chorégraphier un monde d'objets dynamiques
Klear : Génération conjointe audio-visuelle multi-tâches unifiée
Ministral 3
Le dilemme de la confiance : analyse et atténuation de la mauvaise calibration chez les agents utilisant des outils
ShowUI-π : Modèles génératifs basés sur les flux comme mains habiles GUI
Apprentissage de modèles mondiaux d’actions latentes dans le monde réel
Dr. Zero : des agents de recherche auto-évoluant sans données d'entraînement
MHLA : Restauration de l'expressivité de l'attention linéaire via une approche multi-têtes au niveau des tokens
GlimpRouter : Inférence collaborative efficace par l’aperçu d’un token de pensées
X-Coder : Progresser en programmation compétitive grâce à des tâches, des solutions et des tests entièrement synthétiques
PaCoRe : Apprendre à échelonner le calcul en temps de test grâce au raisonnement coordonné parallèle
BabyVision : Raisonnement visuel au-delà du langage
Regarder, raisonner et chercher : un benchmark de recherche approfondie vidéo sur le Web ouvert pour le raisonnement vidéo agencent
Mémoire conditionnelle par recherche évolutif : un nouvel axe de parcimonie pour les grands modèles linguistiques
EnvScaler : Outil d'extension d'environnements interactifs pour les agents LLM par synthèse programmée
Enchaînement des preuves : apprentissage par renforcement robuste pour des agents de recherche profonde avec des récompenses fondées sur une grille de notation consciente des citations
CaricatureGS : Exagérer les visages en Splatting Gaussien 3D par la courbure gaussienne
La Structure Moléculaire de la Pensée : Cartographie de la Topologie du Raisonnement en Chaîne Longue
MMFormalizer : Autoformalisation multimodale dans le wild
Réfléchir avec une carte : un agent parallèle renforcé augmenté par carte pour la géolocalisation
Briser la barrière de tri pour les plus courts chemins à origine unique dirigés
Rapport technique GR-Dexter
VideoAuto-R1 : Raisonnement vidéo automatique par une pensée unique, une réponse double
RelayLLM : Raisonnement efficace grâce au décodage collaboratif
Collaboration de LLM au niveau des tokens par FusionRoute
RL-AWB : apprentissage par renforcement profond pour la correction de l’équilibrage des blancs automatique dans les scènes nocturnes à faible éclairage
Multiplieurs apprenables : libérer l'échelle des couches matricielles des modèles linguistiques
GDPO : Optimisation de politique à normalisation déconnectée par récompense groupée pour l'optimisation de RL à multi-récompenses
MemRL : Agents auto-évoluant par apprentissage par renforcement en temps réel sur une mémoire épisodique
Du échec à la maîtrise : génération d'échantillons difficiles pour les agents utilisant des outils
Chorégraphier un monde d'objets dynamiques
Klear : Génération conjointe audio-visuelle multi-tâches unifiée