Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

ENVACE : INTERNALISER LA DYNAMIQUE DE L'ENVIRONNEMENT PAR RÉPÉTITION DU MONDE POUR L'APPRENTISSAGE PAR RENFORCEMENT AGENTIQUE

GST-Bench : les modèles vision-langage peuvent-ils acquérir une conscience spatiale globale à partir de vidéos ?






























WorldClaw : Génération agentique de mondes ouverts 3D à grande échelle
Décodage MEG interprétable de la parole perçue : sources corticales et caractéristiques du stimulus qui sous-tendent la récupération
OSReward : Instaurer une évaluation standardisée pour les modèles de récompense inter-plateformes des agents utilisant un ordinateur
AGENTOPSD : AUTO-DISTILLATION RÉCURSIVE POUR L'APPRENTISSAGE PAR RENFORCEMENT AGENTIQUE
ACM : Gestion agentique du contexte pour les tâches à long horizon
Reconstruction de profondeur en lumière structurée monocoup basée sur l’IA pour le guidage laparoscopique en temps réel
Séparation représentationnelle entre modèles génératifs quantiques unitaires et à canal via un aléa classique partagé à faible profondeur
La structure de la récompense façonne l’interaction entre exploration épisodique et mémoire neuronale en apprentissage par renforcement
Crêtes de densité stables : cohérence et convergence du Mean Shift sous contrainte de sous-espace
Raisonnement de mouvement robuste et efficace pour la reconnaissance d’incidents en classe respectueuse de la vie privée
ABSeeker : entraînement d'agents de recherche à long horizon par attribution de crédit avec rétro-traçage depuis la réponse
PG-LLM : Évaluation comparative des modèles de langage généralistes pour le classement de variants protéiques
DataSpace : un banc d'essai pour les agents de données dédiés à l'analyse vérifiable sur des espaces de travail hétérogènes
Réutilisation des déploiements sous décalage de politique : optimisation de politique normalisée par préfixe pour l’apprentissage par renforcement des grands modèles de langue
Harness-R1 : Apprendre à éditer des harnais d'exécution à partir de trajectoires d'échec d'agents
FinanceHarness : un cadre autonome pour la recherche financière approfondie
DeepSeek-V4 : vers une intelligence hautement efficace à contexte d’un million de jetons
Découplage Connaissance–Géométrie : Transfert Pré-entraîné Actualisable pour la Recommandation en Flux
Video-DeepResearch : vers un agent de recherche profonde multimodal de nouvelle génération
AURORA-LM : Représentation unifiée auto-encodée pour la modélisation linguistique par diffusion à espace latent continu
Hunyuan3D-Buffalo 1.0 : un modèle multimodal unifié pour la génération, la compréhension et l'édition 3D à grande échelle
JoyAI-Video-Edit : Édition vidéo ouverte en temps réel par diffusion autorégressive
MerchantBench : Évaluation comparative des agents LLM pour la cohérence à long terme dans les opérations de commerce électronique
Entraînement de nGPT
UEmbed : Plongements multimodaux unifiés creux et denses
VAD : Attribution de preuves visuelles pour la reconstruction de cibles en distillation multimodale on-policy
GÉNÉRATION PROGRESSIVE DE COMPÉTENCES D'AGENT PAR APPRENTISSAGE PAR RENFORCEMENT
DAPD : Distillation de politique à double ancrage
LongHorizon-Harness : faire progresser les agents à long horizon pour les tâches du monde réel
SwanTale : génération unifiée de parole et d’audio multi-locuteurs pour les tâches par instruction et zero-shot