Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

BEAR : Benchmarking et amélioration des modèles linguistiques multimodaux pour des capacités incarnées atomiques

Transformateurs de diffusion avec autoencodeurs de représentation































BEAR : Benchmarking et amélioration des modèles linguistiques multimodaux pour des capacités incarnées atomiques

Transformateurs de diffusion avec autoencodeurs de représentation






























QeRL : Au-delà de l'efficacité — apprentissage par renforcement amélioré par quantification pour les modèles de langage à grande échelle
Boucles de Wilson sans inversion pour les transformateurs : un outil pratique de diagnostic de l'invariance et de la sensibilité à l'ordre
TUMIX : Échelonnage à l'heure du test avec plusieurs agents et combinaison d'outils
R-Horizon : Jusqu'où votre modèle de raisonnement massif peut-il réellement aller en ampleur et en profondeur ?
AutoPR : Automatisons votre promotion académique !
Optimisation du prompt multimodal : Pourquoi ne pas exploiter plusieurs modalités pour les MLLM
TAG : Guidance d'amplification tangentielle pour un échantillonnage de diffusion résistant aux hallucinations
Penser avec l'appareil photo : un modèle multimodal unifié pour la compréhension et la génération centrées sur l'appareil photo
D2E : Extension de l'apprentissage préalable vision-action sur des données de bureau pour le transfert vers l'intelligence artificielle incarnée
Code2Video : un paradigme centré sur le code pour la génération de vidéos éducatives
Dr. Bias : Inégalités sociales dans les systèmes d’orientation médicale alimentés par l’intelligence artificielle
Le potentiel de l'optimisation du second ordre pour les modèles de langage : une étude basée sur le Gauss-Newton complet
L'auto-conscience améliore les modèles de raisonnement : apprentissage par renforcement de l'alignement auto-référentiel
Du Quoi au Pourquoi : un système multi-agents pour le raisonnement fondé sur des preuves des conditions de réaction chimique
DreamOmni2 : Édition et génération basées sur des instructions multimodales
VideoCanvas : Complétion vidéo unifiée à partir de morceaux spatio-temporels arbitraires par conditionnement in-context
UniVideo : Compréhension, génération et édition unifiées pour les vidéos
MemMamba : Repenser les motifs de mémoire dans les modèles d'espace d'état
MM-HELIX : Accroître le raisonnement réfléchi multimodal à longue chaîne grâce à une plateforme holistique et une optimisation adaptative de politique hybride
PromptCoT 2.0 : Échelle de la synthèse de prompts pour le raisonnement des modèles linguistiques à grande échelle
Extrait-0 : Un modèle linguistique spécialisé pour l'extraction d'information documentaire
OmniRetarget : Génération de données préservant les interactions pour la locomotion et la manipulation globale des humanoïdes ainsi que l'interaction avec la scène
WildSpeech-Bench : Évaluation des modèles linguistiques vocaux end-to-end dans des conditions réelles
Édition attentive aux jetons des activations internes pour l'alignement des grands modèles linguistiques
Apprentissage orienté vers l'acquisition : une porte dynamique par jeton pour le modélisation vision-langage à faibles ressources
Apprentissage de l'agent par expérience précoce
MATRIX : Alignement de trajectoires masquées pour la génération vidéo consciente des interactions
RLinf-VLA : Un cadre unifié et efficace pour l'entraînement VLA+RL
SHANKS : Audition et pensée simultanées pour les modèles de langage parlé
Lumina-DiMOO : un grand modèle linguistique à diffusion omnimode pour la génération et la compréhension multi-modale
QeRL : Au-delà de l'efficacité — apprentissage par renforcement amélioré par quantification pour les modèles de langage à grande échelle
Boucles de Wilson sans inversion pour les transformateurs : un outil pratique de diagnostic de l'invariance et de la sensibilité à l'ordre
TUMIX : Échelonnage à l'heure du test avec plusieurs agents et combinaison d'outils
R-Horizon : Jusqu'où votre modèle de raisonnement massif peut-il réellement aller en ampleur et en profondeur ?
AutoPR : Automatisons votre promotion académique !
Optimisation du prompt multimodal : Pourquoi ne pas exploiter plusieurs modalités pour les MLLM
TAG : Guidance d'amplification tangentielle pour un échantillonnage de diffusion résistant aux hallucinations
Penser avec l'appareil photo : un modèle multimodal unifié pour la compréhension et la génération centrées sur l'appareil photo
D2E : Extension de l'apprentissage préalable vision-action sur des données de bureau pour le transfert vers l'intelligence artificielle incarnée
Code2Video : un paradigme centré sur le code pour la génération de vidéos éducatives
Dr. Bias : Inégalités sociales dans les systèmes d’orientation médicale alimentés par l’intelligence artificielle
Le potentiel de l'optimisation du second ordre pour les modèles de langage : une étude basée sur le Gauss-Newton complet
L'auto-conscience améliore les modèles de raisonnement : apprentissage par renforcement de l'alignement auto-référentiel
Du Quoi au Pourquoi : un système multi-agents pour le raisonnement fondé sur des preuves des conditions de réaction chimique
DreamOmni2 : Édition et génération basées sur des instructions multimodales
VideoCanvas : Complétion vidéo unifiée à partir de morceaux spatio-temporels arbitraires par conditionnement in-context
UniVideo : Compréhension, génération et édition unifiées pour les vidéos
MemMamba : Repenser les motifs de mémoire dans les modèles d'espace d'état
MM-HELIX : Accroître le raisonnement réfléchi multimodal à longue chaîne grâce à une plateforme holistique et une optimisation adaptative de politique hybride
PromptCoT 2.0 : Échelle de la synthèse de prompts pour le raisonnement des modèles linguistiques à grande échelle
Extrait-0 : Un modèle linguistique spécialisé pour l'extraction d'information documentaire
OmniRetarget : Génération de données préservant les interactions pour la locomotion et la manipulation globale des humanoïdes ainsi que l'interaction avec la scène
WildSpeech-Bench : Évaluation des modèles linguistiques vocaux end-to-end dans des conditions réelles
Édition attentive aux jetons des activations internes pour l'alignement des grands modèles linguistiques
Apprentissage orienté vers l'acquisition : une porte dynamique par jeton pour le modélisation vision-langage à faibles ressources
Apprentissage de l'agent par expérience précoce
MATRIX : Alignement de trajectoires masquées pour la génération vidéo consciente des interactions
RLinf-VLA : Un cadre unifié et efficace pour l'entraînement VLA+RL
SHANKS : Audition et pensée simultanées pour les modèles de langage parlé
Lumina-DiMOO : un grand modèle linguistique à diffusion omnimode pour la génération et la compréhension multi-modale