Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

R-Horizon : Jusqu'où votre modèle de raisonnement massif peut-il réellement aller en ampleur et en profondeur ?

AutoPR : Automatisons votre promotion académique !






























Optimisation du prompt multimodal : Pourquoi ne pas exploiter plusieurs modalités pour les MLLM
TAG : Guidance d'amplification tangentielle pour un échantillonnage de diffusion résistant aux hallucinations
Penser avec l'appareil photo : un modèle multimodal unifié pour la compréhension et la génération centrées sur l'appareil photo
D2E : Extension de l'apprentissage préalable vision-action sur des données de bureau pour le transfert vers l'intelligence artificielle incarnée
Code2Video : un paradigme centré sur le code pour la génération de vidéos éducatives
Dr. Bias : Inégalités sociales dans les systèmes d’orientation médicale alimentés par l’intelligence artificielle
Le potentiel de l'optimisation du second ordre pour les modèles de langage : une étude basée sur le Gauss-Newton complet
L'auto-conscience améliore les modèles de raisonnement : apprentissage par renforcement de l'alignement auto-référentiel
Du Quoi au Pourquoi : un système multi-agents pour le raisonnement fondé sur des preuves des conditions de réaction chimique
DreamOmni2 : Édition et génération basées sur des instructions multimodales
VideoCanvas : Complétion vidéo unifiée à partir de morceaux spatio-temporels arbitraires par conditionnement in-context
UniVideo : Compréhension, génération et édition unifiées pour les vidéos
MemMamba : Repenser les motifs de mémoire dans les modèles d'espace d'état
MM-HELIX : Accroître le raisonnement réfléchi multimodal à longue chaîne grâce à une plateforme holistique et une optimisation adaptative de politique hybride
PromptCoT 2.0 : Échelle de la synthèse de prompts pour le raisonnement des modèles linguistiques à grande échelle
Extrait-0 : Un modèle linguistique spécialisé pour l'extraction d'information documentaire
OmniRetarget : Génération de données préservant les interactions pour la locomotion et la manipulation globale des humanoïdes ainsi que l'interaction avec la scène
WildSpeech-Bench : Évaluation des modèles linguistiques vocaux end-to-end dans des conditions réelles
Édition attentive aux jetons des activations internes pour l'alignement des grands modèles linguistiques
Apprentissage orienté vers l'acquisition : une porte dynamique par jeton pour le modélisation vision-langage à faibles ressources
Apprentissage de l'agent par expérience précoce
MATRIX : Alignement de trajectoires masquées pour la génération vidéo consciente des interactions
RLinf-VLA : Un cadre unifié et efficace pour l'entraînement VLA+RL
SHANKS : Audition et pensée simultanées pour les modèles de langage parlé
Lumina-DiMOO : un grand modèle linguistique à diffusion omnimode pour la génération et la compréhension multi-modale
Communication sémantique directe entre modèles de langage massifs par échange de cache
Ming-UniVision : Compréhension et génération d'images conjointes à l'aide d'un tokeniseur continu unifié
Rapport technique Phi-3 : un modèle linguistique hautement performant fonctionnant localement sur votre téléphone
Rapport technique Qwen2.5
Découverte d'algorithmes scientifiques par l'augmentation d'AlphaEvolve avec une recherche approfondie