Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Réutiliser les données d'entraînement préalable au moment du test est un multiplicateur de calcul

NVIDIA Nemotron Nano V2 VL































Réutiliser les données d'entraînement préalable au moment du test est un multiplicateur de calcul

NVIDIA Nemotron Nano V2 VL






























CostBench : Évaluation de la planification et de l'adaptation multi-tours à coût optimal dans des environnements dynamiques pour les agents utilisant des outils basés sur les grands modèles linguistiques
Cambrian-S : Vers une supersensibilité spatiale dans la vidéo
Mise à l'échelle de l'apprentissage des agents par synthèse d'expériences
V-Thinker : Pensée interactive avec des images
Raisonner avec la vidéo : la génération de vidéos comme paradigme prometteur de raisonnement multimodal
Évolutions récentes des simulations biomoléculaires de l'améthyste
UltraHR-100K : Amélioration de la synthèse d’images ultra-haute résolution grâce à un jeu de données à grande échelle et de haute qualité
Des cinq dimensions à l'infini : les modèles linguistiques massifs comme des profilers psychologiques précis et interprétables
Édition basée sur les nœuds pour la génération multimodale de texte, audio, image et vidéo
DR. WELL : Raisonnement dynamique et apprentissage fondés sur un modèle mondial symbolique pour la collaboration multi-agents basée sur des LLM incarnés
Orion-MSP : attention sparse multi-échelle pour l'apprentissage contextuel sur des tableaux
TabTune : Une bibliothèque unifiée pour l'inférence et le fine-tuning des modèles fondamentaux tabulaires
Rapport technique de Step-Audio-EditX
LEGO-Eval : Vers une évaluation fine pour la synthèse d'environnements incarnés 3D avec une augmentation d'outils
UniAVGen : Génération unifiée d'audio et de vidéo avec des interactions intermodales asymétriques
Les modèles de langage de diffusion sont des apprenants super-données
UNO-Bench : une base unifiée pour explorer la loi de composition entre les modèles unimodaux et omni-modaux dans les modèles omni
Génération de trajectoires humaines sensible à la distribution dynamique de la population avec un modèle de diffusion
Texte pour l'assemblage robotique d'objets multi-composants utilisant l'intelligence artificielle générative 3D et des modèles de langage-vision
Kosmos : Un scientifique artificiel pour la découverte autonome
Plus court mais pas pire : un raisonnement frugal via des exemples simples comme régularisateurs de longueur dans le cadre du Math RLVR
Brain-IT : Reconstruction d'images à partir d'IRMf par transformateur d'interaction cérébrale
Lorsque les modalités entrent en conflit : comment l’incertitude du raisonnement unimodal gouverne la dynamique des préférences dans les MLLMs
Ne pas aveugler votre VLA : aligner les représentations visuelles pour une généralisation hors distribution
Lorsque la visualisation est la première étape du raisonnement : MIRA, un benchmark pour la chaîne de raisonnement visuelle
VCode : une base d'évaluation codée multimodale utilisant le SVG comme représentation visuelle symbolique
L'Indice de productivité de l'IA (APEX)
Chaîne de cadres : Progresser dans la compréhension vidéo au sein des modèles linguistiques multimodaux grâce au raisonnement conscient des cadres
Vers un raisonnement mathématique robuste
Vers une conception de système d'infrastructure d'intelligence artificielle hautement évolutif basée dans l'espace
CostBench : Évaluation de la planification et de l'adaptation multi-tours à coût optimal dans des environnements dynamiques pour les agents utilisant des outils basés sur les grands modèles linguistiques
Cambrian-S : Vers une supersensibilité spatiale dans la vidéo
Mise à l'échelle de l'apprentissage des agents par synthèse d'expériences
V-Thinker : Pensée interactive avec des images
Raisonner avec la vidéo : la génération de vidéos comme paradigme prometteur de raisonnement multimodal
Évolutions récentes des simulations biomoléculaires de l'améthyste
UltraHR-100K : Amélioration de la synthèse d’images ultra-haute résolution grâce à un jeu de données à grande échelle et de haute qualité
Des cinq dimensions à l'infini : les modèles linguistiques massifs comme des profilers psychologiques précis et interprétables
Édition basée sur les nœuds pour la génération multimodale de texte, audio, image et vidéo
DR. WELL : Raisonnement dynamique et apprentissage fondés sur un modèle mondial symbolique pour la collaboration multi-agents basée sur des LLM incarnés
Orion-MSP : attention sparse multi-échelle pour l'apprentissage contextuel sur des tableaux
TabTune : Une bibliothèque unifiée pour l'inférence et le fine-tuning des modèles fondamentaux tabulaires
Rapport technique de Step-Audio-EditX
LEGO-Eval : Vers une évaluation fine pour la synthèse d'environnements incarnés 3D avec une augmentation d'outils
UniAVGen : Génération unifiée d'audio et de vidéo avec des interactions intermodales asymétriques
Les modèles de langage de diffusion sont des apprenants super-données
UNO-Bench : une base unifiée pour explorer la loi de composition entre les modèles unimodaux et omni-modaux dans les modèles omni
Génération de trajectoires humaines sensible à la distribution dynamique de la population avec un modèle de diffusion
Texte pour l'assemblage robotique d'objets multi-composants utilisant l'intelligence artificielle générative 3D et des modèles de langage-vision
Kosmos : Un scientifique artificiel pour la découverte autonome
Plus court mais pas pire : un raisonnement frugal via des exemples simples comme régularisateurs de longueur dans le cadre du Math RLVR
Brain-IT : Reconstruction d'images à partir d'IRMf par transformateur d'interaction cérébrale
Lorsque les modalités entrent en conflit : comment l’incertitude du raisonnement unimodal gouverne la dynamique des préférences dans les MLLMs
Ne pas aveugler votre VLA : aligner les représentations visuelles pour une généralisation hors distribution
Lorsque la visualisation est la première étape du raisonnement : MIRA, un benchmark pour la chaîne de raisonnement visuelle
VCode : une base d'évaluation codée multimodale utilisant le SVG comme représentation visuelle symbolique
L'Indice de productivité de l'IA (APEX)
Chaîne de cadres : Progresser dans la compréhension vidéo au sein des modèles linguistiques multimodaux grâce au raisonnement conscient des cadres
Vers un raisonnement mathématique robuste
Vers une conception de système d'infrastructure d'intelligence artificielle hautement évolutif basée dans l'espace