Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

TalkVid : Un grand jeu de données diversifié pour la synthèse de visages parlants pilotée par le son

Droplet3D : des prioris du sens commun extraits des vidéos facilitent la génération 3D































TalkVid : Un grand jeu de données diversifié pour la synthèse de visages parlants pilotée par le son

Droplet3D : des prioris du sens commun extraits des vidéos facilitent la génération 3D






























A.S.E : Une référence au niveau du dépôt pour évaluer la sécurité dans le code généré par l'IA
EmbodiedOneVision : pré-entraînement entrelacé vision-texte-action pour le contrôle général des robots
R-4B : Inciter la capacité auto-réfléchissante générale dans les MLLMs par recuit bi-mode et apprentissage par renforcement
Enflammer l'écriture créative dans les petits modèles linguistiques : LLM comme juge versus récompenses raffinées par multi-agents
TMUAD : Amélioration des capacités logiques dans les modèles unifiés de détection d'anomalies grâce à une banque de mémoire textuelle
Analyse de la dynamique de pensée en chaîne : orientation active ou rationalisation post hoc peu fiable ?
AWorld : Orchestration de la recette d'entraînement pour l'intelligence artificielle agente
MCP-Bench : Outil d'évaluation des agents LLM utilisant des outils dans des tâches réelles complexes via des serveurs MCP
rStar2-Agent : Rapport technique sur le raisonnement agentique
Pref-GRPO : GRPO basé sur la récompense de préférence par paires pour un apprentissage par renforcement texte-image stable
MobileCLIP2 : Amélioration de l'entraînement renforcé multimodal
Collaboration esthétique IA-IA fondée sur une prise de conscience sémiotique explicite et le développement d'une grammaire émergente
Fixer son regard au cœur : un jeu de données vidéo multi-vues pour l'estimation du rPPG et des biomarqueurs de santé
Prédire l'ordre des jetons suivants améliore la modélisation du langage
MIDAS : synthèse multimodale interactive d'humains numériques par génération vidéo autoregressive en temps réel
Diffusion discrète VLA : Intégrer la diffusion discrète dans le décodage des actions des politiques vision-langage-action
Modèle vision-langage à récompense autonome par décomposition du raisonnement
Au-delà de la transcription : l'interprétabilité mécaniste dans la reconnaissance automatique de la parole
CODA : Coordonner le cerveau et le cervelet pour un agent informatique à cerveau dual utilisant un apprentissage par renforcement découplé
WebSight : Une architecture centrée sur la vision pour des agents web robustes
UltraMemV2 : les réseaux mémoire évoluant à 120 milliards de paramètres avec une apprentissage de contexte long supérieur
Rapport technique d'Hermes 4
OmniHuman-1.5 : Insuffler une pensée active aux avatars par simulation cognitive
VoxHammer : Édition 3D précise et cohérente sans entraînement dans l'espace 3D natif
CMPhysBench : un benchmark pour évaluer les grands modèles linguistiques en physique de la matière condensée
TreePO : Réduire l'écart entre l'optimisation des politiques, l'efficacité et l'efficacité de l'inférence grâce à une modélisation arborescente heuristique
Nemotron-CC-Math : un jeu de données pré-entraînement de haute qualité pour les mathématiques à l’échelle de 133 milliards de tokens
Compréhension du raisonnement intégré à l'outil
Spacer : Vers une inspiration scientifique conçue
Au-delà de la mémorisation : approfondir le raisonnement grâce à la récurrence, à la mémoire et à l'échelle du calcul au moment de l'évaluation
A.S.E : Une référence au niveau du dépôt pour évaluer la sécurité dans le code généré par l'IA
EmbodiedOneVision : pré-entraînement entrelacé vision-texte-action pour le contrôle général des robots
R-4B : Inciter la capacité auto-réfléchissante générale dans les MLLMs par recuit bi-mode et apprentissage par renforcement
Enflammer l'écriture créative dans les petits modèles linguistiques : LLM comme juge versus récompenses raffinées par multi-agents
TMUAD : Amélioration des capacités logiques dans les modèles unifiés de détection d'anomalies grâce à une banque de mémoire textuelle
Analyse de la dynamique de pensée en chaîne : orientation active ou rationalisation post hoc peu fiable ?
AWorld : Orchestration de la recette d'entraînement pour l'intelligence artificielle agente
MCP-Bench : Outil d'évaluation des agents LLM utilisant des outils dans des tâches réelles complexes via des serveurs MCP
rStar2-Agent : Rapport technique sur le raisonnement agentique
Pref-GRPO : GRPO basé sur la récompense de préférence par paires pour un apprentissage par renforcement texte-image stable
MobileCLIP2 : Amélioration de l'entraînement renforcé multimodal
Collaboration esthétique IA-IA fondée sur une prise de conscience sémiotique explicite et le développement d'une grammaire émergente
Fixer son regard au cœur : un jeu de données vidéo multi-vues pour l'estimation du rPPG et des biomarqueurs de santé
Prédire l'ordre des jetons suivants améliore la modélisation du langage
MIDAS : synthèse multimodale interactive d'humains numériques par génération vidéo autoregressive en temps réel
Diffusion discrète VLA : Intégrer la diffusion discrète dans le décodage des actions des politiques vision-langage-action
Modèle vision-langage à récompense autonome par décomposition du raisonnement
Au-delà de la transcription : l'interprétabilité mécaniste dans la reconnaissance automatique de la parole
CODA : Coordonner le cerveau et le cervelet pour un agent informatique à cerveau dual utilisant un apprentissage par renforcement découplé
WebSight : Une architecture centrée sur la vision pour des agents web robustes
UltraMemV2 : les réseaux mémoire évoluant à 120 milliards de paramètres avec une apprentissage de contexte long supérieur
Rapport technique d'Hermes 4
OmniHuman-1.5 : Insuffler une pensée active aux avatars par simulation cognitive
VoxHammer : Édition 3D précise et cohérente sans entraînement dans l'espace 3D natif
CMPhysBench : un benchmark pour évaluer les grands modèles linguistiques en physique de la matière condensée
TreePO : Réduire l'écart entre l'optimisation des politiques, l'efficacité et l'efficacité de l'inférence grâce à une modélisation arborescente heuristique
Nemotron-CC-Math : un jeu de données pré-entraînement de haute qualité pour les mathématiques à l’échelle de 133 milliards de tokens
Compréhension du raisonnement intégré à l'outil
Spacer : Vers une inspiration scientifique conçue
Au-delà de la mémorisation : approfondir le raisonnement grâce à la récurrence, à la mémoire et à l'échelle du calcul au moment de l'évaluation