Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

G2VLM : Modèle de vision-langage ancré dans la géométrie avec reconstruction 3D unifiée et raisonnement spatial

Multi-Crit : Évaluation des juges multimodaux sur le respect de critères pluralistes































G2VLM : Modèle de vision-langage ancré dans la géométrie avec reconstruction 3D unifiée et raisonnement spatial

Multi-Crit : Évaluation des juges multimodaux sur le respect de critères pluralistes






























MIRA : Agent de raisonnement itératif multimodal pour l'édition d'images
ENACT : Évaluation de la cognition incarnée à l’aide d’un modèle du monde pour l’interaction egocentrique
Canvas-to-Image : Génération d’images composées avec des contrôles multimodaux
Les modèles de génération vidéo sont de bons modèles de récompense latente
DeepSeekMath-V2 : Vers un raisonnement mathématique auto-vérifiable
ToolOrchestra : L'Intelligence par une Orchestration Efficace de Modèles et d'Outils
Pensez visuellement, raisonnez textuellement : la synergie vision-langage dans ARC
Harmonie : Harmonisation de la génération audiovisuelle par synergie inter-tâches
Inferix : un moteur d'inférence de nouvelle génération pour la simulation du monde basé sur le block-diffusion
Collaboration latente dans les systèmes multi-agents
Évaluation multimodale des architectures en langue russe
ROOT : Optimiseur orthogonalisé robuste pour l'entraînement des réseaux de neurones
La superposition conduit à une mise à l'échelle neuronale robuste
Bornes optimales d'erreurs pour l'apprentissage en ligne transductif
Le renforcement learning incite-t-il réellement les modèles de langage de grande taille à développer une capacité de raisonnement au-delà du modèle de base ?
Pourquoi les modèles de diffusion n'ont-ils pas de mémoire : le rôle de la régularisation dynamique implicite pendant l'entraînement
Réseaux de 1000 couches pour l'apprentissage par renforcement auto-supervisé : l'augmentation de la profondeur peut permettre de nouvelles capacités d'atteinte de buts
Attention à seuil pour les grands modèles linguistiques : non-linéarité, parcimonie et absence de puits d'attention
Hivemind artificiel : l'homogénéité sans fin des modèles linguistiques (et au-delà)
Stratégies d'évolution à l'échelle hyperscale
Comprendre informe-t-il la génération dans les modèles multimodaux unifiés ? De l’analyse à la voie d’avenir
iMontage : Génération d’images many-to-many unifiée, polyvalente et hautement dynamique
Agent0-VL : Exploration d’un Agent Auto-Évoluant pour le Raisonnement Vision-Langage Intégré aux Outils
MedSAM3 : Exploration du Segment Anything à travers des concepts médicaux
SteadyDancer : Animation harmonisée et cohérente d’images humaines avec préservation de la première trame
GigaEvo : un cadre d'optimisation open source alimenté par des LLM et des algorithmes évolutionnaires
Voici la traduction en chinois, conforme au style académique des revues SCI/SSCI : 基于随机路径积分的忠实度感知推荐解释
Extraction de concepts monosémiques sensibles aux interactions dans les systèmes de recommandation
MSRNet : Un réseau récursif multi-échelle pour la détection d'objets camouflés
L'utilisation d'outils tenant compte du budget permet une mise à l'échelle efficace de l'Agent.
MIRA : Agent de raisonnement itératif multimodal pour l'édition d'images
ENACT : Évaluation de la cognition incarnée à l’aide d’un modèle du monde pour l’interaction egocentrique
Canvas-to-Image : Génération d’images composées avec des contrôles multimodaux
Les modèles de génération vidéo sont de bons modèles de récompense latente
DeepSeekMath-V2 : Vers un raisonnement mathématique auto-vérifiable
ToolOrchestra : L'Intelligence par une Orchestration Efficace de Modèles et d'Outils
Pensez visuellement, raisonnez textuellement : la synergie vision-langage dans ARC
Harmonie : Harmonisation de la génération audiovisuelle par synergie inter-tâches
Inferix : un moteur d'inférence de nouvelle génération pour la simulation du monde basé sur le block-diffusion
Collaboration latente dans les systèmes multi-agents
Évaluation multimodale des architectures en langue russe
ROOT : Optimiseur orthogonalisé robuste pour l'entraînement des réseaux de neurones
La superposition conduit à une mise à l'échelle neuronale robuste
Bornes optimales d'erreurs pour l'apprentissage en ligne transductif
Le renforcement learning incite-t-il réellement les modèles de langage de grande taille à développer une capacité de raisonnement au-delà du modèle de base ?
Pourquoi les modèles de diffusion n'ont-ils pas de mémoire : le rôle de la régularisation dynamique implicite pendant l'entraînement
Réseaux de 1000 couches pour l'apprentissage par renforcement auto-supervisé : l'augmentation de la profondeur peut permettre de nouvelles capacités d'atteinte de buts
Attention à seuil pour les grands modèles linguistiques : non-linéarité, parcimonie et absence de puits d'attention
Hivemind artificiel : l'homogénéité sans fin des modèles linguistiques (et au-delà)
Stratégies d'évolution à l'échelle hyperscale
Comprendre informe-t-il la génération dans les modèles multimodaux unifiés ? De l’analyse à la voie d’avenir
iMontage : Génération d’images many-to-many unifiée, polyvalente et hautement dynamique
Agent0-VL : Exploration d’un Agent Auto-Évoluant pour le Raisonnement Vision-Langage Intégré aux Outils
MedSAM3 : Exploration du Segment Anything à travers des concepts médicaux
SteadyDancer : Animation harmonisée et cohérente d’images humaines avec préservation de la première trame
GigaEvo : un cadre d'optimisation open source alimenté par des LLM et des algorithmes évolutionnaires
Voici la traduction en chinois, conforme au style académique des revues SCI/SSCI : 基于随机路径积分的忠实度感知推荐解释
Extraction de concepts monosémiques sensibles aux interactions dans les systèmes de recommandation
MSRNet : Un réseau récursif multi-échelle pour la détection d'objets camouflés
L'utilisation d'outils tenant compte du budget permet une mise à l'échelle efficace de l'Agent.