Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

ExoActor : Génération vidéo exocentrique comme contrôle humanoid interactif généralisable

Distillation de politiques co-évoluantes































ExoActor : Génération vidéo exocentrique comme contrôle humanoid interactif généralisable

Distillation de politiques co-évoluantes






























Génération visuelle à l’ère nouvelle : une évolution de la cartographie atomique à la modélisation du monde par agents
Collaboration de modèles de fondation scientifiques hétérogènes
Modèles de diffusion : Un cadre d’intégration unifié pour la diffusion contrôlable
RADIO-ViPE : Fusion multimodale en ligne et fortement couplée pour le SLAM sémantique à vocabulaire ouvert dans des environnements dynamiques
ClawGym : Un cadre évolutif pour construire des agents Griffes efficaces
Transformer le TIDE : Distillation inter-architecture pour les grands modèles linguistiques basés sur des Diffusions
Les grands modèles linguistiques explorent par distillation latente
GLM-5V-Turbo : vers un modèle de fondation natif pour les agents multimodaux
SWE-chat : Interactions entre agents de codage et utilisateurs réels dans la nature
AdaExplore : Adaptation pilotée par les échecs et recherche préservant la diversité pour la génération efficace de noyaux
Affinement par régénération : L'élargissement de l'espace de modification améliore l'affinement d'image dans les modèles multimodaux unifiés
AutoResearchBench : Évaluation des agents IA dans la découverte complexe de la littérature scientifique
Meta-CoT : Amélioration de la granularité et de la généralisation dans l'édition d'images
DV-World : Évaluation des agents de visualisation de données dans des scénarios du monde réel
Programmation avec des données : Ingénierie des données axée sur les tests pour des LLM auto-améliorants à partir de corpus bruts
Systèmes multi-agents récursifs
Récupération de compétences pour l'IA Agentique
SketchVLM : Les modèles de langage visuel peuvent annoter des images pour expliquer les pensées et guider les utilisateurs
RSRCC : Un benchmark pour la compréhension des changements régionaux en télédétection construit par un classement de type Best-of-N augmenté par récupération (Retrieval-Augmented)
LongSpeech : Un benchmark évolutif pour la transcription, la traduction et la compréhension de la parole longue
ClawMark : un benchmark du monde vivant pour les agents collaborateurs multimodaux sur plusieurs tours et plusieurs jours
Tuna-2 : Les embeddings de pixels surpassent les encodeurs visuels pour la compréhension et la génération multimodales
Sécurité Vision-Language-Action : Menaces, Défis, Évaluations et Mécanismes
ReVSI : Rétablir l’évaluation de l’intelligence spatiale visuelle pour une évaluation précise du raisonnement 3D des VLM
De la compétence au talent : organiser des agents hétérogènes comme une entreprise dans le monde réel
World-R1 : Renforcement des contraintes 3D pour la génération de vidéos à partir de texte
Analyse et génération de vidéos via une fonction de progression sémantique
SmartPhotoCrafter : Raisonnement, génération et optimisation unifiés pour l'édition automatique d'images photographiques
Les contextes ne sont jamais assez longs : un raisonnement structuré pour une question-réponse scalable sur des ensembles de documents longs
AgentSearchBench : un benchmark pour la recherche par AI agent en milieu réel
Génération visuelle à l’ère nouvelle : une évolution de la cartographie atomique à la modélisation du monde par agents
Collaboration de modèles de fondation scientifiques hétérogènes
Modèles de diffusion : Un cadre d’intégration unifié pour la diffusion contrôlable
RADIO-ViPE : Fusion multimodale en ligne et fortement couplée pour le SLAM sémantique à vocabulaire ouvert dans des environnements dynamiques
ClawGym : Un cadre évolutif pour construire des agents Griffes efficaces
Transformer le TIDE : Distillation inter-architecture pour les grands modèles linguistiques basés sur des Diffusions
Les grands modèles linguistiques explorent par distillation latente
GLM-5V-Turbo : vers un modèle de fondation natif pour les agents multimodaux
SWE-chat : Interactions entre agents de codage et utilisateurs réels dans la nature
AdaExplore : Adaptation pilotée par les échecs et recherche préservant la diversité pour la génération efficace de noyaux
Affinement par régénération : L'élargissement de l'espace de modification améliore l'affinement d'image dans les modèles multimodaux unifiés
AutoResearchBench : Évaluation des agents IA dans la découverte complexe de la littérature scientifique
Meta-CoT : Amélioration de la granularité et de la généralisation dans l'édition d'images
DV-World : Évaluation des agents de visualisation de données dans des scénarios du monde réel
Programmation avec des données : Ingénierie des données axée sur les tests pour des LLM auto-améliorants à partir de corpus bruts
Systèmes multi-agents récursifs
Récupération de compétences pour l'IA Agentique
SketchVLM : Les modèles de langage visuel peuvent annoter des images pour expliquer les pensées et guider les utilisateurs
RSRCC : Un benchmark pour la compréhension des changements régionaux en télédétection construit par un classement de type Best-of-N augmenté par récupération (Retrieval-Augmented)
LongSpeech : Un benchmark évolutif pour la transcription, la traduction et la compréhension de la parole longue
ClawMark : un benchmark du monde vivant pour les agents collaborateurs multimodaux sur plusieurs tours et plusieurs jours
Tuna-2 : Les embeddings de pixels surpassent les encodeurs visuels pour la compréhension et la génération multimodales
Sécurité Vision-Language-Action : Menaces, Défis, Évaluations et Mécanismes
ReVSI : Rétablir l’évaluation de l’intelligence spatiale visuelle pour une évaluation précise du raisonnement 3D des VLM
De la compétence au talent : organiser des agents hétérogènes comme une entreprise dans le monde réel
World-R1 : Renforcement des contraintes 3D pour la génération de vidéos à partir de texte
Analyse et génération de vidéos via une fonction de progression sémantique
SmartPhotoCrafter : Raisonnement, génération et optimisation unifiés pour l'édition automatique d'images photographiques
Les contextes ne sont jamais assez longs : un raisonnement structuré pour une question-réponse scalable sur des ensembles de documents longs
AgentSearchBench : un benchmark pour la recherche par AI agent en milieu réel