Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

Raisonnement visuel implicite latent

Les personas de LLM comme substitution aux expériences sur le terrain dans le benchmarking méthodologique






























DataFlow : un cadre piloté par LLM pour la préparation unifiée des données et l'automatisation des flux de travail à l'ère de l'intelligence artificielle centrée sur les données
HiStream : Génération vidéo à haute résolution efficace par flux éliminant la redondance
TokSuite : Mesurer l'impact du choix du tokenizer sur le comportement des modèles linguistiques
Nemotron 3 Nano : Modèle hybride Mamba-Transformer à mélange d'experts ouvert et efficace pour le raisonnement agencé
Au-delà de la mémoire : une évaluation ordonnée multimodale pour révéler le biais de popularité dans les modèles vision-langage
DreaMontage : Génération vidéo à une seule tentative guidée par des trames arbitraires
T2AV-Compass : Vers une Évaluation Unifiée pour la Génération Texte-À-Audio-Vidéo
TongSIM : une plateforme générale pour la simulation de machines intelligentes
Qwen-Image-Layered : Vers une éditabilité intrinsèque grâce à la décomposition en couches
RoboSafe : Protéger les agents incarnés grâce à une logique de sécurité exécutable
Évaluation en situation réelle des revues de sécurité des médicaments par les modèles linguistiques massifs dans les soins primaires du NHS
Analyse thématique multi-LLM avec métriques de fiabilité duals : combinaison du kappa de Cohen et de la similarité sémantique pour la validation de la recherche qualitative
L'intelligence active dans les avatars vidéo grâce à la modélisation mondiale boucle fermée
FaithLens : Détection et explication de l’hallucination de fidélité
SAM Audio : Segmenter n'importe quoi dans l'audio
Rapport technique Step-DeepResearch
SpatialTree : Comment les capacités spatiales se développent-elles dans les MLLM
SemanticGen : Génération vidéo dans l'espace sémantique
Planification automatisée de la radiochirurgie stéréotaxique à l'aide d'un agent de modèle de langage à grande échelle à raisonnement en boucle humaine
LongVideoAgent : raisonnement multi-agents avec des vidéos longues
GenEnv : Co-évolution alignée par la difficulté entre des agents LLM et des simulateurs d’environnement
WorldWarp : Propagation de la géométrie 3D via la diffusion vidéo asynchrone
LoGoPlanner : Politique de navigation fondée sur la localisation avec géométrie visuelle consciente des métriques
Peuvent les LLM prédire les difficultés des étudiants ? Alignement entre humains et IA sur la difficulté grâce à une simulation de compétence pour la prévision de la difficulté des items
QuCo-RAG : Quantification de l’incertitude à partir du corpus de pré-entraînement pour une génération augmentée par récupération dynamique
L'hypothèse Prism : Harmonisation des représentations sémantiques et pixeliques par auto-encodage unifié
Med-Banana-50K : Un grand jeu de données multimodales pour l'édition d'images médicales guidée par le texte
Kascade : Une méthode pratique d’attention creuse pour l’inférence des LLM à contexte long
GLM-4.5 : Modèles fondamentaux agents, raisonnants et codants (ARC)
GroundingME : Mettre en évidence le fossé de l'ancrage visuel dans les MLLM par évaluation multidimensionnelle