Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

EmoBench-M : Évaluation de l'intelligence émotionnelle des grands modèles linguistiques multimodaux

FDABench : un benchmark pour les agents de données sur les requêtes analytiques sur des données hétérogènes






























Peindre plus facile que penser : les modèles texte-image peuvent-ils préparer la scène, mais pas diriger le spectacle ?
UniVerse-1 : Génération audiovisuelle unifiée par assemblage d'experts
Quelle est la qualité des modèles fondamentaux dans le raisonnement incarné étape par étape ?
Rapport technique SpikingBrain : Modèles grands inspirés du cerveau à déclenchement d'impulsions
SAGE : Un benchmark réaliste pour la compréhension sémantique
WAVECLIP : Tokenisation par ondelettes pour CLIP à résolution adaptative
EmbeddingGemma : Des représentations textuelles puissantes et légères
Avancement de la compréhension du discours dans les modèles linguistiques conscients du discours grâce au GRPO
À quel point les VLM sont-ils éloignés de l'intelligence visuo-spatiale ? Une perspective pilotée par un benchmark
SIM-CoT : Chaîne de raisonnement implicite supervisée
SWE-QA : Les modèles de langage peuvent-ils répondre à des questions sur le code au niveau du dépôt ?
Les modèles vidéo sont des apprenants et raisonneurs zéro-shot
Une agence GPT N-Plus-1 pour la résolution critique de problèmes d'analyse en génie mécanique
Memory-QA : réponse à des questions de rappel basée sur des mémoires multimodales
MAPO : Optimisation politique à avantages mixtes
Hyper-Bagel : un cadre unifié d'accélération pour la compréhension et la génération multimodales
Apprentissage par renforcement sur les données d'entraînement préalable
Avez-vous besoin d’états proprioceptifs dans les politiques visuomotrices ?
Baseer : un modèle vision-langage pour la reconnaissance optique de caractères de documents arabes vers Markdown
GenExam : un examen multidisciplinaire texte-à-image
Nav-R1 : Raisonnement et navigation dans des scènes incarnées
Les MoE sont plus puissantes que vous ne le pensez : l'échelle d'inférence hyper-parallèle avec RoE
ARE : Agrandissement des environnements d'agents et des évaluations
DiffusionNFT : Renforcement par diffusion en ligne avec processus avant
TempSamp-R1 : Échantillonnage temporel efficace avec une adaptation par renforcement pour les modèles linguistiques vidéo
OnePiece : Intégration de l'ingénierie du contexte et du raisonnement dans un système industriel de classement en cascade
OmniInsert : Insertion vidéo sans masque de toute référence par le biais de modèles de transformation par diffusion
LIMI : Moins, c'est plus pour l'agence
Une approche par réseau de neurones à fusion modulaire pour prédire efficacement les sites de liaison à plusieurs métaux dans les séquences protéiques
IndexTTS2 : Une avancée dans la synthèse vocale auto-régressive zéro-shot expressivement émotionnelle et contrôlable en durée