Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

TruthRL : Inciter les grands modèles linguistiques à être véridiques par apprentissage par renforcement

Gagner le pari de la taille : une approche unifiée pour la suppression conjointe d'échantillons et de tokens afin d'optimiser le fine-tuning supervisé






























Le Dragonnaître : le lien manquant entre le Transformer et les modèles du cerveau
Vision-Zero : Amélioration autonome des modèles linguistiques-visuels évolutifs par un auto-jeu stratégique et ludifié
MCPMark : un benchmark pour tester la résilience des utilisations réalistes et complètes de l'agent MCP
La notation de politique aléatoire suffit pour le raisonnement des LLM avec des récompenses vérifiables
Démocratiser les scientifiques en intelligence artificielle à l’aide de ToolUniverse
Quand le raisonnement compte-t-il ? Une étude contrôlée sur la contribution du raisonnement à la performance des modèles
Optimisation préférentielle de Nash en multi-joueurs
StableToken : un tokenizer sémantique pour la parole résistant au bruit pour des modèles linguistiques vocaux résilients
SLA : Au-delà de la parcimonie dans les transformateurs à diffusion grâce à une attention parcimonieuse ajustable fine
SimpleFold : replier les protéines est plus simple que vous ne le pensez
POINTS-Reader : Adaptation sans distillation de modèles vision-langage pour la conversion de documents
Synthèse de légendes d'images géométriques généralisables
Avantages et pièges de l'apprentissage par renforcement pour la planification des modèles de langage : une perspective théorique
Estimation du pouvoir d'agir des agents basés sur les modèles linguistiques
Les modèles linguistiques peuvent apprendre à partir de retours verbaux sans récompenses scalaires
Raisonnement variationnel pour les modèles de langage
EPO : Optimisation de politique régularisée par entropie pour les agents LLM Apprentissage par renforcement
MinerU2.5 : un modèle vision-langage déconnecté pour une analyse efficace de documents à haute résolution
Estimation de l'avantage quantile pour un raisonnement sûr en entropie
LongLive : Génération en temps réel d'images vidéo longues interactives
Créativité combinatoire : une nouvelle frontière des capacités de généralisation
Prédiction spatio-temporelle causale : une approche multi-modale efficace et performante
Hunyuan3D-Omni : Un cadre unifié pour la génération contrôlable de ressources 3D
Seedream 4.0 : Vers une génération d’images multimodales de nouvelle génération
Recherche arborescente pour l'apprentissage par renforcement des agents LLM
SciReasoner : Établir les fondements du raisonnement scientifique à travers les disciplines
MMR1 : Amélioration du raisonnement multimodal grâce à un échantillonnage conscient de la variance et à des ressources ouvertes
VCRL : apprentissage par renforcement avec curriculum basé sur la variance pour les grands modèles linguistiques
MultiEdit : Progresser dans l'édition d'images basée sur les instructions sur des tâches diverses et exigeantes
BRISC : Jeu de données annoté pour la segmentation et la classification des tumeurs cérébrales avec Swin-HAFNet