Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

Attribution de crédit avec réinitialisations dans le raisonnement des modèles de langage

OCR à l'infini : Bienvenue dans l'ère de l'analyse à court terme avec un seul exemple






























PlanBench-XL : Évaluation de la planification à long horizon des agents d'utilisation d'outils LLM dans des écosystèmes d'outils à grande échelle
OpenRath : État d'exécution centré sur la session pour les Systèmes Agent
EvoEmbedding : Représentations Évoluables pour la Récupération de Contexte Long et la Mémoire Agentic
Apprendre de ses propres erreurs : Construire des trajectoires micro-réflexives apprenables pour l'auto-distillation
Modèles d'Action du Monde : Une Revue de Littérature
KaLM-Reranker-V1 : Rapide mais sans interaction tardive pour le réordonnancement de documents compressés
Repenser le biais de rétrécissement dans le pré-entraînement LLM en FP4 : origine géométrique, impact systémique et recette UFP4
HydraHead : De l'hétérogénéité fonctionnelle de niveau tête à l'hybridation spécialisée de l'attention
3DCodeBench : Évaluation des agents de modélisation 3D procédurale via le code
RadImageNet-VQA : Un grand ensemble de données CT et IRM pour la réponse visuelle à des questions en imagerie radiologique
Entraînement des agents et des vérificateurs en génie logiciel avec SWE-Gym
MAKIEVAL : Un cadre automatique multilingue basé sur WiKIdata pour l'évaluation de la sensibilisation culturelle des LLMs
GeneralVLA-2 : Reconstruction consciente de la géométrie et mémoire gouvernée pour la planification robotique
Masquage Réflexif Multi-Tour Élicite le Raisonnement dans les Modèles de Diffusion par Masquage
BrainG3N : Un Tokeniseur à Double Usage pour la Génération Contrôlée d'IRM Cérébrales 3D
GateMem : Évaluation de la gouvernance de la mémoire dans les Agents à mémoire partagée Multi-Principal
MemSlides : Un cadre d'agent hiérarchique piloté par la mémoire pour la génération de diapositives personnalisée avec révision locale multi-tours
PerceptionDLM : Perception parallèle de régions avec des modèles de langage de diffusion multimodaux
Modèles mondiaux du code pour le jeu généraliste de jeux
Au-delà des classements statiques : validité prédictive pour l'évaluation des agents LLM
S-Agent : Utilisation d'outils spatiaux élicite le raisonnement pour l'intelligence spatiale
Multi-LCB : Extension de LiveCodeBench à plusieurs langages de programmation
Apprentissage Robotique Agentic Ludique
DragMesh-2 : Interaction main-objet adroite physiquement plausible avec des objets articulés
Moebius : cadre léger d'inpainting d'images de 0.2B avec des performances de niveau 10B
EfficientRollout : Décodage auto-spéculatif conscient du système pour les rollouts RL
Faites confiance au bon enseignant : Auto-distillation consciente de la qualité pour l'ancrage GUI
Renforcement du raisonnement à double voie dans les modèles de langage visuel spatiaux
Les interventions SAE sont peu fiables : Récupération post-intervention des comportements supprimés
Kairos: Une pile de modèles du monde native pour l'IA physique