Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

dLLM : Modélisation simple du langage par diffusion

Agent LLM à mémoire augmentée exploratoire par optimisation hybride sur et hors politique































dLLM : Modélisation simple du langage par diffusion

Agent LLM à mémoire augmentée exploratoire par optimisation hybride sur et hors politique






























L’imagination aide le raisonnement visuel, mais pas encore dans l’espace latent
OmniGAIA : Vers des agents IA omnimodaux natifs
MobilityBench : un benchmark pour évaluer les Agents de planification de trajets dans des scénarios de mobilité du monde réel
Des points aveugles aux gains : une formation itérative pilotée par le diagnostic pour les grands modèles multimodaux
La Trinité de la Cohérence en tant que Principe Définissant des Modèles Mondiaux Généraux
GUI-Libra : Entraînement d'agents GUI natifs à raisonner et agir grâce à une supervision consciente des actions et à un apprentissage par renforcement partiellement vérifiable
SkyReels-V4 : modèle de génération, de comblement et d'édition vidéo-audio multimodale
ARLArena : Un cadre unifié pour l'apprentissage par renforcement agencé stable
DreamID-Omni : Cadre unifié pour la génération audiovisuelle contrôlable centrée sur l’humain
MolHIT : Progresser dans la génération de graphes moléculaires grâce à des modèles de diffusion discrète hiérarchiques
HyTRec : Une architecture hybride à attention sensible au temps pour la recommandation séquentielle de longues séquences de comportements
DREAM : Évaluation de la recherche approfondie avec des métriques agences
LongCLI-Bench : Un benchmark préliminaire et une étude sur la programmation agente à horizon long dans les interfaces en ligne de commande
PyVision-RL : Développement de modèles visionnels agents ouverts par apprentissage par renforcement
De la perception à l’action : une benchmark interactive pour le raisonnement visuel
Reranker centré sur la requête et conscient de la mémoire pour le traitement de contextes longs
Sur l'ingénierie des données pour l'extension des capacités terminales des LLM
DSDR : Régularisation par diversité à double échelle pour l’exploration dans le raisonnement des LLM
Mobile-O : Compréhension et génération multimodale unifiées sur appareil mobile
TOPReward : Probabilités de tokens comme récompenses cachées zéro-shot pour la robotique
ManCAR : Raisonnement latent contraint par variété avec calcul adaptatif en temps de test pour la recommandation séquentielle
VLANeXt : Des Recettes pour Construire des Modèles VLA Robustes
Un très grand ensemble de raisonnement vidéo
Entraînement sélectif des grands modèles vision-langage par gain d'information visuelle
DeepVision-103K : Un jeu de données mathématique à large couverture, diversifié visuellement et vérifiable pour le raisonnement multimodal
SARAH : Humains agents en temps réel sensibles à l'espace
EgoPush : Apprentissage d'une réarrangement multi-objets egocentrique bout-en-bout pour les robots mobiles
Realité générée : simulation du monde centrée sur l’humain à l’aide de la génération vidéo interactive avec contrôle de la main et de la caméra
VESPO : Optimisation Variationnelle de Politique Douce au Niveau de la Séquence pour une Formation Stable des LLM en Mode Hors-Échantillonnage
Rapport technique Arcee Trinity
L’imagination aide le raisonnement visuel, mais pas encore dans l’espace latent
OmniGAIA : Vers des agents IA omnimodaux natifs
MobilityBench : un benchmark pour évaluer les Agents de planification de trajets dans des scénarios de mobilité du monde réel
Des points aveugles aux gains : une formation itérative pilotée par le diagnostic pour les grands modèles multimodaux
La Trinité de la Cohérence en tant que Principe Définissant des Modèles Mondiaux Généraux
GUI-Libra : Entraînement d'agents GUI natifs à raisonner et agir grâce à une supervision consciente des actions et à un apprentissage par renforcement partiellement vérifiable
SkyReels-V4 : modèle de génération, de comblement et d'édition vidéo-audio multimodale
ARLArena : Un cadre unifié pour l'apprentissage par renforcement agencé stable
DreamID-Omni : Cadre unifié pour la génération audiovisuelle contrôlable centrée sur l’humain
MolHIT : Progresser dans la génération de graphes moléculaires grâce à des modèles de diffusion discrète hiérarchiques
HyTRec : Une architecture hybride à attention sensible au temps pour la recommandation séquentielle de longues séquences de comportements
DREAM : Évaluation de la recherche approfondie avec des métriques agences
LongCLI-Bench : Un benchmark préliminaire et une étude sur la programmation agente à horizon long dans les interfaces en ligne de commande
PyVision-RL : Développement de modèles visionnels agents ouverts par apprentissage par renforcement
De la perception à l’action : une benchmark interactive pour le raisonnement visuel
Reranker centré sur la requête et conscient de la mémoire pour le traitement de contextes longs
Sur l'ingénierie des données pour l'extension des capacités terminales des LLM
DSDR : Régularisation par diversité à double échelle pour l’exploration dans le raisonnement des LLM
Mobile-O : Compréhension et génération multimodale unifiées sur appareil mobile
TOPReward : Probabilités de tokens comme récompenses cachées zéro-shot pour la robotique
ManCAR : Raisonnement latent contraint par variété avec calcul adaptatif en temps de test pour la recommandation séquentielle
VLANeXt : Des Recettes pour Construire des Modèles VLA Robustes
Un très grand ensemble de raisonnement vidéo
Entraînement sélectif des grands modèles vision-langage par gain d'information visuelle
DeepVision-103K : Un jeu de données mathématique à large couverture, diversifié visuellement et vérifiable pour le raisonnement multimodal
SARAH : Humains agents en temps réel sensibles à l'espace
EgoPush : Apprentissage d'une réarrangement multi-objets egocentrique bout-en-bout pour les robots mobiles
Realité générée : simulation du monde centrée sur l’humain à l’aide de la génération vidéo interactive avec contrôle de la main et de la caméra
VESPO : Optimisation Variationnelle de Politique Douce au Niveau de la Séquence pour une Formation Stable des LLM en Mode Hors-Échantillonnage
Rapport technique Arcee Trinity