Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Triton-distribué : Programmation de noyaux chevauchants sur des systèmes d'IA distribués avec le compilateur Triton

Extension des transformateurs de diffusion texte-image à l’aide d’autoencodeurs de représentation































Triton-distribué : Programmation de noyaux chevauchants sur des systèmes d'IA distribués avec le compilateur Triton

Extension des transformateurs de diffusion texte-image à l’aide d’autoencodeurs de représentation






























BayesianVLA : Décomposition bayésienne des modèles vision-langage-action à l’aide de requêtes d’action latentes
Le piège de la flexibilité : pourquoi les limites d’ordre arbitraire restreignent le potentiel de raisonnement des modèles linguistiques à diffusion
LLM-in-Sandbox Évoque une Intelligence Agente Générale
HERMES : Mémoire tampon KV comme mémoire hiérarchique pour une compréhension efficace des vidéos en flux
EvoCUA : Évolution d'agents d'utilisation informatique par apprentissage à partir d'expériences synthétiques évolutives
Rapport technique HY-MT1.5
Lois d'échelle pour le code : chaque langage de programmation compte
Rapport technique Qwen3-TTS
Petits modèles, grands résultats : atteindre une extraction d'intention supérieure grâce à la décomposition
FinVault : Évaluation de la sécurité des agents financiers dans des environnements fondés sur l'exécution
MMDeepResearch-Bench : Un benchmark pour les agents de recherche profonde multimodaux
DARC : Programme d'apprentissage déconnecté et asymétrique pour l'évolution des LLM
Réfléchir à nouveau aux modèles de génération vidéo pour le monde incarné
Paper2Rebuttal : un cadre multi-agents pour une assistance transparente à la réponse des auteurs
Raisonnement agencent pour les grands modèles linguistiques
PERSONAPLEX : CONTRÔLE DE VOIX ET DE RÔLE POUR LES MODÈLES DE PAROLE CONVERSATIONNELLE À DÉPLEXAGE COMPLET
FlashLabs Chroma 1.0 : un modèle de dialogue parlé en temps réel et bout-en-bout avec clonage vocal personnalisé
MemoryRewardBench : Évaluation des modèles de récompense pour la gestion de la mémoire à long terme dans les grands modèles linguistiques
OmniTransfer : Cadre tout-en-un pour le transfert vidéo spatio-temporel
Vers des Agents Performants : Mémoire, Apprentissage d'Outils et Planification
FutureOmni : Évaluation de la prévision de l'avenir à partir d'un contexte omni-modal pour les LLM multimodaux
Being-H0.5 : Pilotage de l'apprentissage robotique centré sur l'humain pour une généralisation trans-embodiment
Avancées et frontières de la résolution de problèmes basée sur les LLM en génie logiciel : une revue complète
Nemotron-Math : Distillation efficace de raisonnement mathématique à long contexte via une supervision multi-mode
Construction d'indicateurs prêts à l'emploi pour Gemini
Rapport technique LFM2
CoDance : Un paradigme déliaison-réliaison pour l'animation multi-sujets robuste
L’axe de l’Assistante : Situer et stabiliser la personnalité par défaut des modèles linguistiques
ABC-Bench : Évaluation de la programmation côté serveur agissant dans les environnements de développement réels
Pensée multiplexe : raisonnement par branchement et fusion au niveau des tokens
BayesianVLA : Décomposition bayésienne des modèles vision-langage-action à l’aide de requêtes d’action latentes
Le piège de la flexibilité : pourquoi les limites d’ordre arbitraire restreignent le potentiel de raisonnement des modèles linguistiques à diffusion
LLM-in-Sandbox Évoque une Intelligence Agente Générale
HERMES : Mémoire tampon KV comme mémoire hiérarchique pour une compréhension efficace des vidéos en flux
EvoCUA : Évolution d'agents d'utilisation informatique par apprentissage à partir d'expériences synthétiques évolutives
Rapport technique HY-MT1.5
Lois d'échelle pour le code : chaque langage de programmation compte
Rapport technique Qwen3-TTS
Petits modèles, grands résultats : atteindre une extraction d'intention supérieure grâce à la décomposition
FinVault : Évaluation de la sécurité des agents financiers dans des environnements fondés sur l'exécution
MMDeepResearch-Bench : Un benchmark pour les agents de recherche profonde multimodaux
DARC : Programme d'apprentissage déconnecté et asymétrique pour l'évolution des LLM
Réfléchir à nouveau aux modèles de génération vidéo pour le monde incarné
Paper2Rebuttal : un cadre multi-agents pour une assistance transparente à la réponse des auteurs
Raisonnement agencent pour les grands modèles linguistiques
PERSONAPLEX : CONTRÔLE DE VOIX ET DE RÔLE POUR LES MODÈLES DE PAROLE CONVERSATIONNELLE À DÉPLEXAGE COMPLET
FlashLabs Chroma 1.0 : un modèle de dialogue parlé en temps réel et bout-en-bout avec clonage vocal personnalisé
MemoryRewardBench : Évaluation des modèles de récompense pour la gestion de la mémoire à long terme dans les grands modèles linguistiques
OmniTransfer : Cadre tout-en-un pour le transfert vidéo spatio-temporel
Vers des Agents Performants : Mémoire, Apprentissage d'Outils et Planification
FutureOmni : Évaluation de la prévision de l'avenir à partir d'un contexte omni-modal pour les LLM multimodaux
Being-H0.5 : Pilotage de l'apprentissage robotique centré sur l'humain pour une généralisation trans-embodiment
Avancées et frontières de la résolution de problèmes basée sur les LLM en génie logiciel : une revue complète
Nemotron-Math : Distillation efficace de raisonnement mathématique à long contexte via une supervision multi-mode
Construction d'indicateurs prêts à l'emploi pour Gemini
Rapport technique LFM2
CoDance : Un paradigme déliaison-réliaison pour l'animation multi-sujets robuste
L’axe de l’Assistante : Situer et stabiliser la personnalité par défaut des modèles linguistiques
ABC-Bench : Évaluation de la programmation côté serveur agissant dans les environnements de développement réels
Pensée multiplexe : raisonnement par branchement et fusion au niveau des tokens