Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

EvalVerse : Évaluation consciente du pipeline et calibrée par des experts pour la génération de vidéos cinématographiques professionnelles

MobileGym : Une plateforme de simulation vérifiable et hautement parallèle pour la recherche sur les Mobile GUI Agent































EvalVerse : Évaluation consciente du pipeline et calibrée par des experts pour la génération de vidéos cinématographiques professionnelles

MobileGym : Une plateforme de simulation vérifiable et hautement parallèle pour la recherche sur les Mobile GUI Agent






























SpatialBench : Votre modèle fondamental spatial est-il un joueur polyvalent ?
LocateAnything : Ancrage vision-langage rapide et de haute qualité avec décodage parallèle de boîtes
Gemini Embedding 2 : Un modèle d’embedding multimodal natif de Gemini
Les modèles de langage ont besoin de sommeil
ECHO : Les agents terminaux apprennent des modèles du monde gratuitement
ParaVT : Dompter le paradoxe de l'antériorité des outils pour l'utilisation parallèle des outils dans l'apprentissage par renforcement vidéo agentique
TriSplat : Reconstruction de scènes 3D en avant-prévision prête pour la simulation
Protocole de fondation : une couche de coordination pour la société agentique
WBench : Un benchmark complet multi-tours pour l'évaluation des modèles de monde vidéo interactifs
Macaron-A2UI : Un modèle pour l'interface utilisateur générative dans les agents personnels
DVAO : Optimisation dynamique de l'avantage à variance adaptative pour l'apprentissage par renforcement multi-récompense
ViMU : Évaluation de la compréhension des métaphores vidéo
SMOL : Données parallèles professionnellement traduites pour 115 langues sous-représentées
Chi-Bench : Les agents d’IA peuvent-ils automatiser des workflows de santé complets, à long terme et riches en politiques ?
Combinaison de l’optimisation on-policy et de la distillation pour le raisonnement à long contexte dans les grands modèles de langage
À travers le prisme du contraste : auto-amélioration du raisonnement visuel dans les VLMs
HRM-Text: Un préentraînement efficace au-delà de la mise à l’échelle
Voir ce que je veux dire : Aligner les représentations visuelles et linguistiques pour la compréhension fine des objets dans les vidéos
Rapport technique StepAudio 2.5
SciAtlas : Un graphe de connaissances à grande échelle pour la recherche scientifique automatisée
Repenser le routage de l'information inter-couches dans les Transformers de diffusion
Lens : Repenser l'efficacité de l'entraînement pour les modèles fondamentaux de texte vers image
SkillOpt : Stratégie exécutive pour des compétences d'agent auto-évoluant
CVEvolve : Découverte autonome d'algorithmes pour le traitement des données scientifiques non structurées
Poly-EPO : Entraînement des modèles de raisonnement exploratoire
Résumé
ACC : Compilation des trajectoires d'agents pour l'entraînement à long contexte
L'attention complète frappe à nouveau : transférer l'attention complète en attention sparse en quelques centaines d'étapes d'entraînement
π-Bench : Évaluation des agents assistants personnels proactifs dans les workflows à long terme
Perception ou préjugé : les MLLMs peuvent-ils aller au-delà des premières impressions de personnalité ?
SpatialBench : Votre modèle fondamental spatial est-il un joueur polyvalent ?
LocateAnything : Ancrage vision-langage rapide et de haute qualité avec décodage parallèle de boîtes
Gemini Embedding 2 : Un modèle d’embedding multimodal natif de Gemini
Les modèles de langage ont besoin de sommeil
ECHO : Les agents terminaux apprennent des modèles du monde gratuitement
ParaVT : Dompter le paradoxe de l'antériorité des outils pour l'utilisation parallèle des outils dans l'apprentissage par renforcement vidéo agentique
TriSplat : Reconstruction de scènes 3D en avant-prévision prête pour la simulation
Protocole de fondation : une couche de coordination pour la société agentique
WBench : Un benchmark complet multi-tours pour l'évaluation des modèles de monde vidéo interactifs
Macaron-A2UI : Un modèle pour l'interface utilisateur générative dans les agents personnels
DVAO : Optimisation dynamique de l'avantage à variance adaptative pour l'apprentissage par renforcement multi-récompense
ViMU : Évaluation de la compréhension des métaphores vidéo
SMOL : Données parallèles professionnellement traduites pour 115 langues sous-représentées
Chi-Bench : Les agents d’IA peuvent-ils automatiser des workflows de santé complets, à long terme et riches en politiques ?
Combinaison de l’optimisation on-policy et de la distillation pour le raisonnement à long contexte dans les grands modèles de langage
À travers le prisme du contraste : auto-amélioration du raisonnement visuel dans les VLMs
HRM-Text: Un préentraînement efficace au-delà de la mise à l’échelle
Voir ce que je veux dire : Aligner les représentations visuelles et linguistiques pour la compréhension fine des objets dans les vidéos
Rapport technique StepAudio 2.5
SciAtlas : Un graphe de connaissances à grande échelle pour la recherche scientifique automatisée
Repenser le routage de l'information inter-couches dans les Transformers de diffusion
Lens : Repenser l'efficacité de l'entraînement pour les modèles fondamentaux de texte vers image
SkillOpt : Stratégie exécutive pour des compétences d'agent auto-évoluant
CVEvolve : Découverte autonome d'algorithmes pour le traitement des données scientifiques non structurées
Poly-EPO : Entraînement des modèles de raisonnement exploratoire
Résumé
ACC : Compilation des trajectoires d'agents pour l'entraînement à long contexte
L'attention complète frappe à nouveau : transférer l'attention complète en attention sparse en quelques centaines d'étapes d'entraînement
π-Bench : Évaluation des agents assistants personnels proactifs dans les workflows à long terme
Perception ou préjugé : les MLLMs peuvent-ils aller au-delà des premières impressions de personnalité ?