Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

PHUMA : Jeu de données de locomotion humanoïde fondé sur le physique

UniREditBench : Un benchmark d'édition d'images fondé sur le raisonnement unifié































PHUMA : Jeu de données de locomotion humanoïde fondé sur le physique

UniREditBench : Un benchmark d'édition d'images fondé sur le raisonnement unifié






























Généralisation de l'échelle optimale du calcul au moment du test sous forme de graphe optimisable
UniLumos : Relumière rapide et unifiée d'images et de vidéos avec une rétroaction physiquement plausible
Le pouvoir sous-estimé des modèles de vision pour la compréhension de la structure des graphes
Chaque activation boostée : mise à l’échelle du raisonneur général à 1 billion de fondamentaux linguistiques ouverts
NOBLE - Opérateur neuronal à embeddings latents inspirés de la biologie pour capturer la variabilité expérimentale dans les modèles neuronaux biologiques
Glia : une IA inspirée de l'humain pour la conception et l'optimisation automatisées des systèmes
Ingénierie du contexte 2.0 : Le contexte de l'ingénierie du contexte
Spatial-SSRL : Amélioration de la compréhension spatiale par apprentissage par renforcement auto-supervisé
Modèles de langage autorégressifs continus
πRL : Affinage en ligne par apprentissage par renforcement pour les modèles vision-langage-action fondés sur les flux
INT contre FP : Une étude approfondie des formats de quantification à faible précision et fine granularité
ThinkMorph : Propriétés émergentes dans le raisonnement en chaîne de pensée multimodal entrelacé
OS-Sentinel : Vers des agents GUI mobiles à sécurité renforcée grâce à une validation hybride dans des flux de travail réalistes
L'ère de l'organisation agente : Apprendre à organiser avec les modèles linguistiques
SPICE : l'apprentissage par auto-jeu dans des environnements de corpus améliore le raisonnement
Surfer 2 : La prochaine génération d'agents informatiques multiplateformes
Exploration des conditions des modèles de diffusion en contrôle robotique
Peut un agent maîtriser le web ? Exploration des frontières de l'agent ChatGPT Atlas dans les jeux web
Kimi Linear : une architecture d'attention expressive et efficace
Emu3.5 : les modèles multimodaux natifs sont des apprenants du monde
La fin du décodage manuel : vers des modèles linguistiques véritablement end-to-end
Complémentarité homme-IA : une cible pour un contrôle renforcé
GPTOpt : Vers une optimisation par boîte noire basée sur les grands modèles linguistiques efficace
VFXMaster : Déverrouiller la génération de effets visuels dynamiques grâce à l'apprentissage in-context
GRPO conscient des raisonnements utilisant le mining de processus
Échelle du raisonnement latent par modèles linguistiques bouclés
ReForm : autoformalisation réfléchie avec optimisation séquentielle à bornes prospectives
Video-Thinker : Déclencher la « pensée à travers les vidéos » grâce à l'apprentissage par renforcement
JanusCoder : Vers une interface fondamentale visuelle et programmatique pour l'intelligence du code
MCP-Flow : Faciliter aux agents LLM à maîtriser des outils MCP réels, diversifiés et évolutifs
Généralisation de l'échelle optimale du calcul au moment du test sous forme de graphe optimisable
UniLumos : Relumière rapide et unifiée d'images et de vidéos avec une rétroaction physiquement plausible
Le pouvoir sous-estimé des modèles de vision pour la compréhension de la structure des graphes
Chaque activation boostée : mise à l’échelle du raisonneur général à 1 billion de fondamentaux linguistiques ouverts
NOBLE - Opérateur neuronal à embeddings latents inspirés de la biologie pour capturer la variabilité expérimentale dans les modèles neuronaux biologiques
Glia : une IA inspirée de l'humain pour la conception et l'optimisation automatisées des systèmes
Ingénierie du contexte 2.0 : Le contexte de l'ingénierie du contexte
Spatial-SSRL : Amélioration de la compréhension spatiale par apprentissage par renforcement auto-supervisé
Modèles de langage autorégressifs continus
πRL : Affinage en ligne par apprentissage par renforcement pour les modèles vision-langage-action fondés sur les flux
INT contre FP : Une étude approfondie des formats de quantification à faible précision et fine granularité
ThinkMorph : Propriétés émergentes dans le raisonnement en chaîne de pensée multimodal entrelacé
OS-Sentinel : Vers des agents GUI mobiles à sécurité renforcée grâce à une validation hybride dans des flux de travail réalistes
L'ère de l'organisation agente : Apprendre à organiser avec les modèles linguistiques
SPICE : l'apprentissage par auto-jeu dans des environnements de corpus améliore le raisonnement
Surfer 2 : La prochaine génération d'agents informatiques multiplateformes
Exploration des conditions des modèles de diffusion en contrôle robotique
Peut un agent maîtriser le web ? Exploration des frontières de l'agent ChatGPT Atlas dans les jeux web
Kimi Linear : une architecture d'attention expressive et efficace
Emu3.5 : les modèles multimodaux natifs sont des apprenants du monde
La fin du décodage manuel : vers des modèles linguistiques véritablement end-to-end
Complémentarité homme-IA : une cible pour un contrôle renforcé
GPTOpt : Vers une optimisation par boîte noire basée sur les grands modèles linguistiques efficace
VFXMaster : Déverrouiller la génération de effets visuels dynamiques grâce à l'apprentissage in-context
GRPO conscient des raisonnements utilisant le mining de processus
Échelle du raisonnement latent par modèles linguistiques bouclés
ReForm : autoformalisation réfléchie avec optimisation séquentielle à bornes prospectives
Video-Thinker : Déclencher la « pensée à travers les vidéos » grâce à l'apprentissage par renforcement
JanusCoder : Vers une interface fondamentale visuelle et programmatique pour l'intelligence du code
MCP-Flow : Faciliter aux agents LLM à maîtriser des outils MCP réels, diversifiés et évolutifs