Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

OmniShow : Unifier les conditions multimodales pour la génération de vidéos de Human-Object Interaction

Le passé n'est pas passé : le Reward Shaping dynamique optimisé par la mémoire.































OmniShow : Unifier les conditions multimodales pour la génération de vidéos de Human-Object Interaction

Le passé n'est pas passé : le Reward Shaping dynamique optimisé par la mémoire.






























QuanBench+ : Un Benchmark unifié multi-framework pour la génération de code quantique basée sur les LLM
ELT : Transformers à boucles élastiques pour la génération visuelle
ECHO : Génération efficace de rapports de radiographie thoracique par One-step Block Diffusion
Matrix-Game 3.0 : Modèle de monde interactif en temps réel et en streaming avec une mémoire à long horizon.
Rapport technique d'EXAONE 4.5
RefineAnything : Raffinement multimodal spécifique à la région pour des détails locaux parfaits
FORGE : Évaluation multimodale à grain fin pour les scénarios de fabrication
WildDet3D : Passer à l'échelle de la détection 3D promptable en milieu sauvage (in the wild)
Autoreason : une auto-amélioration capable de savoir quand s'arrêter
ActiveGlasses : Apprentissage de la manipulation par vision active à partir de démonstrations humaines égocentrées
MegaStyle : Construction d'un dataset de styles diversifié et scalable via un mapping de style Text-to-Image cohérent
Lorsque les nombres parlent : Aligner les numéraux textuels et les instances visuelles dans les modèles Text-to-Video Diffusion.
HY-Embodied-0.5 : Des Embodied Foundation Models pour des Agents en conditions réelles.
ClawBench : Les AI Agents peuvent-ils accomplir des tâches quotidiennes en ligne ?
Repenser la Généralisation dans le SFT de Raisonnement : Une Analyse Conditionnelle sur l'Optimisation, les Données et la Capacité du Modèle
SkillClaw : Permettre aux Skills d'évoluer collectivement grâce à un Agentic Evolver
MDPBench : un benchmark pour le parsing de documents multilingues dans des scénarios du monde réel
TC-AE : Libérer la capacité des tokens pour les autoencodeurs de Deep Compression
INSPATIO-WORLD : Un simulateur de monde 4D en temps réel via la modélisation autoregressive spatiotemporelle
FlowInOne : Unifier la génération multimodale sous la forme d'un Flow Matching de type Image-in, Image-out.
MARS : Permettre la Multi-Token Generation pour les Modèles Autoregressive
Penser en traits plutôt qu'en pixels : la génération d'images pilotée par les processus via un raisonnement entrelacé.
RAGEN-2 : Effondrement du raisonnement dans le RL Agentique
Vanast : Virtual Try-On avec Human Image Animation via une supervision par triplets synthétiques
ThinkTwice : Optimisation conjointe des Large Language Models pour le raisonnement et l'auto-raffinement (Self-Refinement)
ACES : Qui teste les tests ? La cohérence de l'AUC Leave-One-Out pour la génération de code.
Apprendre à extraire des informations à partir de trajectoires d'Agent.
Claw-Eval : Vers une évaluation fiable des Autonomous Agents
Video-MME-v2 : Vers la prochaine étape des benchmarks pour la compréhension vidéo exhaustive
GrandCode : Atteindre le niveau Grandmaster en programmation compétitive via l'Agentic Reinforcement Learning
QuanBench+ : Un Benchmark unifié multi-framework pour la génération de code quantique basée sur les LLM
ELT : Transformers à boucles élastiques pour la génération visuelle
ECHO : Génération efficace de rapports de radiographie thoracique par One-step Block Diffusion
Matrix-Game 3.0 : Modèle de monde interactif en temps réel et en streaming avec une mémoire à long horizon.
Rapport technique d'EXAONE 4.5
RefineAnything : Raffinement multimodal spécifique à la région pour des détails locaux parfaits
FORGE : Évaluation multimodale à grain fin pour les scénarios de fabrication
WildDet3D : Passer à l'échelle de la détection 3D promptable en milieu sauvage (in the wild)
Autoreason : une auto-amélioration capable de savoir quand s'arrêter
ActiveGlasses : Apprentissage de la manipulation par vision active à partir de démonstrations humaines égocentrées
MegaStyle : Construction d'un dataset de styles diversifié et scalable via un mapping de style Text-to-Image cohérent
Lorsque les nombres parlent : Aligner les numéraux textuels et les instances visuelles dans les modèles Text-to-Video Diffusion.
HY-Embodied-0.5 : Des Embodied Foundation Models pour des Agents en conditions réelles.
ClawBench : Les AI Agents peuvent-ils accomplir des tâches quotidiennes en ligne ?
Repenser la Généralisation dans le SFT de Raisonnement : Une Analyse Conditionnelle sur l'Optimisation, les Données et la Capacité du Modèle
SkillClaw : Permettre aux Skills d'évoluer collectivement grâce à un Agentic Evolver
MDPBench : un benchmark pour le parsing de documents multilingues dans des scénarios du monde réel
TC-AE : Libérer la capacité des tokens pour les autoencodeurs de Deep Compression
INSPATIO-WORLD : Un simulateur de monde 4D en temps réel via la modélisation autoregressive spatiotemporelle
FlowInOne : Unifier la génération multimodale sous la forme d'un Flow Matching de type Image-in, Image-out.
MARS : Permettre la Multi-Token Generation pour les Modèles Autoregressive
Penser en traits plutôt qu'en pixels : la génération d'images pilotée par les processus via un raisonnement entrelacé.
RAGEN-2 : Effondrement du raisonnement dans le RL Agentique
Vanast : Virtual Try-On avec Human Image Animation via une supervision par triplets synthétiques
ThinkTwice : Optimisation conjointe des Large Language Models pour le raisonnement et l'auto-raffinement (Self-Refinement)
ACES : Qui teste les tests ? La cohérence de l'AUC Leave-One-Out pour la génération de code.
Apprendre à extraire des informations à partir de trajectoires d'Agent.
Claw-Eval : Vers une évaluation fiable des Autonomous Agents
Video-MME-v2 : Vers la prochaine étape des benchmarks pour la compréhension vidéo exhaustive
GrandCode : Atteindre le niveau Grandmaster en programmation compétitive via l'Agentic Reinforcement Learning