Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

CoInteract : Synthèse de vidéos d'interaction humain-objet physiquement cohérente via une co-génération à structure spatiale

Tstars-Tryon 1.0 : un essayage virtuel robuste et réaliste pour des articles de mode diversifiés































CoInteract : Synthèse de vidéos d'interaction humain-objet physiquement cohérente via une co-génération à structure spatiale

Tstars-Tryon 1.0 : un essayage virtuel robuste et réaliste pour des articles de mode diversifiés






























Kernels de déquantification NF4 rapides pour l'inférence de Large Language Model
EasyVideoR1 : Un apprentissage par renforcement facilité pour la compréhension vidéo
MultiWorld : Modèles de monde vidéo multi-vues et multi-agents évolutifs
OpenGame : Open Agentic Coding pour les jeux
Agent-World : Passage à l'échelle de la synthèse d'environnements réels pour l'évolution de l'intelligence généraliste des agents
OneVL : Raisonnement et planification latents en une seule étape avec explication vision-langage
Extension de la génération d'images en une étape des étiquettes de classe vers le texte via une représentation textuelle discriminative
ScribblePrompt : une segmentation interactive rapide et flexible pour toute image biomédicale
Long-VITA : Étendre les Large Multi-modal Models à 1 million de tokens tout en maintenant une précision de pointe sur les contextes courts
UI-TARS : Pionnier de l'interaction GUI automatisée avec des Agents natifs
HunyuanVideo : Un cadre systématique pour les Large Video Generative Models
MathNet : un benchmark multimodal global pour le raisonnement mathématique et la récupération d'informations
L'externalisation dans les LLM Agents : Une revue unifiée de la mémoire, des skills, des protocoles et de l'ingénierie de harness
Compression de Contexte Active : Gestion Autonome de la Mémoire dans les LLM Agents
Limitez vos pertes ! Apprendre à élaguer les chemins tôt pour un reasoning parallèle efficace.
Rapport Technique de Qwen3.5-Omni
Découpage conscient de la recherche Web (W-RAC) pour des systèmes de Retrieval-Augmented Generation efficaces et rentables.
PersonaVLM : LLMs Multimodaux Personnalisés à Long Terme
Dommages cérébraux maximaux sans données ni optimisation : perturber les Neural Networks via des flips de sign-bit.
Élucider le biais SNR-t des Diffusion Probabilistic Models
OCR multimodal : analyser n'importe quel élément à partir de documents
Granite-speech : des LLMs open-source sensibles à la parole dotés de fortes capacités d'ASR en anglais
Fish-Speech : Exploiter les Large Language Models pour une synthèse Text-to-Speech multilingue avancée
Suppression d'objets et d'interactions dans les vidéos
VoxCPM : une synthèse vocale sans tokenizer pour la génération de parole sensible au contexte et un clonage de voix ultra-réaliste
OmniVoice : Vers un Text-to-Speech omnilingue en Zero-Shot avec des Diffusion Language Models
Là où la vision devient texte : localisation du goulot d'étranglement du routage OCR dans les Vision-Language Models
OCR ou non ? Repenser l'extraction d'informations documentaires à l'ère des MLLMs à l'aide de jeux de données à grande échelle du monde réel
dnaHNet : un modèle de fondation hiérarchique et scalable pour l'apprentissage de séquences génomiques
Ordinateurs neuronaux
Kernels de déquantification NF4 rapides pour l'inférence de Large Language Model
EasyVideoR1 : Un apprentissage par renforcement facilité pour la compréhension vidéo
MultiWorld : Modèles de monde vidéo multi-vues et multi-agents évolutifs
OpenGame : Open Agentic Coding pour les jeux
Agent-World : Passage à l'échelle de la synthèse d'environnements réels pour l'évolution de l'intelligence généraliste des agents
OneVL : Raisonnement et planification latents en une seule étape avec explication vision-langage
Extension de la génération d'images en une étape des étiquettes de classe vers le texte via une représentation textuelle discriminative
ScribblePrompt : une segmentation interactive rapide et flexible pour toute image biomédicale
Long-VITA : Étendre les Large Multi-modal Models à 1 million de tokens tout en maintenant une précision de pointe sur les contextes courts
UI-TARS : Pionnier de l'interaction GUI automatisée avec des Agents natifs
HunyuanVideo : Un cadre systématique pour les Large Video Generative Models
MathNet : un benchmark multimodal global pour le raisonnement mathématique et la récupération d'informations
L'externalisation dans les LLM Agents : Une revue unifiée de la mémoire, des skills, des protocoles et de l'ingénierie de harness
Compression de Contexte Active : Gestion Autonome de la Mémoire dans les LLM Agents
Limitez vos pertes ! Apprendre à élaguer les chemins tôt pour un reasoning parallèle efficace.
Rapport Technique de Qwen3.5-Omni
Découpage conscient de la recherche Web (W-RAC) pour des systèmes de Retrieval-Augmented Generation efficaces et rentables.
PersonaVLM : LLMs Multimodaux Personnalisés à Long Terme
Dommages cérébraux maximaux sans données ni optimisation : perturber les Neural Networks via des flips de sign-bit.
Élucider le biais SNR-t des Diffusion Probabilistic Models
OCR multimodal : analyser n'importe quel élément à partir de documents
Granite-speech : des LLMs open-source sensibles à la parole dotés de fortes capacités d'ASR en anglais
Fish-Speech : Exploiter les Large Language Models pour une synthèse Text-to-Speech multilingue avancée
Suppression d'objets et d'interactions dans les vidéos
VoxCPM : une synthèse vocale sans tokenizer pour la génération de parole sensible au contexte et un clonage de voix ultra-réaliste
OmniVoice : Vers un Text-to-Speech omnilingue en Zero-Shot avec des Diffusion Language Models
Là où la vision devient texte : localisation du goulot d'étranglement du routage OCR dans les Vision-Language Models
OCR ou non ? Repenser l'extraction d'informations documentaires à l'ère des MLLMs à l'aide de jeux de données à grande échelle du monde réel
dnaHNet : un modèle de fondation hiérarchique et scalable pour l'apprentissage de séquences génomiques
Ordinateurs neuronaux