Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Sur le rôle de la discrétisation dans les LLM de diffusion

DiffThinker : Vers un raisonnement multimodal génératif basé sur les modèles de diffusion































Sur le rôle de la discrétisation dans les LLM de diffusion

DiffThinker : Vers un raisonnement multimodal génératif basé sur les modèles de diffusion






























Modèles de grands concepts dynamiques : raisonnement latent dans un espace sémantique adaptatif
Amélioration du RAG multi-étapes grâce à une mémoire basée sur des hypergraphes pour une modélisation complexe des relations à long contexte
L'IA Rencontre le Cerveau : Les Systèmes de Mémoire de la Neurosciences Cognitives aux Agents Autonomes
Extension du raisonnement ouvert à l’échelle pour prédire l’avenir
GaMO : Reconstruction 3D à vue éparse par diffusion multi-vues consciente de la géométrie
mHC : Connexions Hyper-Contraintes par Variété
Laissez-fluivre : l’élaboration agente du rock and roll, construction du modèle ROME au sein d’un écosystème d’apprentissage agent ouvert
Youtu-LLM : Déverrouiller le potentiel agentic natif pour les grands modèles linguistiques légers
GateBreaker : Attaques guidées par la porte sur les LLM à mélange d'experts
GraphLocator : Raisonnement causel guidé par graphe pour la localisation des problèmes
Évaluation des méthodes efficaces en paramètres pour le RLVR
Entraînement en temps réel du bout en bout pour un contexte long
DreamOmni3 : Édition et génération basées sur des croquis
UltraShape 1.0 : Génération de formes 3D à haute fidélité par raffinement géométrique évolutif
mimic-video : Modèles vidéo-action pour un contrôle robotique généralisable au-delà des VLAs
HY-Motion 1.0 : Extension des modèles de correspondance de flux pour la génération de mouvement à partir de texte
SurgWorld : Apprentissage de politiques de robots chirurgicaux à partir de vidéos grâce à la modélisation du monde
SpotEdit : Édition de régions sélectives dans les transformateurs à diffusion
La diffusion sait la transparence : réaffecter la diffusion vidéo pour l'estimation de la profondeur et des normales des objets transparents
SmartSnap : Recherche proactive de preuves pour des agents auto-vérifiants
Yume-1.5 : un modèle de génération de monde interactif contrôlé par le texte
LiveTalk : diffusion vidéo multimodale interactive en temps réel via une distillation sur-policy améliorée
Coupler des experts et des routeurs dans les Mixture-of-Experts à l'aide d'une perte auxiliaire
LongFly : Navigation vision-langage pour UAV à horizon long avec intégration du contexte spatio-temporel
L'attention n'est pas ce dont vous avez besoin
SlideTailor : Génération personnalisée de diapositives de présentation pour les articles scientifiques
InSight-o3 : Accroître les modèles fondamentaux multimodaux grâce à une recherche visuelle généralisée
InsertAnywhere : Connecter la géométrie 4D de la scène et les modèles de diffusion pour une insertion d’objet vidéo réaliste
Récupération augmentée par génération consciente de la mindscape pour une meilleure compréhension des contextes longs
Mesure de la factualité de courte forme dans les modèles de langage massifs
Modèles de grands concepts dynamiques : raisonnement latent dans un espace sémantique adaptatif
Amélioration du RAG multi-étapes grâce à une mémoire basée sur des hypergraphes pour une modélisation complexe des relations à long contexte
L'IA Rencontre le Cerveau : Les Systèmes de Mémoire de la Neurosciences Cognitives aux Agents Autonomes
Extension du raisonnement ouvert à l’échelle pour prédire l’avenir
GaMO : Reconstruction 3D à vue éparse par diffusion multi-vues consciente de la géométrie
mHC : Connexions Hyper-Contraintes par Variété
Laissez-fluivre : l’élaboration agente du rock and roll, construction du modèle ROME au sein d’un écosystème d’apprentissage agent ouvert
Youtu-LLM : Déverrouiller le potentiel agentic natif pour les grands modèles linguistiques légers
GateBreaker : Attaques guidées par la porte sur les LLM à mélange d'experts
GraphLocator : Raisonnement causel guidé par graphe pour la localisation des problèmes
Évaluation des méthodes efficaces en paramètres pour le RLVR
Entraînement en temps réel du bout en bout pour un contexte long
DreamOmni3 : Édition et génération basées sur des croquis
UltraShape 1.0 : Génération de formes 3D à haute fidélité par raffinement géométrique évolutif
mimic-video : Modèles vidéo-action pour un contrôle robotique généralisable au-delà des VLAs
HY-Motion 1.0 : Extension des modèles de correspondance de flux pour la génération de mouvement à partir de texte
SurgWorld : Apprentissage de politiques de robots chirurgicaux à partir de vidéos grâce à la modélisation du monde
SpotEdit : Édition de régions sélectives dans les transformateurs à diffusion
La diffusion sait la transparence : réaffecter la diffusion vidéo pour l'estimation de la profondeur et des normales des objets transparents
SmartSnap : Recherche proactive de preuves pour des agents auto-vérifiants
Yume-1.5 : un modèle de génération de monde interactif contrôlé par le texte
LiveTalk : diffusion vidéo multimodale interactive en temps réel via une distillation sur-policy améliorée
Coupler des experts et des routeurs dans les Mixture-of-Experts à l'aide d'une perte auxiliaire
LongFly : Navigation vision-langage pour UAV à horizon long avec intégration du contexte spatio-temporel
L'attention n'est pas ce dont vous avez besoin
SlideTailor : Génération personnalisée de diapositives de présentation pour les articles scientifiques
InSight-o3 : Accroître les modèles fondamentaux multimodaux grâce à une recherche visuelle généralisée
InsertAnywhere : Connecter la géométrie 4D de la scène et les modèles de diffusion pour une insertion d’objet vidéo réaliste
Récupération augmentée par génération consciente de la mindscape pour une meilleure compréhension des contextes longs
Mesure de la factualité de courte forme dans les modèles de langage massifs