Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

NANO3D : Une approche sans entraînement pour une édition 3D efficace sans masques

Échelle de la modification vidéo basée sur les instructions à l’aide d’un jeu de données synthétique de haute qualité































NANO3D : Une approche sans entraînement pour une édition 3D efficace sans masques

Échelle de la modification vidéo basée sur les instructions à l’aide d’un jeu de données synthétique de haute qualité






























OmniVinci : Amélioration de l'architecture et des données pour la compréhension omni-modale par les LLM
Étude théorique sur le pont entre la probabilité interne et la cohérence auto-consistante pour le raisonnement des modèles de langage à grande échelle
DeepSeek-OCR : Compression optique de contexte
Optimisation directe des préférences avec hétérogénéité des préférences non observée : la nécessité des préférences ternaires
Modèles de diffusion par roulement pour la prévision météorologique probabiliste
ImagerySearch : Recherche adaptative en temps de test pour la génération vidéo au-delà des contraintes de dépendance sémantique
Des pixels aux mots – Vers des primitives vision-langage natives à grande échelle
L'intelligence artificielle pour les services : une assistance proactive grâce aux lunettes intelligentes
WithAnyone : Vers une génération d'images contrôlable et cohérente en identité
Optimisation politique à entropie équilibrée agente
Quand les modèles mentent, nous apprenons : détection multilingue des hallucinations au niveau des segments avec PsiloQA
Prédiction de l'efficacité d'amplification spécifique de séquence dans la PCR à plusieurs templates par apprentissage profond
L'outil d'analyse du génome : un cadre MapReduce pour l'analyse des données de séquençage de l'ADN de nouvelle génération
LAMMPS - un outil de simulation flexible pour la modélisation des matériaux basée sur des particules aux échelles atomique, mésoscopique et continue
LabOS : L'IA-XR, le co-scientifique qui voit et travaille avec les humains
Dolphin : Analyse d'images de documents par incitation par ancres hétérogènes
LiveCC : apprentissage d’un modèle linguistique vidéo par transcription audio en continu à grande échelle
DeepMMSearch-R1 : Accroître les capacités des modèles linguistiques multimodaux dans la recherche web multimodale
Dimensionnement des grands modèles linguistiques pour une analyse à cellule unique de nouvelle génération
Une étude sur le codage Vibe avec des modèles de langage à grande échelle
Détection de tout via la prédiction du prochain point
Mise à l’échelle de l’apprentissage représentationnel omnicodal centré sur le langage
DITING : un cadre d'évaluation multi-agents pour le benchmarking de la traduction de romans web
Avancement de la modélisation générative en espace pixel par pixel bout-en-bout par pré-entraînement auto-supervisé
Forçage spatial : alignement implicite de représentations spatiales pour un modèle vision-langage-action
Poser des questions clarificatrices pour l’élicitation des préférences avec des modèles linguistiques à grande échelle
CTRL-Rec : Contrôler les systèmes de recommandation à l’aide d’un langage naturel
RLFR : Extension de l'apprentissage par renforcement aux modèles linguistiques à grande échelle grâce à un environnement à flux
Décodage de raffinement latent : amélioration des modèles linguistiques basés sur les diffusions par le raffinement des états de croyance
OmniVideoBench : Vers une évaluation de la compréhension audiovisuelle pour les MLLMs omnivores
OmniVinci : Amélioration de l'architecture et des données pour la compréhension omni-modale par les LLM
Étude théorique sur le pont entre la probabilité interne et la cohérence auto-consistante pour le raisonnement des modèles de langage à grande échelle
DeepSeek-OCR : Compression optique de contexte
Optimisation directe des préférences avec hétérogénéité des préférences non observée : la nécessité des préférences ternaires
Modèles de diffusion par roulement pour la prévision météorologique probabiliste
ImagerySearch : Recherche adaptative en temps de test pour la génération vidéo au-delà des contraintes de dépendance sémantique
Des pixels aux mots – Vers des primitives vision-langage natives à grande échelle
L'intelligence artificielle pour les services : une assistance proactive grâce aux lunettes intelligentes
WithAnyone : Vers une génération d'images contrôlable et cohérente en identité
Optimisation politique à entropie équilibrée agente
Quand les modèles mentent, nous apprenons : détection multilingue des hallucinations au niveau des segments avec PsiloQA
Prédiction de l'efficacité d'amplification spécifique de séquence dans la PCR à plusieurs templates par apprentissage profond
L'outil d'analyse du génome : un cadre MapReduce pour l'analyse des données de séquençage de l'ADN de nouvelle génération
LAMMPS - un outil de simulation flexible pour la modélisation des matériaux basée sur des particules aux échelles atomique, mésoscopique et continue
LabOS : L'IA-XR, le co-scientifique qui voit et travaille avec les humains
Dolphin : Analyse d'images de documents par incitation par ancres hétérogènes
LiveCC : apprentissage d’un modèle linguistique vidéo par transcription audio en continu à grande échelle
DeepMMSearch-R1 : Accroître les capacités des modèles linguistiques multimodaux dans la recherche web multimodale
Dimensionnement des grands modèles linguistiques pour une analyse à cellule unique de nouvelle génération
Une étude sur le codage Vibe avec des modèles de langage à grande échelle
Détection de tout via la prédiction du prochain point
Mise à l’échelle de l’apprentissage représentationnel omnicodal centré sur le langage
DITING : un cadre d'évaluation multi-agents pour le benchmarking de la traduction de romans web
Avancement de la modélisation générative en espace pixel par pixel bout-en-bout par pré-entraînement auto-supervisé
Forçage spatial : alignement implicite de représentations spatiales pour un modèle vision-langage-action
Poser des questions clarificatrices pour l’élicitation des préférences avec des modèles linguistiques à grande échelle
CTRL-Rec : Contrôler les systèmes de recommandation à l’aide d’un langage naturel
RLFR : Extension de l'apprentissage par renforcement aux modèles linguistiques à grande échelle grâce à un environnement à flux
Décodage de raffinement latent : amélioration des modèles linguistiques basés sur les diffusions par le raffinement des états de croyance
OmniVideoBench : Vers une évaluation de la compréhension audiovisuelle pour les MLLMs omnivores