Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

La conception de noyaux adaptatifs pour l'optimisation bayésienne est un jeu d'enfant avec les modèles de langage à grande échelle

DePass : Attribution unifiée des caractéristiques par une passe avant décomposée simple































La conception de noyaux adaptatifs pour l'optimisation bayésienne est un jeu d'enfant avec les modèles de langage à grande échelle

DePass : Attribution unifiée des caractéristiques par une passe avant décomposée simple






























COOPER : Un modèle unifié pour la perception coopérative et le raisonnement en intelligence spatiale
De l’imitation à la discrimination : Vers un mécanisme avantageux généralisé de curriculum favorisant les tâches de raisonnement multidomaines
PaCo-RL : Vers une amélioration de l'apprentissage par renforcement pour la génération d'images cohérentes grâce à un modèle de récompense par paires
EMMA : Compréhension, génération et édition multimodales efficaces grâce à une architecture unifiée
EditThinker : Déverrouiller le raisonnement itératif pour tout éditeur d’image
TwinFlow : Réalisation d'une génération en une seule étape sur les grands modèles grâce aux flux auto-adverses
CARE-PD : Un jeu de données cliniques anonymisées multicentriques pour l’évaluation de la marche chez les patients atteints de maladie de Parkinson
WenetSpeech-Chuan : un corpus à grande échelle de dialecte sichuanais avec une annotation riche pour le traitement du discours dialectal
PolypSense3D : un jeu de données multicapteurs pour la mesure de la taille des polypes consciente de la profondeur en endoscopie
PhysDrive : Un ensemble de données multimodales pour la mesure à distance des signaux physiologiques en vue d'un suivi du conducteur dans le véhicule
Hivemind artificiel : l'homogénéité sans fin des modèles linguistiques (et au-delà)
OmniSVG : un modèle unifié de génération de graphiques vectoriels évolutifs
Théorie de la pensée algorithmique
Modèle mondial robotique : un simulateur à réseau de neurones pour une optimisation robuste des politiques en robotique
Forçage de récompense : génération efficace de vidéos en flux avec distillation par correspondance de distribution récompensée
La sémantique guide la voie : harmonisation de la modélisation sémantique et texturelle par diffusion latente asynchrone
ARM-Thinker : Renforcer les modèles de récompense génératifs multimodaux grâce à l’utilisation d’outils agents et au raisonnement visuel
Nex-N1 : Modèles agents entraînés via un écosystème unifié pour la construction à grande échelle d’environnements
DAComp : Évaluation des Agents de données tout au long du cycle de vie de l'intelligence des données
Avatar en direct : génération d'avatar piloté par l'audio en temps réel avec une longueur infinie
F5-TTS : Un conteur qui simule une parole fluide et fidèle grâce au matching de flux
VOccl3D : Un ensemble de données vidéo pour l'estimation de la posture et de la forme 3D humaines en présence d'occlusions réelles
Alpamayo-R1 : Relever le défi du raisonnement et de la prédiction d'action pour une conduite autonome généralisable dans la queue longue
Tout est lié : un voyage à travers la mémoire au moment du test, le biais attentionnel, la rétention et l'optimisation en ligne
Réfléchir à la conception des prompts pour le scaling au moment de l'inférence dans la génération texte-visual
Piloter les modèles vision-langage-action comme une anti-exploration : une approche d'échelle au moment du test
OneThinker : Modèle de raisonnement tout-en-un pour les images et les vidéos
ViDiC : Captioning de différences vidéo
PretrainZero : Pré-entraînement actif par renforcement
Chaque jeton compte : généralisation du contexte ultra-long de 16 millions dans les modèles de langage à grande échelle
COOPER : Un modèle unifié pour la perception coopérative et le raisonnement en intelligence spatiale
De l’imitation à la discrimination : Vers un mécanisme avantageux généralisé de curriculum favorisant les tâches de raisonnement multidomaines
PaCo-RL : Vers une amélioration de l'apprentissage par renforcement pour la génération d'images cohérentes grâce à un modèle de récompense par paires
EMMA : Compréhension, génération et édition multimodales efficaces grâce à une architecture unifiée
EditThinker : Déverrouiller le raisonnement itératif pour tout éditeur d’image
TwinFlow : Réalisation d'une génération en une seule étape sur les grands modèles grâce aux flux auto-adverses
CARE-PD : Un jeu de données cliniques anonymisées multicentriques pour l’évaluation de la marche chez les patients atteints de maladie de Parkinson
WenetSpeech-Chuan : un corpus à grande échelle de dialecte sichuanais avec une annotation riche pour le traitement du discours dialectal
PolypSense3D : un jeu de données multicapteurs pour la mesure de la taille des polypes consciente de la profondeur en endoscopie
PhysDrive : Un ensemble de données multimodales pour la mesure à distance des signaux physiologiques en vue d'un suivi du conducteur dans le véhicule
Hivemind artificiel : l'homogénéité sans fin des modèles linguistiques (et au-delà)
OmniSVG : un modèle unifié de génération de graphiques vectoriels évolutifs
Théorie de la pensée algorithmique
Modèle mondial robotique : un simulateur à réseau de neurones pour une optimisation robuste des politiques en robotique
Forçage de récompense : génération efficace de vidéos en flux avec distillation par correspondance de distribution récompensée
La sémantique guide la voie : harmonisation de la modélisation sémantique et texturelle par diffusion latente asynchrone
ARM-Thinker : Renforcer les modèles de récompense génératifs multimodaux grâce à l’utilisation d’outils agents et au raisonnement visuel
Nex-N1 : Modèles agents entraînés via un écosystème unifié pour la construction à grande échelle d’environnements
DAComp : Évaluation des Agents de données tout au long du cycle de vie de l'intelligence des données
Avatar en direct : génération d'avatar piloté par l'audio en temps réel avec une longueur infinie
F5-TTS : Un conteur qui simule une parole fluide et fidèle grâce au matching de flux
VOccl3D : Un ensemble de données vidéo pour l'estimation de la posture et de la forme 3D humaines en présence d'occlusions réelles
Alpamayo-R1 : Relever le défi du raisonnement et de la prédiction d'action pour une conduite autonome généralisable dans la queue longue
Tout est lié : un voyage à travers la mémoire au moment du test, le biais attentionnel, la rétention et l'optimisation en ligne
Réfléchir à la conception des prompts pour le scaling au moment de l'inférence dans la génération texte-visual
Piloter les modèles vision-langage-action comme une anti-exploration : une approche d'échelle au moment du test
OneThinker : Modèle de raisonnement tout-en-un pour les images et les vidéos
ViDiC : Captioning de différences vidéo
PretrainZero : Pré-entraînement actif par renforcement
Chaque jeton compte : généralisation du contexte ultra-long de 16 millions dans les modèles de langage à grande échelle