Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

Le troupeau de modèles Llama 3

InternLM-XComposer-2.5 : un modèle de vision et de langage massif polyvalent prenant en charge les entrées et sorties à longue portée






























MMDU : Une base de benchmark pour la compréhension des dialogues à plusieurs tours et à plusieurs images, et un jeu de données pour l'ajustage par instruction des LVLM
Qu'est-ce qui compte lors de la construction de modèles vision-langage ?
DDOS : Jeu de données pour la segmentation de la profondeur des drones et des obstacles
Auto-Régressif vs Appariement de Flux : une Étude Comparative des Paradigmes de Modélisation pour la Génération Musique à Partir du Texte
SeerAttention-R : Adaptation de l'attention parcimonieuse pour le raisonnement à long terme
JoueurUn : Simulateur de Monde Égocentrique
ComfyUI-R1 : Exploration des modèles de raisonnement pour la génération de flux de travail
Formation par post-entraînement adversaire autoregressif pour la génération de vidéos interactives en temps réel
Confiance est tout ce dont vous avez besoin : Ajustement fin de modèles de langage par apprentissage par renforcement à faible échantillonnage
Sur l'utilisation des représentations acoustiques auto-supervisées dans la synthèse de parole spontanée
Champ de force à base d'apprentissage automatique efficace pour les simulations moléculaires à grande échelle des systèmes organiques
vLLM Hook v0 : Un module enfichable pour les internes du modèle de programmation sur vLLM
MIRAGE : Récupération et génération d'images multimodales et de textes pour l'éducation médicale
ComfyGPT : Un système multi-agents auto-optimisant pour la génération complète de flux de travail ComfyUI
Conception d'un modèle séquentiel pour la complétion de code dans les IDE modernes
ACE-Step : Une étape vers le modèle fondamental de génération musicale
Synthèse de la parole à partir de texte en zero-shot conditionnée par un modèle de représentation de la parole auto-supervisé
Les petits modèles de langage de raisonnement peuvent-ils évaluer les articles de recherche en termes de qualité scientifique, et l'utilisation de l'approbation et de l'approche few-shot contribue-t-elle à améliorer les résultats ?
Un cadre de déploiement flexible et sécurisé pour les applications distribuées
Pré-entraînement multimodal et génération pour la recommandation : un tutoriel
Une limite théorique au physicalisme : une explication non technique du théorème de Gemini
EmoSSLSphere : Synthèse de la parole émotionnelle multilingue à l’aide de vecteurs sphériques et de jetons de parole discrets
Dynamique de propagation des faisceaux vortex gaussiens d'Airy circulaires dans l'équation de Schrödinger non linéaire fractionnaire
VASP sur un GPU : application aux calculs d'échange exact de la stabilité du bore élémentaire
Quantité d'information dans un pixel d'une image numérique
AR-RAG : Augmentation de la récupération autoregressive pour la génération d'images
Reconnaissance de l'écriture manuscrite romaine à l'aide du moteur OCR open source Tesseract
TimeSenCLIP : Un modèle vision-langage pour les séries temporelles appliqué à l'observation de la Terre
Apprentissage de l'évolution temporelle de la dépendance spatiale à l'aide de modèles généralisés de processus gaussiens spatio-temporels
TripoSG : Synthèse de formes 3D de haute fidélité à l’aide de modèles de flux rectifié à grande échelle