Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

OpenDataArena : une arène équitable et ouverte pour évaluer la valeur des jeux de données après l'entraînement

Test de Réalité Vidéo : Les vidéos ASMR générées par l’IA peuvent-elles tromper les VLM et les humains ?































OpenDataArena : une arène équitable et ouverte pour évaluer la valeur des jeux de données après l'entraînement

Test de Réalité Vidéo : Les vidéos ASMR générées par l’IA peuvent-elles tromper les VLM et les humains ?






























WorldPlay : Vers une cohérence géométrique à long terme pour la modélisation mondiales interactive en temps réel
MMGR : Raisonnement génératif multimodal
Science de la frontière : Évaluation de la capacité de l'IA à accomplir des tâches scientifiques au niveau d'expert
Le classement FACTS : une référence complète pour la facticité des grands modèles linguistiques
Nemotron-Cascade : Extension de l'apprentissage par renforcement en cascade pour les modèles de raisonnement polyvalents
Rapport technique KlingAvatar 2.0
QwenLong-L1.5 : Recette de post-entraînement pour le raisonnement à longue portée et la gestion de la mémoire
ReFusion : un Modèle de Langage Grand à Diffusion avec Décodage Autoregressif Parallèle
L'attention linéaire sans erreur est un repas gratuit : solution exacte issue de dynamiques en temps continu
La mémoire à l’ère des agents IA
LongVie 2 : Modèle mondial ultra-long contrôlable multimodal
FirstAidQA : un jeu de données synthétique pour les premiers secours et la réponse aux urgences dans des environnements à faible connectivité
CUDA-L2 : Dépasser les performances de cuBLAS pour la multiplication matricielle grâce à l'apprentissage par renforcement
X-VLA : Modèle vision-langage-action à incarnation croisée évolutif basé sur un transformateur à prompt doux
Nemotron 3 Nano : Modèle hybride Mamba-Transformer à mélanges d'experts ouvert et efficace pour le raisonnement agissant
Structure From Tracking : Distiller le Mouvement Préserveur de la Structure pour la Génération Vidéo
Exploration du transfert d'information MLLM-Diffusion avec MetaCanvas
PersonaLive ! Animation expressive d’images de portrait pour le streaming en direct
V-RGBX : Édition vidéo avec un contrôle précis des propriétés intrinsèques
SVG-T2I : Augmenter l'échelle du modèle de diffusion latente Texte-Vers-Image sans Autoencodeur Variationnel
DentalGPT : Incitation du raisonnement complexe multimodal en odontologie
SSRB : Interrogation directe en langage naturel de grandes quantités de données semi-structurées hétérogènes
MUVR : Une base de benchmark pour la recherche dans les vidéos non coupées à plusieurs modalités avec correspondance visuelle multi-niveaux
Évaluation des politiques de robotique Gemini dans un simulateur de monde Veo
MotionEdit : Évaluation et apprentissage de l'édition d'images centrée sur le mouvement
Atteindre un Agent de Modèle Linguistique Géométrique de Niveau Olympique grâce au Renforcement par Boosting de Complexité
OPV : Vérificateur de Processus Axé sur les Résultats pour une Vérification Efficace des Chaînes Longues de Raisonnement
Sommes-nous prêts à l'RL dans la génération text-to-3D ? Une investigation progressive
Agent de raisonnement à horizon long pour la résolution de problèmes mathématiques de niveau olympiade
T-pro 2.0 : un modèle hybride de raisonnement russe efficace et une plateforme de développement
WorldPlay : Vers une cohérence géométrique à long terme pour la modélisation mondiales interactive en temps réel
MMGR : Raisonnement génératif multimodal
Science de la frontière : Évaluation de la capacité de l'IA à accomplir des tâches scientifiques au niveau d'expert
Le classement FACTS : une référence complète pour la facticité des grands modèles linguistiques
Nemotron-Cascade : Extension de l'apprentissage par renforcement en cascade pour les modèles de raisonnement polyvalents
Rapport technique KlingAvatar 2.0
QwenLong-L1.5 : Recette de post-entraînement pour le raisonnement à longue portée et la gestion de la mémoire
ReFusion : un Modèle de Langage Grand à Diffusion avec Décodage Autoregressif Parallèle
L'attention linéaire sans erreur est un repas gratuit : solution exacte issue de dynamiques en temps continu
La mémoire à l’ère des agents IA
LongVie 2 : Modèle mondial ultra-long contrôlable multimodal
FirstAidQA : un jeu de données synthétique pour les premiers secours et la réponse aux urgences dans des environnements à faible connectivité
CUDA-L2 : Dépasser les performances de cuBLAS pour la multiplication matricielle grâce à l'apprentissage par renforcement
X-VLA : Modèle vision-langage-action à incarnation croisée évolutif basé sur un transformateur à prompt doux
Nemotron 3 Nano : Modèle hybride Mamba-Transformer à mélanges d'experts ouvert et efficace pour le raisonnement agissant
Structure From Tracking : Distiller le Mouvement Préserveur de la Structure pour la Génération Vidéo
Exploration du transfert d'information MLLM-Diffusion avec MetaCanvas
PersonaLive ! Animation expressive d’images de portrait pour le streaming en direct
V-RGBX : Édition vidéo avec un contrôle précis des propriétés intrinsèques
SVG-T2I : Augmenter l'échelle du modèle de diffusion latente Texte-Vers-Image sans Autoencodeur Variationnel
DentalGPT : Incitation du raisonnement complexe multimodal en odontologie
SSRB : Interrogation directe en langage naturel de grandes quantités de données semi-structurées hétérogènes
MUVR : Une base de benchmark pour la recherche dans les vidéos non coupées à plusieurs modalités avec correspondance visuelle multi-niveaux
Évaluation des politiques de robotique Gemini dans un simulateur de monde Veo
MotionEdit : Évaluation et apprentissage de l'édition d'images centrée sur le mouvement
Atteindre un Agent de Modèle Linguistique Géométrique de Niveau Olympique grâce au Renforcement par Boosting de Complexité
OPV : Vérificateur de Processus Axé sur les Résultats pour une Vérification Efficace des Chaînes Longues de Raisonnement
Sommes-nous prêts à l'RL dans la génération text-to-3D ? Une investigation progressive
Agent de raisonnement à horizon long pour la résolution de problèmes mathématiques de niveau olympiade
T-pro 2.0 : un modèle hybride de raisonnement russe efficace et une plateforme de développement