Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Youtu-GraphRAG : Agents verticalement unifiés pour le raisonnement complexe renforcé par la récupération de graphes

SceneSplat : Compréhension de scène basée sur le Gaussian Splatting avec pré-entraînement vision-langage































Youtu-GraphRAG : Agents verticalement unifiés pour le raisonnement complexe renforcé par la récupération de graphes

SceneSplat : Compréhension de scène basée sur le Gaussian Splatting avec pré-entraînement vision-langage






























Économies d'agents virtuels
Vers la compréhension de l'ancrage visuel dans les modèles linguistiques visuels
Kling-Avatar : Fondement des instructions multimodales pour la synthèse en cascade d'animations d'avatar à longue durée
MachineLearningLM : Pré-entraînement continu des modèles linguistiques sur des millions de tâches de prédiction tabulaires synthétiques permettant une mise à l'échelle de l'apprentissage in-context en apprentissage automatique
EchoX : Vers la réduction de l'écart acoustique-sémantique grâce à l'entraînement par écho pour les modèles linguistiques parlés
SimpleVLA-RL : Échelle d'entraînement des VLA par apprentissage par renforcement
VLA-Adapter : un paradigme efficace pour les modèles vision-langage-action à petite échelle
scSiameseClu : Un cadre d'apprentissage non supervisé par paires pour l'interprétation des données de séquençage à l'unité cellulaire de l'ARN
ST-Raptor : interrogation de tables semi-structurées pilotée par les modèles linguistiques
OmniSpatial : Vers une évaluation complète du raisonnement spatial pour les modèles vision-langage
Comprendre les compromis économiques entre agents humains et agents intelligents dans les jeux de négociation
Jupiter : Amélioration des capacités d'analyse des données par les modèles de langage à grande échelle grâce à une recherche guidée par les valeurs au moment de l'inférence et par des blocs-notes
Rapport technique Hunyuan-MT
P3-SAM : segmentation 3D native des parties
AgentGym-RL : Formation d'agents LLM pour la prise de décision à horizon long par apprentissage par renforcement multi-tours
Modélisation du monde en 3D et en 4D : Un état de l'art
RewardDance : Échelonnage de la récompense dans la génération visuelle
Partager, c’est s'occuper : Une post-formation efficace des modèles linguistiques par partage d'expériences collectives en apprentissage par renforcement
FinReflectKG : Construction et évaluation agente de graphes de connaissances financières
Une étude sur l'apprentissage par renforcement pour les grands modèles de raisonnement
Mesurer et atténuer la surdépendance est nécessaire pour développer une IA compatible avec l’humain
F1 : Un modèle Vision-Texte-Action reliant la compréhension et la génération aux actions
UMO : Extension de la cohérence multi-identité pour la personnalisation d'images par récompense de correspondance
L'alignement de reconstruction améliore les modèles multimodaux unifiés
Mini-o3 : Échelle des schémas de raisonnement et du nombre d’échanges pour la recherche visuelle
Alignement de représentation visuelle pour les grands modèles linguistiques multimodaux
Parallel-R1 : Vers une pensée parallèle par apprentissage par renforcement
WenetSpeech-Yue : un corpus parlé de cantonais à grande échelle avec annotation multidimensionnelle
SheetDesigner : Génération de disposition de feuille de calcul pilotée par MLLM avec réflexion fondée sur des règles et réflexion fondée sur la vision
L'évolution autonome du code rencontre la NP-complétude
Économies d'agents virtuels
Vers la compréhension de l'ancrage visuel dans les modèles linguistiques visuels
Kling-Avatar : Fondement des instructions multimodales pour la synthèse en cascade d'animations d'avatar à longue durée
MachineLearningLM : Pré-entraînement continu des modèles linguistiques sur des millions de tâches de prédiction tabulaires synthétiques permettant une mise à l'échelle de l'apprentissage in-context en apprentissage automatique
EchoX : Vers la réduction de l'écart acoustique-sémantique grâce à l'entraînement par écho pour les modèles linguistiques parlés
SimpleVLA-RL : Échelle d'entraînement des VLA par apprentissage par renforcement
VLA-Adapter : un paradigme efficace pour les modèles vision-langage-action à petite échelle
scSiameseClu : Un cadre d'apprentissage non supervisé par paires pour l'interprétation des données de séquençage à l'unité cellulaire de l'ARN
ST-Raptor : interrogation de tables semi-structurées pilotée par les modèles linguistiques
OmniSpatial : Vers une évaluation complète du raisonnement spatial pour les modèles vision-langage
Comprendre les compromis économiques entre agents humains et agents intelligents dans les jeux de négociation
Jupiter : Amélioration des capacités d'analyse des données par les modèles de langage à grande échelle grâce à une recherche guidée par les valeurs au moment de l'inférence et par des blocs-notes
Rapport technique Hunyuan-MT
P3-SAM : segmentation 3D native des parties
AgentGym-RL : Formation d'agents LLM pour la prise de décision à horizon long par apprentissage par renforcement multi-tours
Modélisation du monde en 3D et en 4D : Un état de l'art
RewardDance : Échelonnage de la récompense dans la génération visuelle
Partager, c’est s'occuper : Une post-formation efficace des modèles linguistiques par partage d'expériences collectives en apprentissage par renforcement
FinReflectKG : Construction et évaluation agente de graphes de connaissances financières
Une étude sur l'apprentissage par renforcement pour les grands modèles de raisonnement
Mesurer et atténuer la surdépendance est nécessaire pour développer une IA compatible avec l’humain
F1 : Un modèle Vision-Texte-Action reliant la compréhension et la génération aux actions
UMO : Extension de la cohérence multi-identité pour la personnalisation d'images par récompense de correspondance
L'alignement de reconstruction améliore les modèles multimodaux unifiés
Mini-o3 : Échelle des schémas de raisonnement et du nombre d’échanges pour la recherche visuelle
Alignement de représentation visuelle pour les grands modèles linguistiques multimodaux
Parallel-R1 : Vers une pensée parallèle par apprentissage par renforcement
WenetSpeech-Yue : un corpus parlé de cantonais à grande échelle avec annotation multidimensionnelle
SheetDesigner : Génération de disposition de feuille de calcul pilotée par MLLM avec réflexion fondée sur des règles et réflexion fondée sur la vision
L'évolution autonome du code rencontre la NP-complétude