Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Rapport technique de Phi-Ground : Progresser dans la perception de l'alignement GUI

Seed-Prover : raisonnement profond et large pour la démonstration automatique de théorèmes































Rapport technique de Phi-Ground : Progresser dans la perception de l'alignement GUI

Seed-Prover : raisonnement profond et large pour la démonstration automatique de théorèmes






























Moins, c’est plus pour la détection de la parole synthétique dans le monde réel
Sélection de ReLU locale versus globale : la MILP partielle fait son retour pour la vérification des réseaux de neurones profonds
CoT-Self-Instruct : Construction de promts synthétiques de haute qualité pour les tâches de raisonnement et non de raisonnement
Vers des expressions et raisonnements omnimodaux dans la segmentation audio-visuelle par référence
Adaptation de détecteurs de véhicules pour des images aériennes à des domaines inédits avec une supervision faible
VL-Cogito : apprentissage par renforcement avec programme progressif pour le raisonnement multimodal avancé
Falcon-H1 : une famille de modèles linguistiques à tête hybride redéfinissant l'efficacité et les performances
BANG : Division de ressources 3D par dynamique éclatée générative
ScreenCoder : Progresser dans la génération visuelle vers le code pour l'automatisation du front-end grâce à des agents multimodaux modulaires
MIRepNet : Une chaîne de traitement et un modèle fondamental pour la classification de l’imagerie motrice à partir d’EEG
ChemDFM-R : Un raisonneur chimique basé sur un modèle linguistique grand (LLM) amélioré par des connaissances chimiques atomisées
X-Omni : Le apprentissage par renforcement rend aux modèles de génération d’images autoregressifs discrets leur grandeur d’antan
HunyuanWorld 1.0 : Génération de mondes 3D immersifs, explorables et interactifs à partir de mots ou de pixels
AlphaEarth Foundations : un modèle de champ d'embeddings pour une cartographie globale précise et efficace à partir de données étiquetées éparses
Vers une prévision à longue portée de l'ENSO à l'aide d'un modèle d'apprentissage profond explicite
OmniArch : Construction d'un modèle fondamental pour le calcul scientifique
UI-AGILE : Approfondir les agents d'interface utilisateur avec un apprentissage par renforcement efficace et une ancrage précis au moment de l'inférence
DualSG : Un cadre de prévision des séries temporelles multivariées à guide sémantique explicite à deux flux
Lorsque les tokens parlent trop : Une revue de la compression de tokens à longue portée multimodaux dans les images, vidéos et audios
SmallThinker : Une famille de modèles de langage à grande échelle efficaces entraînés nativement pour le déploiement local
Reconstruction de l'intelligence spatiale 4D : Un état de l'art
Rep-MTL : Déverrouiller le pouvoir de la salience des tâches au niveau de la représentation pour l'apprentissage multi-tâches
ARC-Hunyuan-Video-7B : Compréhension structurée des vidéos du monde réel en courte durée
Optimisation de politique renforcée agente
Spécification de correction auto : atténuer le piratage de récompense en contexte par une révision au moment des tests
PRIX : Apprendre à planifier à partir de pixels bruts pour le pilotage autonome en boucle complète
Chat avec l'IA : La tournure surprenante de la communication vidéo en temps réel passant d'un humain à une IA
MMBench-GUI : Cadre d'évaluation hiérarchique pour les agents GUI multiplateformes
Recherche profonde avec diffusion en temps de test
La géométrie de la quantification des LLM : GPTQ comme l'algorithme du plan le plus proche de Babai
Moins, c’est plus pour la détection de la parole synthétique dans le monde réel
Sélection de ReLU locale versus globale : la MILP partielle fait son retour pour la vérification des réseaux de neurones profonds
CoT-Self-Instruct : Construction de promts synthétiques de haute qualité pour les tâches de raisonnement et non de raisonnement
Vers des expressions et raisonnements omnimodaux dans la segmentation audio-visuelle par référence
Adaptation de détecteurs de véhicules pour des images aériennes à des domaines inédits avec une supervision faible
VL-Cogito : apprentissage par renforcement avec programme progressif pour le raisonnement multimodal avancé
Falcon-H1 : une famille de modèles linguistiques à tête hybride redéfinissant l'efficacité et les performances
BANG : Division de ressources 3D par dynamique éclatée générative
ScreenCoder : Progresser dans la génération visuelle vers le code pour l'automatisation du front-end grâce à des agents multimodaux modulaires
MIRepNet : Une chaîne de traitement et un modèle fondamental pour la classification de l’imagerie motrice à partir d’EEG
ChemDFM-R : Un raisonneur chimique basé sur un modèle linguistique grand (LLM) amélioré par des connaissances chimiques atomisées
X-Omni : Le apprentissage par renforcement rend aux modèles de génération d’images autoregressifs discrets leur grandeur d’antan
HunyuanWorld 1.0 : Génération de mondes 3D immersifs, explorables et interactifs à partir de mots ou de pixels
AlphaEarth Foundations : un modèle de champ d'embeddings pour une cartographie globale précise et efficace à partir de données étiquetées éparses
Vers une prévision à longue portée de l'ENSO à l'aide d'un modèle d'apprentissage profond explicite
OmniArch : Construction d'un modèle fondamental pour le calcul scientifique
UI-AGILE : Approfondir les agents d'interface utilisateur avec un apprentissage par renforcement efficace et une ancrage précis au moment de l'inférence
DualSG : Un cadre de prévision des séries temporelles multivariées à guide sémantique explicite à deux flux
Lorsque les tokens parlent trop : Une revue de la compression de tokens à longue portée multimodaux dans les images, vidéos et audios
SmallThinker : Une famille de modèles de langage à grande échelle efficaces entraînés nativement pour le déploiement local
Reconstruction de l'intelligence spatiale 4D : Un état de l'art
Rep-MTL : Déverrouiller le pouvoir de la salience des tâches au niveau de la représentation pour l'apprentissage multi-tâches
ARC-Hunyuan-Video-7B : Compréhension structurée des vidéos du monde réel en courte durée
Optimisation de politique renforcée agente
Spécification de correction auto : atténuer le piratage de récompense en contexte par une révision au moment des tests
PRIX : Apprendre à planifier à partir de pixels bruts pour le pilotage autonome en boucle complète
Chat avec l'IA : La tournure surprenante de la communication vidéo en temps réel passant d'un humain à une IA
MMBench-GUI : Cadre d'évaluation hiérarchique pour les agents GUI multiplateformes
Recherche profonde avec diffusion en temps de test
La géométrie de la quantification des LLM : GPTQ comme l'algorithme du plan le plus proche de Babai