Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Kascade : Une méthode pratique d’attention creuse pour l’inférence des LLM à contexte long

GLM-4.5 : Modèles fondamentaux agents, raisonnants et codants (ARC)































Kascade : Une méthode pratique d’attention creuse pour l’inférence des LLM à contexte long

GLM-4.5 : Modèles fondamentaux agents, raisonnants et codants (ARC)






























GroundingME : Mettre en évidence le fossé de l'ancrage visuel dans les MLLM par évaluation multidimensionnelle
À la fois la sémantique et la reconstruction comptent : préparer les encodeurs de représentation à la génération et à l’édition d’images à partir de texte
4D-RGPT : Vers une compréhension 4D au niveau des régions par distillation perceptuelle
Seed-Prover 1.5 : Maîtrise de la démonstration de théorèmes au niveau licence grâce à l'apprentissage par l'expérience
Lorsque le raisonnement rencontre ses lois
Sondering de l'intelligence générale scientifique des LLM à l'aide de workflows alignés sur les scientifiques
K2-V2 : Un LLM à ouverture 360°, renforcé par le raisonnement
VenusBench-GD : une benchmark graphique multiplateforme complète pour des tâches d'ancrage diverses
MCIF : Benchmark de suivi d'instructions multimodal et multilingue issu de conférences scientifiques
NitroGen : un modèle fondamental open source pour des agents de jeu généralistes
Neurones H : Existence, impact et origine des neurones associés aux hallucinations dans les grands modèles linguistiques
Le monde est votre toile : peindre des événements pilotables à l’aide d’images de référence, de trajectoires et de texte
Alchimiste : Libérer l’efficacité de l’entraînement des modèles Texte-Image grâce à une sélection de données par méta-gradient
Depth Any Panoramas : un modèle fondamental pour l'estimation de la profondeur panoramique
Réfocalisation générative : contrôle flexible du flou de mise au point à partir d'une seule image
StereoPilot : Apprentissage d'une conversion stéréo unifiée et efficace via des priori génératifs
La prédiction de prochain embedding favorise l'apprentissage visuel performant
Agent IA : Explorer les frontières de l'interaction multimodale
Un mathématicien par intelligence artificielle comme partenaire dans l'avancée de la découverte mathématique — Une étude de cas en théorie de l'homogénéisation
GenEval 2 : Traitement du décalage des référentiels dans l'évaluation des modèles text-to-image
PrivateXR : Protection contre les attaques visant la vie privée dans la réalité étendue grâce à la confidentialité différentielle guidée par une IA explicable
Frictions temporelles et résultats judiciaires : Analyse de l'impact des délais sur les peines prononcées dans le comté de Cook (2020–2024)
L'Apprentissage Meta-RL Favorise l'Exploration chez les Agents Linguistiques
LLMCache : Stratégies d’empilement par couche pour une réutilisation accélérée dans l’inférence des Transformers
OPENTOUCH : Intégrer le toucher de toute la main à l’interaction en milieu réel
VideoRewardBench : Évaluation Complète des Modèles de Récompense Multimodaux pour la Compréhension Vidéo
Soul : Donner vie à une humanité numérique pour une animation multimodale de haute fidélité à long terme
IF-Bench : Évaluation et amélioration des MLLMs pour les images infrarouges à l'aide d'un visualisation générative
Rapport technique de RecGPT-V2
Vector Prism : Animer les graphiques vectoriels par stratification de la structure sémantique
GroundingME : Mettre en évidence le fossé de l'ancrage visuel dans les MLLM par évaluation multidimensionnelle
À la fois la sémantique et la reconstruction comptent : préparer les encodeurs de représentation à la génération et à l’édition d’images à partir de texte
4D-RGPT : Vers une compréhension 4D au niveau des régions par distillation perceptuelle
Seed-Prover 1.5 : Maîtrise de la démonstration de théorèmes au niveau licence grâce à l'apprentissage par l'expérience
Lorsque le raisonnement rencontre ses lois
Sondering de l'intelligence générale scientifique des LLM à l'aide de workflows alignés sur les scientifiques
K2-V2 : Un LLM à ouverture 360°, renforcé par le raisonnement
VenusBench-GD : une benchmark graphique multiplateforme complète pour des tâches d'ancrage diverses
MCIF : Benchmark de suivi d'instructions multimodal et multilingue issu de conférences scientifiques
NitroGen : un modèle fondamental open source pour des agents de jeu généralistes
Neurones H : Existence, impact et origine des neurones associés aux hallucinations dans les grands modèles linguistiques
Le monde est votre toile : peindre des événements pilotables à l’aide d’images de référence, de trajectoires et de texte
Alchimiste : Libérer l’efficacité de l’entraînement des modèles Texte-Image grâce à une sélection de données par méta-gradient
Depth Any Panoramas : un modèle fondamental pour l'estimation de la profondeur panoramique
Réfocalisation générative : contrôle flexible du flou de mise au point à partir d'une seule image
StereoPilot : Apprentissage d'une conversion stéréo unifiée et efficace via des priori génératifs
La prédiction de prochain embedding favorise l'apprentissage visuel performant
Agent IA : Explorer les frontières de l'interaction multimodale
Un mathématicien par intelligence artificielle comme partenaire dans l'avancée de la découverte mathématique — Une étude de cas en théorie de l'homogénéisation
GenEval 2 : Traitement du décalage des référentiels dans l'évaluation des modèles text-to-image
PrivateXR : Protection contre les attaques visant la vie privée dans la réalité étendue grâce à la confidentialité différentielle guidée par une IA explicable
Frictions temporelles et résultats judiciaires : Analyse de l'impact des délais sur les peines prononcées dans le comté de Cook (2020–2024)
L'Apprentissage Meta-RL Favorise l'Exploration chez les Agents Linguistiques
LLMCache : Stratégies d’empilement par couche pour une réutilisation accélérée dans l’inférence des Transformers
OPENTOUCH : Intégrer le toucher de toute la main à l’interaction en milieu réel
VideoRewardBench : Évaluation Complète des Modèles de Récompense Multimodaux pour la Compréhension Vidéo
Soul : Donner vie à une humanité numérique pour une animation multimodale de haute fidélité à long terme
IF-Bench : Évaluation et amélioration des MLLMs pour les images infrarouges à l'aide d'un visualisation générative
Rapport technique de RecGPT-V2
Vector Prism : Animer les graphiques vectoriels par stratification de la structure sémantique