Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

Rapport technique VibeVoice

MMTok : Maximisation de la couverture multimodale pour une inférence efficace des modèles de vision et de langage































Rapport technique VibeVoice

MMTok : Maximisation de la couverture multimodale pour une inférence efficace des modèles de vision et de langage






























MV-RAG : diffusion multivue augmentée par récupération
Connecter la synthèse des frameworks organométalliques à leurs applications à l’aide d’un apprentissage automatique multimodal
Protocoles de contexte de modèle dans les systèmes de transport adaptatifs : Une revue
Action collective algorithmique avec plusieurs collectifs
OpenCUA : Fondations ouvertes pour les agents d'utilisation informatique
Politique spatiale : orienter la manipulation robotique visuomotrice par une modélisation et un raisonnement sensibles à l'espace
Jet-Nemotron : Modèle linguistique efficace basé sur une recherche post-architecturale neuronale
CRISP : Désapprentissage de concepts persistants par autoencodeurs creux
Apprentissage contrastif sélectif pour l'ancrage d'aptitudes sous supervision faible
EgoTwin : Corps et vue en première personne dans le rêve
Au-delà de Pass@1 : le self-play avec une synthèse variationnelle de problèmes soutient le RLVR
ODYSSEY : Exploration et manipulation des quadrupèdes dans un monde ouvert pour des tâches à horizon long
AgentFly : Affiner les agents de LLMS sans affiner les LLMS
Raisonneur de diffusion guidé par des contraintes pour l'apprentissage neuro-symbole
Les agents fondés sur les LLM pour la cartographie du paysage concurrentiel dans le cadre de l'analyse approfondie des actifs pharmaceutiques
SceneGen : Génération de scènes 3D à partir d'une seule image en une seule passe d'avant-progression
Une revue sur les benchmarks des grands modèles linguistiques
Waver : Ondulez votre chemin vers la génération vidéo réaliste
LiveMCP-101 : Tests de charge et diagnostic des agents pilotés par MCP sur des requêtes complexes
Pensez profondément avec assurance
Mobile-Agent-v3 : Agents fondamentaux pour l'automatisation des interfaces graphiques
Intern-S1 : un modèle fondamental multimodal scientifique
Ajustement guidé par le langage : amélioration de l'optimisation numérique grâce aux retours textuels
NiceWebRL : une bibliothèque Python pour les expériences avec sujets humains dans des environnements d'apprentissage par renforcement
Du traitement de l'information scientifique par l'intelligence artificielle à la science agente : une revue sur la découverte scientifique autonome
MeshCoder : Génération de code de maillage structuré par LLM à partir de nuages de points
Tinker : Le don de la diffusion à l'édition 3D cohérente sur plusieurs vues à partir d'entrées éparses sans optimisation par scène
FutureX : un benchmark en temps réel avancé pour les agents LLM dans la prédiction de l'avenir
DuPO : Permettre une auto-vérification fiable des grands modèles linguistiques grâce à une optimisation par préférences duals
Des notes aux compétences : un cadre de diagnostic cognitif pour évaluer les grands modèles linguistiques financiers
MV-RAG : diffusion multivue augmentée par récupération
Connecter la synthèse des frameworks organométalliques à leurs applications à l’aide d’un apprentissage automatique multimodal
Protocoles de contexte de modèle dans les systèmes de transport adaptatifs : Une revue
Action collective algorithmique avec plusieurs collectifs
OpenCUA : Fondations ouvertes pour les agents d'utilisation informatique
Politique spatiale : orienter la manipulation robotique visuomotrice par une modélisation et un raisonnement sensibles à l'espace
Jet-Nemotron : Modèle linguistique efficace basé sur une recherche post-architecturale neuronale
CRISP : Désapprentissage de concepts persistants par autoencodeurs creux
Apprentissage contrastif sélectif pour l'ancrage d'aptitudes sous supervision faible
EgoTwin : Corps et vue en première personne dans le rêve
Au-delà de Pass@1 : le self-play avec une synthèse variationnelle de problèmes soutient le RLVR
ODYSSEY : Exploration et manipulation des quadrupèdes dans un monde ouvert pour des tâches à horizon long
AgentFly : Affiner les agents de LLMS sans affiner les LLMS
Raisonneur de diffusion guidé par des contraintes pour l'apprentissage neuro-symbole
Les agents fondés sur les LLM pour la cartographie du paysage concurrentiel dans le cadre de l'analyse approfondie des actifs pharmaceutiques
SceneGen : Génération de scènes 3D à partir d'une seule image en une seule passe d'avant-progression
Une revue sur les benchmarks des grands modèles linguistiques
Waver : Ondulez votre chemin vers la génération vidéo réaliste
LiveMCP-101 : Tests de charge et diagnostic des agents pilotés par MCP sur des requêtes complexes
Pensez profondément avec assurance
Mobile-Agent-v3 : Agents fondamentaux pour l'automatisation des interfaces graphiques
Intern-S1 : un modèle fondamental multimodal scientifique
Ajustement guidé par le langage : amélioration de l'optimisation numérique grâce aux retours textuels
NiceWebRL : une bibliothèque Python pour les expériences avec sujets humains dans des environnements d'apprentissage par renforcement
Du traitement de l'information scientifique par l'intelligence artificielle à la science agente : une revue sur la découverte scientifique autonome
MeshCoder : Génération de code de maillage structuré par LLM à partir de nuages de points
Tinker : Le don de la diffusion à l'édition 3D cohérente sur plusieurs vues à partir d'entrées éparses sans optimisation par scène
FutureX : un benchmark en temps réel avancé pour les agents LLM dans la prédiction de l'avenir
DuPO : Permettre une auto-vérification fiable des grands modèles linguistiques grâce à une optimisation par préférences duals
Des notes aux compétences : un cadre de diagnostic cognitif pour évaluer les grands modèles linguistiques financiers