Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

World Craft : Cadre agent pour la création de mondes visualisables à partir de texte

La génération visuelle débloque un raisonnement semblable à celui de l’humain grâce aux modèles mondes multimodaux































World Craft : Cadre agent pour la création de mondes visualisables à partir de texte

La génération visuelle débloque un raisonnement semblable à celui de l’humain grâce aux modèles mondes multimodaux






























Modélisation de la profondeur masquée pour la perception spatiale
Un modèle fondamental VLA pragmatique
AdaReasoner : Orchestration dynamique d'outils pour le raisonnement visuel itératif
AgentDoG : Un cadre de protection diagnostique pour la sécurité et la sûreté des agents IA
RAPPORT TECHNIQUE ARCEE TRINITY GRAND FORMAT
Enseigner aux modèles d'enseigner eux-mêmes : le raisonnement aux limites de l'apprenabilité
ATLAS : Lois d'adaptation de transfert pour le préentraînement multilingue, le fine-tuning et le décodage de la malédiction de la multilinguisme
iFSQ : Amélioration de FSQ pour la génération d'images avec une seule ligne de code
Attention Élastique : Ratios de Sparsité Adaptatifs en Temps de Test pour des Transformers Efficaces
Synthèse d’images scientifiques : benchmarking, méthodologies et utilité en aval
Le Script, c’est tout ce dont vous avez besoin : un cadre agissant pour la génération de vidéos cinématographiques à partir de dialogues à longue portée
daVinci-Dev : Agent-native Mid-training pour l'ingénierie logicielle
Les LLM peuvent-ils nettoyer votre désordre ? Une revue de la préparation des données opérationnelles grâce aux LLM
DeepSeek-OCR 2 : Flux causal visuel
Apprendre à découvrir au moment de l'essai
Extraire des capacités nuisibles par une adaptation fine à partir de sorties protégées
Memory-V2V : Amplifier les modèles de diffusion vidéo-à-vidéo par la mémoire
Échelle d'inférence du vérification : agents de recherche profonde auto-évoluant via une vérification guidée par un barème à l'époque du test
VisGym : Environnements diversifiés, personnalisables et évolutifs pour les agents multimodaux
TwinBrainVLA : Libérer le potentiel des VLM généralistes pour les tâches incarnées grâce à un Mélange asymétrique de Transformers
SWE-Pruner : Élagage contextuel auto-adaptatif pour les agents de codage
Rapport technique LongCat-Flash-Thinking-2601
Les modèles de langage peuvent-ils découvrir des lois d'échelle ?
Cosmos Policy : Affinement de modèles vidéo pour le contrôle et la planification visuomoteurs
Triton-distribué : Programmation de noyaux chevauchants sur des systèmes d'IA distribués avec le compilateur Triton
Extension des transformateurs de diffusion texte-image à l’aide d’autoencodeurs de représentation
BayesianVLA : Décomposition bayésienne des modèles vision-langage-action à l’aide de requêtes d’action latentes
Le piège de la flexibilité : pourquoi les limites d’ordre arbitraire restreignent le potentiel de raisonnement des modèles linguistiques à diffusion
LLM-in-Sandbox Évoque une Intelligence Agente Générale
HERMES : Mémoire tampon KV comme mémoire hiérarchique pour une compréhension efficace des vidéos en flux
Modélisation de la profondeur masquée pour la perception spatiale
Un modèle fondamental VLA pragmatique
AdaReasoner : Orchestration dynamique d'outils pour le raisonnement visuel itératif
AgentDoG : Un cadre de protection diagnostique pour la sécurité et la sûreté des agents IA
RAPPORT TECHNIQUE ARCEE TRINITY GRAND FORMAT
Enseigner aux modèles d'enseigner eux-mêmes : le raisonnement aux limites de l'apprenabilité
ATLAS : Lois d'adaptation de transfert pour le préentraînement multilingue, le fine-tuning et le décodage de la malédiction de la multilinguisme
iFSQ : Amélioration de FSQ pour la génération d'images avec une seule ligne de code
Attention Élastique : Ratios de Sparsité Adaptatifs en Temps de Test pour des Transformers Efficaces
Synthèse d’images scientifiques : benchmarking, méthodologies et utilité en aval
Le Script, c’est tout ce dont vous avez besoin : un cadre agissant pour la génération de vidéos cinématographiques à partir de dialogues à longue portée
daVinci-Dev : Agent-native Mid-training pour l'ingénierie logicielle
Les LLM peuvent-ils nettoyer votre désordre ? Une revue de la préparation des données opérationnelles grâce aux LLM
DeepSeek-OCR 2 : Flux causal visuel
Apprendre à découvrir au moment de l'essai
Extraire des capacités nuisibles par une adaptation fine à partir de sorties protégées
Memory-V2V : Amplifier les modèles de diffusion vidéo-à-vidéo par la mémoire
Échelle d'inférence du vérification : agents de recherche profonde auto-évoluant via une vérification guidée par un barème à l'époque du test
VisGym : Environnements diversifiés, personnalisables et évolutifs pour les agents multimodaux
TwinBrainVLA : Libérer le potentiel des VLM généralistes pour les tâches incarnées grâce à un Mélange asymétrique de Transformers
SWE-Pruner : Élagage contextuel auto-adaptatif pour les agents de codage
Rapport technique LongCat-Flash-Thinking-2601
Les modèles de langage peuvent-ils découvrir des lois d'échelle ?
Cosmos Policy : Affinement de modèles vidéo pour le contrôle et la planification visuomoteurs
Triton-distribué : Programmation de noyaux chevauchants sur des systèmes d'IA distribués avec le compilateur Triton
Extension des transformateurs de diffusion texte-image à l’aide d’autoencodeurs de représentation
BayesianVLA : Décomposition bayésienne des modèles vision-langage-action à l’aide de requêtes d’action latentes
Le piège de la flexibilité : pourquoi les limites d’ordre arbitraire restreignent le potentiel de raisonnement des modèles linguistiques à diffusion
LLM-in-Sandbox Évoque une Intelligence Agente Générale
HERMES : Mémoire tampon KV comme mémoire hiérarchique pour une compréhension efficace des vidéos en flux