Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

Avancement des modèles mondiaux open-source

Plus dur est mieux : améliorer le raisonnement mathématique grâce au GRPO conscient de la difficulté et à la reformulation multi-aspect des questions






























L'attention à fenêtre courte permet la mémoire à long terme
World Craft : Cadre agent pour la création de mondes visualisables à partir de texte
La génération visuelle débloque un raisonnement semblable à celui de l’humain grâce aux modèles mondes multimodaux
Modélisation de la profondeur masquée pour la perception spatiale
Un modèle fondamental VLA pragmatique
AdaReasoner : Orchestration dynamique d'outils pour le raisonnement visuel itératif
AgentDoG : Un cadre de protection diagnostique pour la sécurité et la sûreté des agents IA
RAPPORT TECHNIQUE ARCEE TRINITY GRAND FORMAT
Enseigner aux modèles d'enseigner eux-mêmes : le raisonnement aux limites de l'apprenabilité
ATLAS : Lois d'adaptation de transfert pour le préentraînement multilingue, le fine-tuning et le décodage de la malédiction de la multilinguisme
iFSQ : Amélioration de FSQ pour la génération d'images avec une seule ligne de code
Attention Élastique : Ratios de Sparsité Adaptatifs en Temps de Test pour des Transformers Efficaces
Synthèse d’images scientifiques : benchmarking, méthodologies et utilité en aval
Le Script, c’est tout ce dont vous avez besoin : un cadre agissant pour la génération de vidéos cinématographiques à partir de dialogues à longue portée
daVinci-Dev : Agent-native Mid-training pour l'ingénierie logicielle
Les LLM peuvent-ils nettoyer votre désordre ? Une revue de la préparation des données opérationnelles grâce aux LLM
DeepSeek-OCR 2 : Flux causal visuel
Apprendre à découvrir au moment de l'essai
Extraire des capacités nuisibles par une adaptation fine à partir de sorties protégées
Memory-V2V : Amplifier les modèles de diffusion vidéo-à-vidéo par la mémoire
Échelle d'inférence du vérification : agents de recherche profonde auto-évoluant via une vérification guidée par un barème à l'époque du test
VisGym : Environnements diversifiés, personnalisables et évolutifs pour les agents multimodaux
TwinBrainVLA : Libérer le potentiel des VLM généralistes pour les tâches incarnées grâce à un Mélange asymétrique de Transformers
SWE-Pruner : Élagage contextuel auto-adaptatif pour les agents de codage
Rapport technique LongCat-Flash-Thinking-2601
Les modèles de langage peuvent-ils découvrir des lois d'échelle ?
Cosmos Policy : Affinement de modèles vidéo pour le contrôle et la planification visuomoteurs
Triton-distribué : Programmation de noyaux chevauchants sur des systèmes d'IA distribués avec le compilateur Triton
Extension des transformateurs de diffusion texte-image à l’aide d’autoencodeurs de représentation
BayesianVLA : Décomposition bayésienne des modèles vision-langage-action à l’aide de requêtes d’action latentes