Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA

SimScale : Apprendre à conduire grâce à la simulation en monde réel à grande échelle

Skywork-R1V4 : Vers une intelligence multimodale agente grâce à une pensée entrelacée avec des images et une recherche approfondie































SimScale : Apprendre à conduire grâce à la simulation en monde réel à grande échelle

Skywork-R1V4 : Vers une intelligence multimodale agente grâce à une pensée entrelacée avec des images et une recherche approfondie






























LLM auto-évoluant guidé avec une supervision humaine minimale
MultiShotMaster : un cadre contrôlable pour la génération de vidéos à plusieurs plans
MG-Nav : Navigation visuelle à double échelle par mémoire spatiale creuse
Le Consistency Critic : Correction des incohérences dans les images générées par alignement attentif guidé par une référence
À quelle distance sommes-nous d’agents de recherche profonde véritablement utiles ?
Stabilisation de l'apprentissage par renforcement avec des LLM : formulation et pratiques
Envision : Évaluation comparative d'une compréhension et génération unifiées pour des aperçus des processus mondiaux causaux
LongVT : Inciter à « réfléchir avec des vidéos longues » grâce à l'appel natif d'outils
Du modèle fondamental de code aux Agents et aux applications : un guide pratique pour l'intelligence du code
Modélisation spatio-temporelle pilotée par la physique pour la détection des vidéos générées par l'intelligence artificielle
Mem-α : Apprentissage de la construction de mémoire par apprentissage par renforcement
Recherche par auto-jeu : repousser les limites de la capacité des agents sans supervision
CudaForge : un cadre d'agents avec retour matériel pour l'optimisation des noyaux CUDA
ScaleNet : Augmenter l'échelle des réseaux neuronaux préentraînés par des paramètres incrémentaux
Optimisation du mélange d'attention par bloc
FractalForensics : détection et localisation préventives des deepfakes par empreintes fractales
Hijacking de chaîne de raisonnement
InstanceAssemble : Génération d'images sensible au disposition par attention par assemblage d'instances
3EED : Intégrer tout, partout, en 3D
DetectiumFire : Un ensemble de données multi-modales complet reliant la vision et le langage pour la compréhension des incendies
CHIP : Un jeu de données multi-capteurs pour l'estimation de la pose 6D des chaises dans des environnements industriels
Agent à contraintes géométriques pour le raisonnement spatial
DeepSeek-V3.2 : Pousser les limites des modèles linguistiques à grande échelle ouverts
DiP : Maîtriser les modèles de diffusion dans l'espace pixel.
Le découplage d'architecture n'est pas tout ce dont vous avez besoin pour un modèle multimodal unifié
Vision Bridge Transformer à grande échelle
AnyTalker : Génération de vidéos parlantes multi-personnes à grande échelle avec raffinement de l'interactivité
REASONEDIT : Vers des modèles de modification d’image renforcés par le raisonnement
OpenApps : Simuler des variations d'environnement pour évaluer la fiabilité des agents UI
Rapport technique Qwen3-VL
LLM auto-évoluant guidé avec une supervision humaine minimale
MultiShotMaster : un cadre contrôlable pour la génération de vidéos à plusieurs plans
MG-Nav : Navigation visuelle à double échelle par mémoire spatiale creuse
Le Consistency Critic : Correction des incohérences dans les images générées par alignement attentif guidé par une référence
À quelle distance sommes-nous d’agents de recherche profonde véritablement utiles ?
Stabilisation de l'apprentissage par renforcement avec des LLM : formulation et pratiques
Envision : Évaluation comparative d'une compréhension et génération unifiées pour des aperçus des processus mondiaux causaux
LongVT : Inciter à « réfléchir avec des vidéos longues » grâce à l'appel natif d'outils
Du modèle fondamental de code aux Agents et aux applications : un guide pratique pour l'intelligence du code
Modélisation spatio-temporelle pilotée par la physique pour la détection des vidéos générées par l'intelligence artificielle
Mem-α : Apprentissage de la construction de mémoire par apprentissage par renforcement
Recherche par auto-jeu : repousser les limites de la capacité des agents sans supervision
CudaForge : un cadre d'agents avec retour matériel pour l'optimisation des noyaux CUDA
ScaleNet : Augmenter l'échelle des réseaux neuronaux préentraînés par des paramètres incrémentaux
Optimisation du mélange d'attention par bloc
FractalForensics : détection et localisation préventives des deepfakes par empreintes fractales
Hijacking de chaîne de raisonnement
InstanceAssemble : Génération d'images sensible au disposition par attention par assemblage d'instances
3EED : Intégrer tout, partout, en 3D
DetectiumFire : Un ensemble de données multi-modales complet reliant la vision et le langage pour la compréhension des incendies
CHIP : Un jeu de données multi-capteurs pour l'estimation de la pose 6D des chaises dans des environnements industriels
Agent à contraintes géométriques pour le raisonnement spatial
DeepSeek-V3.2 : Pousser les limites des modèles linguistiques à grande échelle ouverts
DiP : Maîtriser les modèles de diffusion dans l'espace pixel.
Le découplage d'architecture n'est pas tout ce dont vous avez besoin pour un modèle multimodal unifié
Vision Bridge Transformer à grande échelle
AnyTalker : Génération de vidéos parlantes multi-personnes à grande échelle avec raffinement de l'interactivité
REASONEDIT : Vers des modèles de modification d’image renforcés par le raisonnement
OpenApps : Simuler des variations d'environnement pour évaluer la fiabilité des agents UI
Rapport technique Qwen3-VL