Command Palette
Search for a command to run...
Papers
Articles de recherche en IA de pointe mis à jour quotidiennement pour vous aider à suivre les dernières tendances en IA
articles

Regarder avant d'agir : amélioration des représentations de fondation visuelles pour les modèles vision-langage-action

Apprentissage par renforcement complémentaire






























L'alignement rend les LLM normatifs, et non descriptifs.
MosaicMem : mémoire spatiale hybride pour des modèles mondiaux vidéo contrôlables
MetaClaw : Il suffit de parler — un Agent qui méta-apprend et évolue à l'état sauvage
Video-CoE : Renforcer la prédiction d'événements vidéo via une Chain of Events
FunCineForge : un toolkit de dataset unifié et un modèle pour le doublage de films en zero-shot dans diverses scènes cinématographiques
Watermarking in-context pour les Large Language Models
WorldCam : Mondes de jeu 3D interactifs et autorégressifs avec la pose de caméra comme représentation géométrique unificatrice
Démystifier le raisonnement vidéo
Kinema4D : Modélisation cinématique du monde en 4D pour la simulation incarnée spatio-temporelle
Qianfan-OCR : un modèle unifié de bout en bout pour l'intelligence documentaire
InCoder-32B : modèle fondationnel de code pour des scénarios industriels
MiroThinker-1.7 & H1 : Vers des agents de recherche de haute performance par la vérification
HSImul3R : Reconstruction en boucle fermée intégrant la physique pour des interactions humain-scène prêtes à la simulation
Attention de type mélange de profondeurs
Résidus d'attention
Ancrage des modèles de simulation du monde dans une métropole réelle
OpenSeeker : démocratisation des agents de recherche de pointe par la mise entièrement open source des données d'entraînement
L'IA peut acquérir le goût scientifique.
MM-CondChain : une référence vérifiée algorithmiquement pour le raisonnement compositionnel profond ancré visuellement
Les modèles vision-langage peuvent-ils résoudre le jeu de coquilles ?
OmniForcing : Libérer la génération audio-visuelle conjointe en temps réel
daVinci-Env : Synthèse d'environnements SWE ouverts à grande échelle
Cheers : Découpler les détails des patchs des représentations sémantiques permet une compréhension et une génération multimodales unifiées
LMEB : Benchmark d'incorporation de mémoire à long horizon
DreamVideo-Omni : Personnalisation vidéo multi-sujets pilotée par un mouvement omnidirectionnel avec renforcement de l'identité latente
ShotVerse : Faire progresser le contrôle cinématographique de la caméra pour la création de vidéos multi-plans pilotée par le texte
Modélisation de la récompense basée sur la vidéo pour les agents d'utilisation informatique
IndexCache : Accélération de l'attention éparses par réutilisation d'index inter-couches
Navigation stratégique ou recherche stochastique ? Comment les agents et les humains raisonnent sur des collections de documents
Spatial-TTT : Intelligence spatiale basée sur le flux visuel avec entraînement au moment du test