Command Palette
Search for a command to run...
Tutoriel En Ligne | L'agent Visuel Est Là ! Les Performances Du Nouveau Modèle DeepSeek-V4 Explosent, Atteignant Un Score De 36,5 Sur ApexBench

La série DeepSeek-V4 franchit officiellement le pas du multimodal avec la sortie de son premier modèle visuel expérimental : DeepSeek-V4-Flash-Vision-Exp !
En tant qu’extension multimodale de l’architecture DeepSeek-V4-Flash, DeepSeek-V4-Flash-Vision-Exp intègre un module visuel et bénéficie d’un entraînement continu. Tout en conservant les capacités initiales des agents textuels, il débloque désormais une compréhension visuelle avancée. Le modèle peut traiter des tâches complexes en combinant informations visuelles telles que des images ou des graphiques, renforçant ainsi particulièrement la perception environnementale et la capacité à exécuter des tâches au sein d’agents multimodaux.
Sur le plan des performances, le modèle réalise un meilleur équilibre entre les compétences des agents textuels et celles des agents multimodaux. Alors que les performances sur les tâches purement textuelles restent stables, le score ApexBench (Pass@1) passe de 26,2 à 36,5, Agents' Last Exam atteint 27,3, et le modèle obtient respectivement 64,3 et 35,0 dans les benchmarks multimodaux Chartography et ZeroBench. Il se distingue également par des résultats compétitifs lors des tests textuels tels que DeepSWE, NL2Repo et Toolathlon-Verified.
De la compréhension textuelle à la perception visuelle, DeepSeek-V4-Flash-Vision-Exp ouvre une nouvelle voie pour les agents multimodauux au sein de la famille DeepSeek-V4. À mesure que s’intégrera davantage la compréhension visuelle, le raisonnement et l’appel d’outils, ces agents devraient faire preuve d’une autonomie accrue dans des scénarios réels exigeants : exécution de tâches complexes, analyse de diagrammes, manipulation d’interfaces utilisateur, etc.
Le volet tutoriels de HyperAI propose dès maintenant « Inférence multimodale avec DeepSeek-V4-Flash-Vision-Exp et déploiement via Open WebUI ». Cette solution permet un déploiement en un clic afin de découvrir rapidement ses capacités de compréhension visuelle, d’agent multimodal et d’exécution de tâches complexes.
Exécution en ligne :
Plusieurs autres tutoriels disponibles en ligne :
Exécution de la Démo
- Depuis la page d’accueil de hyper.ai, accédez à la section « Tutoriels » ou cliquez sur « Voir plus de tutoriels », sélectionnez « Inférence multimodale avec DeepSeek-V4-Flash-Vision-Exp et déploiement via Open WebUI », puis cliquez sur « Lancer ce tutoriel ».
- Après redirection vers la page suivante, cliquez sur « Clone » en haut à droite pour cloner ce tutoriel dans votre propre conteneur.
Remarque : La langue affichée en haut à droite est modifiable ; chinois et anglais sont actuellement pris en charge. Les étapes ci-dessous illustrent le processus en utilisant l’anglais comme exemple.
- Attendez l’affectation des ressources. Une fois le statut passé à « Running (En cours d’exécution) », cliquez sur « Open Workspace » pour accéder à l’environnement Jupyter Workspace.
Présentation des Résultats
- Après redirection, ouvrez le fichier README situé dans la barre latérale gauche, puis cliquez sur Run (Exécuter) en haut de celle-ci.
- Une fois démarré, cliquez sur l’adresse API située à droite pour accéder à l’interface Open WebUI depuis votre navigateur et commencer à dialoguer avec le modèle local.



