DeepSeek lance l'API multimodale V4-Flash-Vision
DeepSeek a rendu accessible en ligne son nouveau modèle expérimental multimodal DeepSeek-V4-Flash-Vision-Exp via sa plateforme d'interface de programmation. Cette mise à jour s'accompagne de la sortie de DeepSeek Harness 0.1.1, qui intègre une prise en charge native de la nouvelle architecture. Le modèle conserve les performances de sa version antérieure sur les tâches textuelles, notamment en raisonnement, en connaissances générales et dans le fonctionnement des agents autonomes. Sur les benchmarks dédiés aux agents multimodaux, il réalise un bond significatif, se rapprochant désormais des performances du modèle Opus-4.8. L'ajout de la vision par ordinateur élargit considérablement les cas d'usage pratiques. Le modèle accepte désormais des entrées combinant texte et images, que celles-ci soient fournies sous forme de liens externes, de codes encodés ou via une nouvelle fonctionnalité de gestion des fichiers. DeepSeek a en effet lancé une interface dédiée au stockage de fichiers, permettant de téléverser une image une seule fois et de la réutiliser ultérieurement grâce à un identifiant unique. Cette solution réduit la consommation de bande passante et simplifie les workflows développeurs. L'utilisation de cette nouvelle fonctionnalité est gratuite. Sur le plan technique, le service s'intègre aux endpoints standards de génération de texte et de gestion des messages, tout en restant compatible avec les principaux cadres de développement d'agents. La facturation des images suit une tokenisation maximale de 384 jetons par visuel, appliquée aux tarifs existants du modèle de base. Les développeurs peuvent activer la fonctionnalité en spécifiant le nom correspondant dans leurs requêtes. Cette publication marque une étape importante dans la démocratisation des agents intégrant compréhension visuelle et exécution d'outils complexes, tout en maintenant un accès économique et une intégration fluide dans les écosystèmes existants.
