HyperAIHyperAI

Command Palette

Search for a command to run...

DeepSeek startet V4-Flash-Vision-Exp Multimodal-API

DeepSeek hat die experimentelle Multimodal-API DeepSeek-V4-Flash-Vision-Exp veröffentlicht und gleichzeitig die Files API live geschaltet. Das neue Modell entspricht auf rein textbasierten Aufgaben wie Agentensteuerung, komplexem Reasoning und Weltwissen dem bereits etablierten V4-Flash. Bei multimodalen Agentenbenchmarktests erzielt die Vision-Erweiterung einen deutlichen Leistungssprung und erreicht in der Bewertung annähernd das Niveau von Opus-4.8. Die Integration in bestehende Infrastrukturen wird durch die direkte Parameterreferenz sowie den Release von DeepSeek Harness 0.1.1 erheblich vereinfacht, die out-of-the-box-Unterstützung für das neue Modell bietet. Technisch ermöglicht die API die Verarbeitung gemischter Eingaben aus Text und Bildern über mehrere Schnittstellen. Nutzer können Bilddaten wahlweise als Base64-String, externe URLs oder über die neu eingeführte Files API bereitstellen. Die Abrechnung erfolgt tokenisiert, wobei jedes Bild bis zu 384 Tokens verbraucht; die Preisgestaltung orientiert sich an den Konditionen von V4-Flash. Die Files API stellt ein kostenloses Feature dar, das Entwicklern erlaubt, Bilder einmalig hochzuladen und anschließend über eine eindeutige Datei-ID wiederzuverwenden. Dies reduziert den Netzwerktraffic erheblich und eliminiert wiederholte Uploads in nachfolgenden Anfragezyklen. Die Kombination aus visueller Analyse und breiten Tool-Schnittstellen erschließt neue Anwendungsfelder für autonome Agenten. Durch die kompatible Architektur lässt sich das Modell reibungslos in gängige Agenten-Frameworks einbinden, was praktische, multimodale Arbeitsabläufe beschleunigt. Mit dem Support für Chat Completions und Messages & Responses stellt DeepSeek damit ein schlüssiges Ökosystem bereit, das die Skalierbarkeit von Bild-Text-Kombinationen in professionellen KI-Infrastrukturen weiter vorantreibt.

Verwandte Links