Command Palette
Search for a command to run...
Online-Tutorial | Der Visuelle Agent Ist Da! DeepSeek-V4-Modell Erreicht Drastisch Höhere Benchmark-Ergebnisse, ApexBench Steigt Auf 36,5

Die DeepSeek-V4-Serie macht offiziell den Schritt hin zu Multimodalität – das erste experimentelle visuelle Modell „DeepSeek-V4-Flash-Vision-Exp“ wurde veröffentlicht!
Als multimodale Erweiterung der DeepSeek-V4-Flash-Architektur hat DeepSeek-V4-Flash-Vision-Exp durch die Einführung eines visuellen Moduls und kontinuierliches Training nicht nur seine ursprünglichen Fähigkeiten als Text-Agent beibehalten, sondern auch neue Fähigkeiten im Bereich des visuellen Verständnisses freigeschaltet. Das Modell kann komplexe Aufgaben unter Einbeziehung visueller Informationen wie Bilder und Diagramme ausführen, wobei der Schwerpunkt auf einer verstärkten Umgebungswahrnehmung und Aufgabenausführungsfähigkeit von multimodalen Agents liegt.
In Bezug auf die Leistung zeigt das Modell eine weiter verbesserte Balance zwischen reinen Textfähigkeiten und multimodalen Agentenfunktionen: Während die Performance bei textbasierten Agentenaufgaben weitgehend stabil blieb, stieg der ApexBench-Wert (Pass@1) von 26,2 auf 36,5, Agents’ Last Exam erreichte einen Wert von 27,3, und es wurden Ergebnisse von 64,3 bzw. 35,0 in multimodalen Benchmarktests wie Chartography und ZeroBench erzielt. In Tests für reine Textagents wie DeepSWE, NL2Repo und Toolathlon-Verified zeigte sich ebenfalls ein wettbewerbsfähiger Auftritt des neuen Modells.
Vom Textverständnis zur visuellen Wahrnehmung eröffnet DeepSeek-V4-Flash-Vision-Exp mit dem DeepSeek-V4-Serie einen neuen Weg für multimodale Agents. Mit der weiteren Integration von visuellem Verständnis, Schlussfolgerungsvermögen und Werkzeugnutzung werden Agents wahrscheinlich stärkere autonome Fähigkeiten in realen Anwendungsszenarien zeigen, etwa bei komplexen Aufgaben, Diagrammanalysen oder Benutzeroberflächensteuerungen.
Derzeit ist im HyperAI-Tutorialbereich das Tutorial „Multimodales Reasoning mit DeepSeek-V4-Flash-Vision-Exp & Deployment über Open WebUI“ verfügbar. Es unterstützt die Installation des Modells per Knopfdruck, sodass Sie dessen visuelle Verstehens-, multimodale Agenten- sowie Fähigkeit zur Ausführung komplexer Aufgaben schnell erleben können.
Online ausführen:
Weitere Online-Anleitungen:
Demo-Betrieb
- Nach Aufrufen der Startseite von hyper.ai wählen Sie die Seite „Tutorials“, klicken auf „Mehr Tutorials anzeigen“ und suchen nach „Multimodales Reasoning mit DeepSeek-V4-Flash-Vision-Exp & Deployment über Open WebUI“. Klicken Sie anschließend auf „Dieses Tutorial starten“.
- Nach Weiterleitung der Seite klicken Sie oben rechts auf „Klonen“, um dieses Tutorial in Ihren eigenen Container zu klonen.
Hinweis: Oben rechts auf der Seite lässt sich die Sprache wechseln; aktuell stehen Chinesisch und Englisch zur Verfügung. Im Folgenden wird am Beispiel der englischen Version vorgegangen.
- Warten Sie, bis Ressourcen zugewiesen sind. Sobald der Status auf „Läuft“ wechselt, klicken Sie auf „Workspace öffnen“, um zum Jupyter-Workspace zu gelangen.
Ergebnispräsentation
- Nach Weiterleitung der Seite klicken Sie links auf die Datei „README“. Dort angekommen klicken Sie oben auf „Run“ (Ausführen).
- Nach dem Start können Sie über die angezeigte API-Adresse rechts Ihre lokale Open-WebUI-Oberfläche im Browser aufrufen und beginnen, lokal mit Ihrem Modell zu interagieren.



