Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Zurück zum Blog

DeepSeek-V4-Flash-Vision-Exp API-Leitfaden 2026

DeepSeek V4 Flash VisionDeepSeek APImultimodale AgentenVision APIResponses API

DeepSeek hat am 21. August 2026 sein erstes offizielles multimodales API-Modell deepseek-v4-flash-vision-exp veröffentlicht. Es ergänzt die Text-, Reasoning- und Agentenfähigkeiten von DeepSeek V4 Flash um Bildverständnis, bietet ein Kontextfenster von 1M Tokens, bis zu 384K Ausgabe-Tokens und berechnet pro Bild höchstens 384 Eingabe-Tokens – zum direkten API-Preis von V4 Flash.

Das Suffix exp steht für experimentell. Die Route ist über die offizielle DeepSeek-API aufrufbar, sollte aber nicht als langfristig stabile Version beschrieben werden. Dieser Leitfaden trennt offizielle DeepSeek-Spezifikationen und Anbieter-Benchmarks, Beispiele Dritter und den öffentlichen Routenstatus dieses Gateways. Bei der Prüfung am 22. August 2026 war die neue ID noch nicht im öffentlichen Preiskatalog dieses Gateways enthalten. Deshalb wird hier kein Gateway-Multiplikator geschätzt.

Zuerst die Live-Route prüfen: Vergewissern Sie sich, dass deepseek-v4-flash-vision-exp unter Modellpreise erscheint, bevor Sie auf der API-Kaufseite ein kleines Guthaben eröffnen. Verfügbarkeit und Abrechnungsbelege zum Zeitpunkt der Anfrage sind maßgeblich.

Eckdaten zu DeepSeek-V4-Flash-Vision-Exp

Punkt Offiziell veröffentlichte Angabe
Veröffentlichung 21. August 2026
Exakte Modell-ID deepseek-v4-flash-vision-exp
Status Experimentelles multimodales API-Modell
Kontextfenster 1M Tokens
Maximale Ausgabe 384K Tokens
Bild-Tokenverbrauch Abmessungsabhängig; höchstens 384 Tokens pro Bild
Maximale Bilder pro Anfrage 600
Eingabemethoden Text + Bild per base64, externer URL oder Files-API-file_id
API-Formate Chat Completions, Anthropic Messages und Responses API
Tool-Aufrufe Unterstützt
Denkmodi Mit und ohne Thinking; Thinking ist Standard
FIM-Vervollständigung Nicht unterstützt
Offizielles Parallelitätslimit 2.500

Offizieller DeepSeek-Benchmarkvergleich von V4 Flash Vision Exp, V4 Flash und Opus-4.8

Quelle: DeepSeek-Veröffentlichung vom 21. August 2026. Es handelt sich um vom Anbieter veröffentlichte Bewertungen, nicht um unabhängige Tests dieser Website.

Benchmark-Analyse: Nahe an Opus-4.8 heißt nicht, jeden Test zu gewinnen

Laut DeepSeek macht V4-Flash-Vision-Exp bei multimodalen Agenten-Benchmarks einen großen Sprung gegenüber V4 Flash und erreicht insgesamt ein Leistungsniveau nahe Opus-4.8. Die veröffentlichte Tabelle stützt diese Einordnung, zeigt bei den Einzelwerten jedoch ein gemischtes Bild und keinen vollständigen Sieg.

Benchmark Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83,9 82,7 85,0
NL2Repo 57,7 54,2 69,7
Cybergym 75,3 76,7 78,3
DeepSWE 59,3 54,4 58,0
Toolathlon-Verified 75,9 70,3 76,2
DSBench-Hard 63,6 59,6 71,7
AutomationBench (Public) 25,7 25,1 27,2
ApexBench (Pass@1) 36,5 26,2 39,4
Agents' Last Exam 27,3 25,2 25,7
Chartography 64,3 65,0
ZeroBench (Pass@5) 35,0 34,0

Vision-Exp liegt bei DeepSWE, Agents' Last Exam und ZeroBench über dem abgebildeten Opus-4.8-Ergebnis, bei Terminal Bench, NL2Repo und DSBench-Hard jedoch darunter. Gegenüber V4-Flash-0731 erreicht es in acht der neun direkt vergleichbaren Zeilen den höheren Wert; die Ausnahme ist Cybergym.

Die Evaluationsbedingungen sind wichtig. DeepSeek führte die öffentlichen textbasierten Code-Agent-Aufgaben mit DeepSeek Harness im Minimal Mode, maximalen Ausgabe-Tokens, top_p=0.95 und temperature=1.0 aus. Bei ApexBench und Agents' Last Exam ignoriert das reine Textmodell V4 Flash multimodale Elemente. Diese Zeilen sind daher kein gleichwertiger Vergleich zweier Vision-Modelle.

Was kostet ein Bild mit 384 Tokens tatsächlich?

DeepSeek skaliert und kachelt ein Bild abhängig von seinen Abmessungen und berechnet das Ergebnis als Eingabe-Tokens. Der Höchstwert beträgt 384 Tokens pro Bild. Mehrere Bilder werden einzeln gezählt; für die gesamte Anfrage gibt es keinen gemeinsamen Deckel von 384 Tokens.

In der direkten API wird Vision-Exp zum gleichen Preis wie V4 Flash gelistet:

Direkte DeepSeek-API Nebenzeit Spitzenzeit
Cache-Treffer-Eingabe / 1M Tokens 0,007 $ 0,014 $
Cache-Fehltreffer-Eingabe / 1M Tokens 0,22 $ 0,44 $
Ausgabe / 1M Tokens 0,66 $ 1,32 $

Unter der vorsichtigen Annahme, dass jedes Bild 384 Tokens erreicht und als Eingabe ohne Cache-Treffer berechnet wird, kosten 1.000 Bilder allein für die Bildeingabe etwa 0,0845 $ in der Nebenzeit oder 0,169 $ zur Spitzenzeit. Texteingabe, Modellausgabe, Tool-Schleifen und Wiederholungen sind nicht enthalten.

Die chinesische Preisseite von DeepSeek nennt regionale CNY-Preise von 1,50 CNY/M in der Nebenzeit und 3,00 CNY/M zur Spitzenzeit für Eingaben ohne Cache-Treffer. Unter derselben Maximalbild-Annahme kosten 1.000 Bilder etwa 0,576 CNY beziehungsweise 1,152 CNY an Bildeingabe. Die USD- und CNY-Tabellen sind offizielle regionale Preise und keine aktuelle Währungsumrechnung.

Der bereitgestellte chinesische Bericht verglich diese Kosten mit anderen Vision-APIs und nannte eine Differenz von 25x bis 50x. Dieser Artikel übernimmt das Verhältnis nicht, weil Konkurrenzmodelle, Bild-Tokenregeln, Zeitstaffeln und Ausgabekosten nicht mit einer einheitlichen Methode verifiziert wurden.

Mit einem echten Abrechnungsbeleg prüfen: Falls das Modell im Live-Katalog dieses Gateways erscheint, laden Sie einen kleinen Betrag auf einen bestehenden Schlüssel und testen Sie ein unkritisches Bild. Erfassen Sie Bild-, Text- und Ausgabe-Tokens, Latenz sowie die tatsächliche Belastung.

Drei Methoden für Bildeingaben

1. Inline-base64

Kodieren Sie JPEG, PNG, GIF oder WebP als Data-URL. Das eignet sich für kleine oder vorübergehend private Bilder. Der Inline-Anfragekörper ist auf 48 MiB begrenzt, ein einzelnes Bild auf 32 MiB.

2. Externe URL

Geben Sie ein öffentlich herunterladbares HTTP(S)-Bild an. DeepSeek begrenzt ein URL-Bild auf 32 MiB und verlangt einen Download innerhalb von 60 Sekunden. Vermeiden Sie Links, die Cookies, privaten Netzwerkzugriff oder kurzlebige Signaturen benötigen, sofern die genaue Route nicht getestet wurde.

3. Files-API-file_id

Laden Sie ein Bild einmal hoch und verwenden Sie dessen file_id in mehreren Anfragen. Die offizielle Files API ist kostenlos, akzeptiert Dateien bis 64 MiB und erlaubt optional eine Ablaufzeit zwischen einer Stunde und 30 Tagen. Sie reduziert wiederholte Uploads für Agenten, die dasselbe Design, Dashboard oder denselben Screenshot erneut prüfen; Bild-Tokens werden weiterhin berechnet, wenn das Modell die Datei liest.

Bildanfrage mit Chat Completions

Dieses Minimalbeispiel nutzt den direkten, OpenAI-kompatiblen Endpunkt von DeepSeek:

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Analysiere diesen Seitenscreenshot und liste Hauptbereiche, Farben und Responsive-Risiken auf."},
        {"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
      ]
    }]
  }'

Chat Completions verwendet ein Array aus Text- und Bildblöcken. Die Responses API überträgt Bilder in input_image-Blöcken, während Anthropic Messages den Endpunkt https://api.deepseek.com/anthropic verwenden kann. Kopieren Sie einen Chat-Anfragekörper nicht unverändert in Responses oder Messages, da sich deren Content-Block-Schemas unterscheiden.

Prüfen Sie für dieses Gateway zuerst, ob die exakte Modell-ID im Live-Katalog vorhanden ist, und verwenden Sie dann die dokumentierte Gateway-Basis-URL und Authentifizierung. Die offizielle Verfügbarkeit bei DeepSeek beweist nicht, dass jedes Drittanbieter-Gateway bereits Bildweiterleitung, Files API, alle Protokolle oder die Abrechnung aktiviert hat.

Praktische Workflows für multimodale Agenten

Das bereitgestellte chinesische Material beschreibt zwei Beispiele: eine Website aus einem Screenshot nachzubauen und ein allgemeines Geschäftsbriefing in eine B2B-Präsentation umzusetzen. Das sind Demonstrationen Dritter und keine unabhängigen Tests dieser Website, zeigen aber nützliche Workflow-Muster.

Vom Screenshot zu HTML

Das Modell muss Layout, Hierarchie, Farben, Typografie, Abstände und Bildplatzierung erkennen, bevor ein Coding-Tool HTML, CSS und JavaScript erzeugt. Eine reale Bewertung sollte visuelle Diffs, das Verhalten bei 375 px Breite, Tastaturfokus, Hover-Zustände und reduzierte Bewegung vergleichen, statt nur einen finalen Screenshot zu beurteilen.

Berichte, Folien und Designprüfung

Vision-Exp kann Diagramme, OCR-Text, visuellen Stil und Seitenstruktur lesen und diese Belege an Dokument-, Präsentations- oder Coding-Tools weitergeben. Die Qualität des Ergebnisses hängt weiterhin vom Agenten-Framework, den verfügbaren Tools, Quellmaterialien und dem Abnahmeprozess ab. Bildverständnis allein garantiert keine kundenfertige Präsentation.

Visuelle Abnahme durch Agenten

Ein Agent kann nach wichtigen Browser- oder Desktop-Aktionen Screenshots prüfen und den beobachteten Zustand mit dem erwarteten Ergebnis vergleichen. Der Bild-Token-Deckel senkt die Eingabekosten wiederholter visueller Kontrollen, doch Ausgaben und Tool-Aufrufe bleiben Teil des Gesamtbudgets.

Vergleichen Sie bei Aufgaben ohne Bilder zuerst den DeepSeek V4 Flash Responses API-Leitfaden. Für anspruchsvolleres reines Text-Reasoning und Coding lesen Sie außerdem den DeepSeek-V4-Pro-0813 API-Leitfaden. Eine neue experimentelle Vision-Route ist kein Grund, jede reine Textanfrage sofort umzustellen.

Bildverständnis ist keine Bilderzeugung

Die DeepSeek-Dokumentation definiert deepseek-v4-flash-vision-exp als Modell, das Text und Bilder annimmt, um Bilder zu beschreiben, Screenshot-Text zu lesen und Diagramme zu analysieren. Es wird nicht als Bildgenerierungsmodell geführt.

Enthält eine generierte Website oder Präsentation Bilder, können diese aus dem Prompt, einer Bilddatenbank, Zeichencode, einem anderen Bildgenerierungs-Tool oder aus Dateien stammen, auf die der Agent zugreifen kann. Ein visuelles Endprodukt beweist nicht, dass Vision-Exp seine Bilder erzeugt hat.

Checkliste für die Produktionsbewertung

  1. Verwenden Sie die exakte ID deepseek-v4-flash-vision-exp; erfinden Sie keinen datierten Alias.
  2. Bestätigen Sie, dass der aktuelle Anbieter- oder Gateway-Katalog die ID tatsächlich listet.
  3. Testen Sie base64, URL und Files API getrennt; die Unterstützung durch Dritte kann variieren.
  4. Nutzen Sie ein kleines Bild ohne Geheimnisse, personenbezogene Daten, private URLs oder Kundeninformationen.
  5. Protokollieren Sie Bildanzahl, Bild-, Text- und Ausgabe-Tokens, Latenz und Abrechnung.
  6. Erstellen Sie bewertete Tests für OCR, Diagramme, Layout und kleine Schrift, statt ungefähre Antworten zu akzeptieren.
  7. Begrenzen Sie Berechtigungen für Tools, Netzwerkzugriff, Dateischreiben und -löschen, Deployment und Zahlungen.
  8. Halten Sie einen Fallback auf deepseek-v4-flash, deepseek-v4-pro oder ein anderes Vision-Modell bereit, da diese Route experimentell ist.

Wichtigste Erkenntnisse

  • deepseek-v4-flash-vision-exp ist eine aktive experimentelle multimodale DeepSeek-API-Route und kein Bildgenerator.
  • Sie bietet ein Kontextfenster von 1M Tokens, bis zu 384K Ausgabe und höchstens 384 Eingabe-Tokens pro Bild.
  • Unterstützt werden Chat Completions, Anthropic Messages und Responses API; Bilder kommen per base64, URL oder Files API.
  • DeepSeek bezeichnet die Leistung multimodaler Agenten als nahe an Opus-4.8; die Tabelle zeigt in diesem Vergleich drei Siege und mehrere Niederlagen.
  • Die direkte DeepSeek-API entspricht dem Preis von V4 Flash; Preise und Protokollabdeckung von Drittanbieterrouten sind separat zu prüfen.
  • Wegen des experimentellen Status sind Abnahmetests, Budgetgrenzen und eine Fallback-Route vor dem Produktionseinsatz wichtig.

Häufig gestellte Fragen

Ist DeepSeek-V4-Flash-Vision-Exp offiziell verfügbar?

Ja. DeepSeek hat es am 21. August 2026 auf der offiziellen API-Plattform veröffentlicht. Es ist eine experimentelle Route und kein Versprechen für langfristig stabiles Verhalten.

Wie lautet die exakte Modell-ID?

Verwenden Sie deepseek-v4-flash-vision-exp. Behalten Sie die kleingeschriebene API-ID mit Bindestrichen bei, statt den großgeschriebenen Anzeigenamen zu verwenden.

Verbraucht jedes Bild immer 384 Tokens?

Nein. Die tatsächliche Anzahl richtet sich nach DeepSeeks Skalierungs- und Kachelregeln. Ein Bild nutzt höchstens 384 Tokens; mehrere Bilder werden separat gezählt.

Kann Vision-Exp Bilder erzeugen?

DeepSeek dokumentiert Bildverständnis, OCR, das Lesen von Screenshots und Diagrammanalyse, nicht native Bilderzeugung. Bilder in einer erzeugten Website oder Präsentation können aus anderen Tools oder bereitgestellten Ressourcen stammen.

Wie viel stärker ist es als V4 Flash?

Vision-Exp liegt in acht der neun direkt vergleichbaren Zeilen der DeepSeek-Tabelle höher und bei Cybergym niedriger. Anbieter-Benchmarks garantieren keine Verbesserung bei jeder Text- oder Repository-Aufgabe.

Kann ich ein Bild mit der Files API wiederverwenden?

Ja. Laden Sie es einmal hoch und referenzieren Sie die zurückgegebene file_id in späteren Anfragen. Speicherung und Upload sind kostenlos, aber bei der Verarbeitung berechnet das Modell weiterhin Bild-Tokens.

Kann ich es mit Codex verwenden?

DeepSeek bestätigt Bildunterstützung in der Responses API. Der Bildtransport durch Codex hängt jedoch von Client-Version, Content-Block-Format und Gateway ab. Testen Sie reinen Text, Bildeingaben und Bilder aus Tool-Ergebnissen getrennt.

Wie hoch ist der Vision-Exp-Multiplikator dieses Gateways?

Bei der Prüfung am 22. August 2026 war diese ID nicht im öffentlichen Preiskatalog des Gateways enthalten. Leiten Sie nicht ab, dass sie der bestehenden Route deepseek-v4-flash entspricht; prüfen Sie die aktuellen Modellpreise.

Primärquellen