Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Zurück zum Blog

DeepSeek V4 Flash mit Codex: Responses-API-Anleitung

DeepSeek V4 FlashCodexResponses APIKI-AgentenProgrammiermodell

DeepSeek veröffentlichte am 31. Juli 2026 die öffentliche Beta der offiziellen DeepSeek-V4-Flash API. Das Modell behält Architektur und Größe von V4-Flash Preview bei, erhält jedoch ein neues Post-Training mit Schwerpunkt auf Agent-Ausführung, Programmierung und Werkzeugnutzung.

Die wichtigste Änderung für Entwickler ist die native Unterstützung der OpenAI Responses API und eine gezielte Codex-Anpassung. Laut der aktuellen DeepSeek-Dokumentation ist deepseek-v4-flash das einzige DeepSeek-Modell, das sich direkt mit Codex verbinden lässt. Die Unterstützung für V4 Pro soll in einem späteren Update folgen.

Dieses Gateway stellt deepseek-v4-flash über /v1/responses für Codex und andere Agent-Clients bereit, die auf dem Responses-Protokoll basieren.

Was ist neu in DeepSeek-V4-Flash-0731?

DeepSeek zufolge verwendet DeepSeek-V4-Flash-0731 dieselbe Architektur und Modellgröße wie V4-Flash Preview. Das Release vom 31. Juli verändert das Post-Training, nicht die zugrunde liegende Struktur. Die V4-Pro-API sowie die Modelle in DeepSeeks App und Weboberfläche wurden mit diesem Release nicht aktualisiert.

Merkmal Aktuelle Information
Modell-ID im Gateway deepseek-v4-flash
Veröffentlichungsdatum 31. Juli 2026
Status Öffentliche Beta der offiziellen API
Zentrale Verbesserung Agent-Ausführung, Programmierung und Werkzeugnutzung
Responses API Nativ unterstützt
Codex Offiziell angepasst
Kontext 1M im Gateway-Katalog
Gateway-Multiplikator 2,5x
Gateway-Referenzpreis Rund 1 CNY pro 1 Million Tokens
Bildeingabe Im Gateway-Katalog derzeit als nicht unterstützt markiert

Verfügbarkeit und Preise können sich ändern. Prüfen Sie vor dem Produktionseinsatz die aktuelle Preisseite und den Modellleitfaden.

Offizielle Agent-Benchmarks

DeepSeek veröffentlichte für das offizielle V4-Flash-Release folgende Ergebnisse:

Benchmark Offizielles Ergebnis
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

Diese Ergebnisse zeigen eine Fähigkeitsrichtung, garantieren jedoch keine Erfolgsquote für Ihr Repository. DeepSeek erklärt, dass die öffentlichen Code-Agent-Evaluierungen mit einem noch unveröffentlichten minimalen DeepSeek Harness, der Aufwandsstufe max, top_p=0.95 und temperature=1.0 durchgeführt wurden. DSBench-FullStack und DSBench-Hard sind interne Testsätze.

Für die Modellauswahl sollten Sie feste Repositories, Werkzeuge, Berechtigungen und Akzeptanztests verwenden. Messen Sie die Erfolgsquote beim ersten Durchlauf, Werkzeugfehler, Gesamtdauer, Token-Verbrauch und den Nacharbeitsaufwand für Entwickler.

Responses API oder Chat Completions?

Chat Completions eignet sich für Gespräche, Schreiben, Übersetzen, Zusammenfassen und einfache Programmierfragen. Der grundlegende Ablauf besteht aus einer Nachrichtenliste und anschließend generiertem Text.

Die Responses API ist für Agenten und die Fortsetzung von Aufgaben nach Werkzeugaufrufen konzipiert. Ein Ablauf kann Modellausgaben, Funktionsaufrufe, Terminal-Aktionen, Werkzeugergebnisse und weitere Schlussfolgerungen enthalten. Codex nutzt dieses reichhaltigere Protokoll, um Code zu untersuchen, Dateien zu bearbeiten, Tests auszuführen und nach jedem Ergebnis weiterzuarbeiten.

Fähigkeit Chat Completions Responses API
Chat und Textgenerierung Gut geeignet Unterstützt
Strukturierte Werkzeugaufrufe Verfügbar Nativer Workflow
Fortgesetzte Ausführung mehrerer Werkzeuge Clientverwaltet Besser geeignet
Codex-Integration Nicht das Codex-Protokoll Erforderlich
Agent-Ereignisstruktur Einfacher Umfangreicher
Lange Engineering-Workflows Zusätzliche Orchestrierung Zentrales Einsatzgebiet

Verwenden Sie Chat Completions für einfache Generierung mit hohem Volumen. Nutzen Sie /v1/responses, wenn Codex, Terminal-Werkzeuge oder mehrstufige Engineering-Aufgaben benötigt werden.

Werkzeuggrenzen dieses Gateways

Die Kompatibilität mit dem Responses-Protokoll bedeutet nicht, dass alle von OpenAI gehosteten Werkzeuge verfügbar sind. Bei direkten Aufrufen dieses Gateways werden mcp, file_search, code_interpreter und computer_use nicht als native serverseitige Werkzeuge unterstützt.

In Codex werden das Lesen und Bearbeiten von Dateien, Shell-Befehle und MCP-Server vom Codex-Client orchestriert: Der Client führt das erlaubte Werkzeug aus, sendet das Ergebnis an das Modell zurück und setzt die Aufgabe über Responses fort. Testen Sie die vom Client bereitgestellten Funktionen einzeln und leiten Sie aus einem erfolgreichen /v1/responses-Aufruf keine Unterstützung gehosteter Werkzeuge ab.

DeepSeek V4 Flash über die Responses API aufrufen

Beginnen Sie mit einer kurzen Anfrage:

curl https://api.llm-token.cn/v1/responses \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect this repository and propose the smallest fix for the failing tests."
  }'

Prüfen Sie Base URL, API-Schlüssel, Modell-ID, HTTP-Status und Ereignisstruktur, bevor Sie Streaming, Funktionsaufrufe, lange Kontexte oder terminalintensive Aufgaben testen.

Ersetzen Sie das Modell in Codex nicht durch ein anderes DeepSeek-Modell. DeepSeek dokumentiert derzeit ausschließlich deepseek-v4-flash als Codex-kompatibel. Andere Modell-IDs können Protokollfehler verursachen, bei Werkzeugaufrufen scheitern, Aufgaben unterbrechen oder inkompatible Ereignisformate zurückgeben.

deepseek-v4-flash in Codex konfigurieren

Installieren oder aktualisieren Sie Codex CLI:

npm install -g @openai/codex@latest
codex --version

Fügen Sie in ~/.codex/config.toml einen Responses-Anbieter hinzu:

model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"

[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true

Stellen Sie den Gateway-API-Schlüssel über die sichere Authentifizierungsmethode bereit, die Ihre Codex-Version unterstützt. Übertragen Sie niemals einen echten Schlüssel an Git, fügen Sie ihn nicht in Beispielcode ein und geben Sie ihn nicht in Logs aus.

Beginnen Sie mit einer schreibgeschützten Aufgabe:

Lesen Sie die Repository-Struktur und nennen Sie den Build-Befehl, den Testbefehl und die drei Hauptmodule. Ändern Sie keine Dateien.

Erteilen Sie Schreib- und Shell-Berechtigungen erst, nachdem Modell, Werkzeugaufrufe und Kontextverarbeitung korrekt funktionieren. Der vollständige Codex-Einrichtungsleitfaden enthält weitere Installationsschritte.

Empfohlene Einsatzgebiete

  • Repository-Analyse, Fehlerdiagnose und begrenzte Korrekturen
  • Code-Iteration nach fehlgeschlagenen Tests
  • Terminal-Befehle, Codesuche und mehrstufige Engineering-Aufgaben
  • MCP-Server, Funktionsaufrufe und externe Werkzeugorchestrierung durch den Client
  • Automatisierte Tests, Code-Reviews und Migrationsplanung
  • Kostensensible Entwicklung mit Agent-Verhalten

DeepSeek V4 Flash ist mehr als eine günstige Chat-Route. Sein wesentlicher Nutzen besteht darin, Codex und Agent-Workflows mit einem niedrigeren Gateway-Multiplikator zu ermöglichen. Produktionsagenten benötigen weiterhin Berechtigungsgrenzen, Zeitlimits, Wiederholungslimits, Token-Budgets und Bedingungen für die menschliche Übernahme.

Checkliste für den Produktionseinsatz

  1. Kopieren Sie die genaue Modell-ID deepseek-v4-flash aus dem Modellleitfaden.
  2. Verwenden Sie https://api.llm-token.cn/v1 als Base URL und setzen Sie das Codex-Protokoll auf responses.
  3. Prüfen Sie Status, Ereignisstruktur, ausgewähltes Modell und Abrechnung mit einer kurzen Anfrage.
  4. Testen Sie Dateizugriff, Suche und Kontextspeicherung mit einer schreibgeschützten Repository-Aufgabe.
  5. Testen Sie Shell, Patches, Funktionsaufrufe, clientseitige MCPs und mehrstufige Werkzeugketten getrennt.
  6. Definieren Sie eindeutige Grenzen für Dateien, Datenbanken, Zahlungen, Deployments und Server.
  7. Fixieren Sie Repository, Start-Commit, Abhängigkeiten und Akzeptanzbefehle für Modellvergleiche.
  8. Erfassen Sie Erfolgsquote, P50/P95-Dauer, Fehlerarten und Kosten pro akzeptierter Aufgabe.

Häufig gestellte Fragen

Unterstützt DeepSeek V4 Flash Codex?

Ja. DeepSeek bestätigt, dass das offizielle V4-Flash-Release die Responses API nativ unterstützt und für Codex angepasst ist. deepseek-v4-flash ist derzeit das einzige DeepSeek-Modell, das als in Codex unterstützt dokumentiert ist.

Welchen Endpoint sollte Codex verwenden?

Verwenden Sie /v1/responses, nicht /v1/chat/completions. Setzen Sie für dieses Gateway die Base URL auf https://api.llm-token.cn/v1 und konfigurieren Sie wire_api = "responses".

Sind MCP, file_search, Code Interpreter und computer_use native Werkzeuge?

Nein. Direkte Aufrufe dieses Gateways stellen mcp, file_search, code_interpreter und computer_use nicht nativ bereit. In Codex sind Dateien, Shell und MCP Werkzeuge, die der Client ausführt und orchestriert; ihre Ergebnisse werden anschließend über Responses an das Modell zurückgegeben.

Kann DeepSeek V4 Pro in Codex verwendet werden?

Laut DeepSeek-Dokumentation soll V4 Pro Codex Anfang August 2026 unterstützen. Betrachten Sie es erst als kompatibel, wenn die offizielle API und die Gateway-Route die Unterstützung bestätigen.

Wie viel kostet DeepSeek V4 Flash?

Der aktuelle Gateway-Katalog nennt einen Multiplikator von 2,5x beziehungsweise ungefähr 1 CNY pro 1 Million Tokens. Maßgeblich sind die Preisseite und das Konto-Ledger.

Ist die Responses API immer besser als Chat Completions?

Nein. Chat Completions ist für Gespräche und einmalige Generierung einfacher. Responses ist vor allem für Codex, clientseitig orchestrierte Werkzeuge und fortgesetzte Engineering-Workflows sinnvoll.

Wo kann ich API-Zugriff kaufen oder Guthaben aufladen?

Neue Kunden können auf der Kaufseite beginnen. Bestehende API-Schlüssel lassen sich über die Aufladung weiterverwenden. Starten Sie mit kleinen, schreibgeschützten und umkehrbaren Tests.

Primärquellen