Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Retour au blog

DeepSeek V4 Flash avec Codex : guide de l'API Responses

DeepSeek V4 FlashCodexAPI Responsesagents IAmodèle de programmation

DeepSeek a lancé la bêta publique de l'API officielle DeepSeek-V4-Flash le 31 juillet 2026. Le modèle conserve l'architecture et la taille de V4-Flash Preview, mais bénéficie d'un nouvel entraînement final axé sur l'exécution agentique, la programmation et l'utilisation d'outils.

Le principal changement pour les développeurs est la prise en charge native de l'API OpenAI Responses et une adaptation dédiée à Codex. La documentation actuelle de DeepSeek indique que deepseek-v4-flash est le seul modèle DeepSeek pouvant se connecter directement à Codex. La prise en charge de V4 Pro est attendue dans une mise à jour ultérieure.

Cette passerelle expose deepseek-v4-flash via /v1/responses pour Codex et les autres clients agentiques fondés sur le protocole Responses.

Nouveautés de DeepSeek-V4-Flash-0731

Selon DeepSeek, DeepSeek-V4-Flash-0731 reprend l'architecture et la taille de V4-Flash Preview. La version du 31 juillet modifie le post-entraînement, pas la structure sous-jacente. L'API V4 Pro ainsi que les modèles de l'application et du site DeepSeek n'ont pas été mis à niveau lors de cette version.

Élément Informations actuelles
ID du modèle sur la passerelle deepseek-v4-flash
Date de sortie 31 juillet 2026
Statut Bêta publique de l'API officielle
Mise à niveau principale Exécution agentique, programmation et utilisation d'outils
API Responses Prise en charge native
Codex Adaptation officielle
Contexte 1M dans le catalogue de la passerelle
Multiplicateur de la passerelle 2,5x
Tarif de référence Environ 1 CNY par million de tokens
Entrée image Actuellement indiquée comme non prise en charge dans le catalogue

La disponibilité et les tarifs peuvent évoluer. Vérifiez la page des tarifs et le guide des modèles avant toute utilisation en production.

Résultats officiels des benchmarks Agent

DeepSeek a publié les résultats suivants pour la version officielle V4 Flash :

Benchmark Résultat officiel
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

Ces résultats indiquent une orientation de capacité, pas un taux de réussite garanti sur votre dépôt. DeepSeek précise que ses évaluations publiques Code Agent ont utilisé un DeepSeek Harness minimal non encore publié, le niveau d'effort max, top_p=0.95 et temperature=1.0. DSBench-FullStack et DSBench-Hard sont des jeux de tests internes.

Pour un choix de modèle, testez des dépôts, outils, autorisations et critères d'acceptation figés. Mesurez la réussite au premier passage, les erreurs d'outils, la durée totale, les tokens consommés et le temps de reprise par un ingénieur.

API Responses ou Chat Completions

Chat Completions convient aux conversations, à la rédaction, à la traduction, au résumé et aux questions simples de programmation. Son flux de base consiste à envoyer une liste de messages puis à recevoir du texte.

L'API Responses est conçue pour les agents et la poursuite d'une tâche après des appels d'outils. Une exécution peut inclure une sortie du modèle, des appels de fonctions, des actions terminal, des résultats d'outils et un raisonnement ultérieur. Codex s'appuie sur ce protocole plus riche pour examiner le code, modifier des fichiers, exécuter des tests puis continuer à partir de chaque résultat.

Capacité Chat Completions API Responses
Conversation et génération de texte Adapté Pris en charge
Appels d'outils structurés Disponibles Flux natif
Exécution continue de plusieurs outils Gérée par le client Mieux adaptée
Intégration Codex N'est pas le protocole de Codex Requise
Structure des événements Agent Plus simple Plus riche
Longs workflows d'ingénierie Orchestration supplémentaire Cas d'usage central

Utilisez Chat Completions pour une génération simple et volumineuse. Utilisez /v1/responses lorsque la charge de travail nécessite Codex, des outils de terminal ou une exécution d'ingénierie en plusieurs étapes.

Limites des outils sur cette passerelle

La compatibilité avec le protocole Responses ne signifie pas que tous les outils hébergés d'OpenAI sont disponibles. Lors d'un appel direct à cette passerelle, mcp, file_search, code_interpreter et computer_use ne sont pas pris en charge comme outils natifs côté serveur.

Dans Codex, la lecture et la modification de fichiers, le Shell et les serveurs MCP sont orchestrés par le client Codex : le client exécute l'outil autorisé, renvoie son résultat au modèle, puis poursuit la tâche via Responses. Testez séparément les fonctions exposées par votre client et ne supposez pas qu'un outil hébergé est disponible parce que le format /v1/responses est accepté.

Appeler DeepSeek V4 Flash avec l'API Responses

Commencez par une requête courte :

curl https://api.llm-token.cn/v1/responses \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect this repository and propose the smallest fix for the failing tests."
  }'

Vérifiez la Base URL, la clé API, l'ID du modèle, le statut HTTP et la structure des événements avant de tester le streaming, les appels de fonctions, un contexte long ou des tâches intensives en terminal.

Ne remplacez pas le modèle par un autre modèle DeepSeek dans Codex. DeepSeek ne documente actuellement que deepseek-v4-flash comme compatible avec Codex. Les autres ID peuvent produire des erreurs de protocole, échouer lors des appels d'outils, interrompre les tâches ou renvoyer des événements incompatibles.

Configurer deepseek-v4-flash dans Codex

Installez ou mettez à jour Codex CLI :

npm install -g @openai/codex@latest
codex --version

Ajoutez un fournisseur Responses dans ~/.codex/config.toml :

model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"

[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true

Fournissez la clé API de la passerelle avec la méthode d'authentification sécurisée prise en charge par votre version de Codex. Ne validez jamais une vraie clé dans Git, ne la collez pas dans un exemple et ne l'exposez pas dans les journaux.

Commencez par une tâche en lecture seule :

Lisez la structure du dépôt et indiquez la commande de build, la commande de test et les trois modules principaux. Ne modifiez aucun fichier.

N'accordez les droits d'écriture et d'exécution Shell qu'après avoir validé le modèle, les appels d'outils et la gestion du contexte. Consultez le guide de configuration Codex pour les étapes d'installation complètes.

Charges de travail recommandées

  • Analyse d'un dépôt, diagnostic de bugs et correctifs limités
  • Itération sur le code après l'échec de tests
  • Commandes terminal, recherche de code et tâches d'ingénierie en plusieurs étapes
  • Serveurs MCP, appels de fonctions et orchestration d'outils externes par le client
  • Tests automatisés, revue de code et planification de migrations
  • Développement sensible au coût nécessitant néanmoins un comportement agentique

DeepSeek V4 Flash n'est plus seulement une route de chat peu coûteuse. Son intérêt principal est d'intégrer Codex et les workflows agentiques avec un multiplicateur de passerelle réduit. Les agents de production ont toujours besoin de limites d'autorisation, de délais, de plafonds de tentatives, de budgets de tokens et de conditions de reprise humaine.

Liste de contrôle avant la production

  1. Copiez l'ID exact deepseek-v4-flash depuis le guide des modèles.
  2. Utilisez https://api.llm-token.cn/v1 comme Base URL et définissez le protocole Codex sur responses.
  3. Validez le statut, la structure des événements, le modèle sélectionné et la facturation avec une requête courte.
  4. Utilisez une tâche en lecture seule pour tester l'accès aux fichiers, la recherche et la conservation du contexte.
  5. Testez séparément le Shell, les patchs, les appels de fonctions, les MCP du client et l'exécution multi-étapes.
  6. Définissez des limites explicites pour les fichiers, bases de données, paiements, déploiements et serveurs.
  7. Figez le dépôt, le commit initial, les dépendances et les commandes d'acceptation pour comparer les modèles.
  8. Enregistrez le taux de réussite, les durées P50/P95, les types d'échec et le coût par tâche acceptée.

Questions fréquentes

DeepSeek V4 Flash prend-il en charge Codex ?

Oui. DeepSeek confirme que la version officielle V4 Flash prend nativement en charge l'API Responses et est adaptée à Codex. deepseek-v4-flash est actuellement le seul modèle DeepSeek documenté comme pris en charge dans Codex.

Quel endpoint utiliser avec Codex ?

Utilisez /v1/responses, pas /v1/chat/completions. Sur cette passerelle, définissez la Base URL sur https://api.llm-token.cn/v1 et configurez wire_api = "responses".

Les outils MCP, file_search, Code Interpreter et computer_use sont-ils natifs ?

Non. L'appel direct à cette passerelle ne fournit pas nativement mcp, file_search, code_interpreter ni computer_use. Dans Codex, les fichiers, le Shell et les MCP sont des outils exécutés et orchestrés par le client, puis leurs résultats sont renvoyés au modèle via Responses.

DeepSeek V4 Pro fonctionne-t-il dans Codex ?

La documentation DeepSeek indique que V4 Pro devrait prendre en charge Codex au début du mois d'août 2026. Ne le considérez pas comme compatible tant que l'API officielle et la route de la passerelle ne le confirment pas.

Quel est le prix de DeepSeek V4 Flash ?

Le catalogue actuel de la passerelle indique un multiplicateur de 2,5x, soit environ 1 CNY par million de tokens. La page des tarifs et le registre du compte font foi.

L'API Responses est-elle toujours préférable à Chat Completions ?

Non. Chat Completions est plus simple pour la conversation et la génération ponctuelle. Responses est surtout utile pour Codex, les outils orchestrés par le client et les workflows d'ingénierie continus.

Où acheter ou recharger l'accès à l'API ?

Les nouveaux clients peuvent commencer sur la page d'achat. Les détenteurs d'une clé API peuvent utiliser la recharge. Commencez par des tests modestes, en lecture seule et réversibles.

Sources principales