Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Retour au blog

DeepSeek-V4-Flash-Vision-Exp : guide API 2026

DeepSeek V4 Flash VisionAPI DeepSeekagents multimodauxAPI VisionAPI Responses

DeepSeek a lancé son premier modèle API multimodal officiel, deepseek-v4-flash-vision-exp, le 21 août 2026. Il ajoute la compréhension d’images aux capacités de texte, de raisonnement et d’agent de DeepSeek V4 Flash, avec une fenêtre de contexte de 1M de tokens, jusqu’à 384K tokens en sortie et un maximum facturé de 384 tokens d’entrée par image, au tarif direct de l’API V4 Flash.

Le suffixe exp signifie expérimental. La route est accessible sur l’API officielle de DeepSeek, mais elle ne doit pas être présentée comme une version stable à long terme. Ce guide distingue les spécifications officielles et benchmarks du fournisseur DeepSeek, les exemples de tiers et l’état de la route publique de cette passerelle. Au 22 août 2026, le catalogue tarifaire public de cette passerelle ne listait pas encore le nouvel ID : cet article ne suppose donc aucun multiplicateur tarifaire.

Vérifiez d’abord la route en direct : confirmez que deepseek-v4-flash-vision-exp apparaît dans les tarifs des modèles avant d’ouvrir un petit solde depuis la page d’achat API. La disponibilité et les relevés de facturation au moment de la requête font foi.

Chiffres clés de DeepSeek-V4-Flash-Vision-Exp

Élément Information publiée officiellement
Date de sortie 21 août 2026
ID exact du modèle deepseek-v4-flash-vision-exp
Statut Modèle API multimodal expérimental
Fenêtre de contexte 1M de tokens
Sortie maximale 384K tokens
Consommation d’une image Selon les dimensions ; au plus 384 tokens par image
Nombre maximal d’images par requête 600
Méthodes d’entrée Texte + image via base64, URL externe ou file_id de la Files API
Formats d’API Chat Completions, Anthropic Messages et Responses API
Appels d’outils Pris en charge
Modes de réflexion Avec et sans réflexion ; réflexion par défaut
Complétion FIM Non prise en charge
Limite officielle de concurrence 2 500

Comparaison officielle des benchmarks DeepSeek entre V4 Flash Vision Exp, V4 Flash et Opus-4.8

Source : publication DeepSeek du 21 août 2026. Il s’agit d’évaluations publiées par le fournisseur, et non de tests indépendants réalisés par ce site.

Analyse des benchmarks : proche d’Opus-4.8 ne signifie pas gagner tous les tests

DeepSeek affirme que V4-Flash-Vision-Exp progresse fortement par rapport à V4 Flash sur les benchmarks d’agents multimodaux et que ses performances globales se rapprochent d’Opus-4.8. Le tableau publié étaye ce positionnement, mais les résultats détaillés montrent une comparaison contrastée plutôt qu’une victoire systématique.

Benchmark Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83,9 82,7 85,0
NL2Repo 57,7 54,2 69,7
Cybergym 75,3 76,7 78,3
DeepSWE 59,3 54,4 58,0
Toolathlon-Verified 75,9 70,3 76,2
DSBench-Hard 63,6 59,6 71,7
AutomationBench (Public) 25,7 25,1 27,2
ApexBench (Pass@1) 36,5 26,2 39,4
Agents' Last Exam 27,3 25,2 25,7
Chartography 64,3 65,0
ZeroBench (Pass@5) 35,0 34,0

Vision-Exp dépasse le résultat Opus-4.8 présenté sur DeepSWE, Agents' Last Exam et ZeroBench, mais reste derrière sur Terminal Bench, NL2Repo et DSBench-Hard. Il surpasse V4-Flash-0731 sur huit des neuf lignes directement comparables, Cybergym étant l’exception.

Les conditions d’évaluation comptent. DeepSeek a exécuté les tâches publiques textuelles de Code Agent avec DeepSeek Harness en mode Minimal, le nombre maximal de tokens de sortie, top_p=0.95 et temperature=1.0. Sur ApexBench et Agents' Last Exam, le modèle V4 Flash purement textuel ignore les éléments multimodaux : ces lignes ne constituent donc pas une comparaison équivalente entre deux modèles vision.

Quel est le coût réel d’une image de 384 tokens ?

DeepSeek redimensionne et découpe l’image selon ses dimensions, puis facture le résultat en tokens d’entrée. Le maximum est de 384 tokens par image. Plusieurs images sont comptées séparément : il n’existe pas de plafond partagé de 384 tokens pour toute la requête.

L’API directe affiche Vision-Exp au même tarif que V4 Flash :

API DeepSeek directe Heures creuses Heures pleines
Entrée avec cache / 1M tokens 0,007 $ 0,014 $
Entrée sans cache / 1M tokens 0,22 $ 0,44 $
Sortie / 1M tokens 0,66 $ 1,32 $

Dans l’hypothèse prudente où chaque image atteint 384 tokens et est facturée comme entrée sans cache, 1 000 images coûtent environ 0,0845 $ en heures creuses ou 0,169 $ en heures pleines pour la seule entrée image. Ce calcul exclut le texte d’entrée, la sortie du modèle, les boucles d’outils et les nouvelles tentatives.

La page tarifaire chinoise de DeepSeek indique des prix régionaux de 1,50 CNY/M en heures creuses et 3,00 CNY/M en heures pleines pour l’entrée sans cache. Avec la même hypothèse d’image maximale, 1 000 images coûtent environ 0,576 CNY ou 1,152 CNY en entrée image. Les tableaux USD et CNY correspondent à des tarifs régionaux officiels, pas à une conversion de change en temps réel.

Le rapport chinois fourni comparait ces coûts à ceux d’autres API vision et avançait un écart de 25x à 50x. Cet article ne reprend pas ce ratio, car les modèles concurrents, les règles de tokens image, les créneaux tarifaires et les coûts de sortie n’ont pas été vérifiés selon une méthode homogène.

Vérifiez avec un relevé réel : si le modèle apparaît dans le catalogue en direct de cette passerelle, rechargez une clé existante d’un petit montant et testez une image non sensible. Notez les tokens image, texte et sortie, la latence et le montant réellement facturé.

Trois méthodes d’entrée d’image

1. Base64 en ligne

Encodez un JPEG, PNG, GIF ou WebP sous forme de data URL. Cette méthode convient aux images petites ou privées et temporaires. Le corps de requête en ligne est limité à 48 Mio, avec un maximum de 32 Mio pour une image.

2. URL externe

Fournissez une image HTTP(S) téléchargeable publiquement. DeepSeek limite une image par URL à 32 Mio et impose un téléchargement en moins de 60 secondes. Évitez les liens dépendant de cookies, d’un réseau privé ou de signatures éphémères sans avoir testé précisément la route.

3. file_id de la Files API

Téléversez une image une fois et réutilisez son file_id dans plusieurs requêtes. La Files API officielle est gratuite, accepte des fichiers jusqu’à 64 Mio et permet une expiration facultative comprise entre une heure et 30 jours. Elle réduit les transferts répétés pour les agents qui revisitent le même design, tableau de bord ou écran ; les tokens image restent facturés lorsque le modèle lit le fichier.

Requête image avec Chat Completions

Cet exemple minimal appelle le point de terminaison direct de DeepSeek compatible OpenAI :

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Analyse cette capture de page et liste ses sections, couleurs et risques responsive principaux."},
        {"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
      ]
    }]
  }'

Chat Completions utilise un tableau de blocs texte et image. Responses API transmet les images dans des blocs input_image, tandis qu’Anthropic Messages peut utiliser le point de terminaison https://api.deepseek.com/anthropic. Ne copiez pas tel quel un corps Chat dans Responses ou Messages : leurs schémas de blocs de contenu diffèrent.

Pour cette passerelle, vérifiez d’abord que l’ID exact figure dans le catalogue en direct, puis utilisez l’URL de base et la méthode d’authentification documentées par la passerelle. La disponibilité officielle chez DeepSeek ne prouve pas que chaque passerelle tierce ait déjà activé le transfert d’images, la Files API, tous les protocoles ou la facturation.

Workflows pratiques pour agents multimodaux

Le contenu chinois fourni décrit deux exemples : reconstruire un site depuis une capture d’écran et transformer un brief commercial général en présentation B2B. Ce sont des démonstrations tierces, pas des tests indépendants de ce site, mais elles illustrent des workflows utiles.

De la capture d’écran au HTML

Le modèle doit repérer la mise en page, la hiérarchie, les couleurs, la typographie, les espacements et le placement des images avant qu’un outil de code ne produise HTML, CSS et JavaScript. Une évaluation réelle doit comparer les différences visuelles, le comportement mobile à 375 px, le focus clavier, les états de survol et la réduction des animations, plutôt que de juger une seule capture finale.

Rapports, diapositives et revue de design

Vision-Exp peut lire graphiques, texte OCR, style visuel et structure de page, puis transmettre ces éléments à des outils de document, de présentation ou de code. La qualité du livrable dépend toujours du framework d’agent, des outils disponibles, des ressources sources et du processus d’acceptation. La seule compréhension d’images ne garantit pas une présentation prête à envoyer à un client.

Validation visuelle pour agents

Un agent peut examiner des captures après des actions importantes dans un navigateur ou sur le bureau et comparer l’état observé au résultat attendu. Le plafond de tokens image réduit le coût d’entrée des contrôles visuels répétés, mais les sorties et appels d’outils restent inclus dans le budget total.

Pour les charges sans image, comparez d’abord le guide DeepSeek V4 Flash Responses API. Pour le raisonnement et le code textuels plus exigeants, consultez aussi le guide API DeepSeek-V4-Pro-0813. Une nouvelle route vision expérimentale ne justifie pas de déplacer immédiatement toutes les requêtes textuelles.

Compréhension d’image ne signifie pas génération d’image

La documentation DeepSeek définit deepseek-v4-flash-vision-exp comme un modèle qui accepte du texte et des images pour décrire des visuels, lire le texte des captures et analyser des graphiques. Il n’est pas répertorié comme modèle de génération d’images.

Si un site ou une présentation générés contiennent des images, celles-ci peuvent provenir du prompt, d’une banque d’images, de code de dessin, d’un autre outil de génération ou de fichiers accessibles à l’agent. Un résultat final visuel ne prouve pas que Vision-Exp en a généré les images.

Liste de contrôle pour l’évaluation en production

  1. Utilisez l’ID exact deepseek-v4-flash-vision-exp ; n’inventez pas d’alias daté.
  2. Confirmez que le catalogue actuel du fournisseur ou de la passerelle liste réellement cet ID.
  3. Testez séparément base64, URL et Files API ; la prise en charge tierce peut varier.
  4. Utilisez une petite image sans secret, donnée personnelle, URL privée ni information client.
  5. Journalisez le nombre d’images, les tokens image, texte et sortie, la latence et la facturation.
  6. Créez des tests notés pour l’OCR, les graphiques, la mise en page et les petits caractères au lieu d’accepter des réponses approximatives.
  7. Encadrez les autorisations d’outils, d’accès réseau, d’écriture et de suppression de fichiers, de déploiement et de paiement.
  8. Conservez un repli vers deepseek-v4-flash, deepseek-v4-pro ou un autre modèle vision, car cette route est expérimentale.

À retenir

  • deepseek-v4-flash-vision-exp est une route API multimodale expérimentale active chez DeepSeek, pas un générateur d’images.
  • Elle offre un contexte de 1M de tokens, jusqu’à 384K tokens en sortie et au plus 384 tokens d’entrée par image.
  • Elle prend en charge Chat Completions, Anthropic Messages et Responses API, avec des images en base64, par URL ou via la Files API.
  • DeepSeek affirme que les performances des agents multimodaux sont proches d’Opus-4.8 ; son tableau montre trois victoires et plusieurs résultats inférieurs dans cette comparaison.
  • L’API directe DeepSeek applique le prix de V4 Flash ; les tarifs et protocoles des routes tierces doivent être vérifiés séparément.
  • Le statut expérimental rend essentiels les tests d’acceptation, le contrôle du budget et une route de repli avant la production.

Questions fréquentes

DeepSeek-V4-Flash-Vision-Exp est-il officiellement disponible ?

Oui. DeepSeek l’a lancé sur sa plateforme API officielle le 21 août 2026. Il s’agit d’une route expérimentale, pas d’une garantie de comportement stable à long terme.

Quel est l’ID exact du modèle ?

Utilisez deepseek-v4-flash-vision-exp. Conservez l’ID API en minuscules avec des traits d’union plutôt que le nom d’affichage capitalisé.

Chaque image utilise-t-elle toujours 384 tokens ?

Non. Le nombre réel dépend des règles de redimensionnement et de découpage de DeepSeek. Une image utilise au plus 384 tokens et les images multiples sont comptées séparément.

Vision-Exp peut-il générer des images ?

DeepSeek documente la compréhension d’images, l’OCR, la lecture de captures et l’analyse de graphiques, pas la génération native d’images. Les images d’un site ou d’une présentation peuvent provenir d’autres outils ou ressources fournies.

Est-il beaucoup plus puissant que V4 Flash ?

Vision-Exp est supérieur sur huit des neuf lignes directement comparables du tableau DeepSeek et inférieur sur Cybergym. Les benchmarks du fournisseur ne garantissent pas une amélioration pour chaque tâche de texte ou de dépôt.

Puis-je réutiliser une image avec la Files API ?

Oui. Téléversez-la une fois et référencez le file_id renvoyé dans les requêtes suivantes. Le stockage et le téléversement sont gratuits, mais le modèle facture toujours les tokens image lorsqu’il la traite.

Puis-je l’utiliser avec Codex ?

DeepSeek confirme les images dans Responses API, mais leur transport via Codex dépend de la version du client, du format des blocs de contenu et de la passerelle. Testez séparément le texte, l’entrée image et les images issues d’outils.

Quel est le multiplicateur Vision-Exp de cette passerelle ?

Au 22 août 2026, le catalogue tarifaire public de cette passerelle ne listait pas cet ID. Ne supposez pas qu’il correspond à la route deepseek-v4-flash existante ; consultez les tarifs des modèles en direct.

Sources principales