DeepSeek-V4-Flash-Vision-Exp : guide API 2026
DeepSeek a lancé son premier modèle API multimodal officiel, deepseek-v4-flash-vision-exp, le 21 août 2026. Il ajoute la compréhension d’images aux capacités de texte, de raisonnement et d’agent de DeepSeek V4 Flash, avec une fenêtre de contexte de 1M de tokens, jusqu’à 384K tokens en sortie et un maximum facturé de 384 tokens d’entrée par image, au tarif direct de l’API V4 Flash.
Le suffixe exp signifie expérimental. La route est accessible sur l’API officielle de DeepSeek, mais elle ne doit pas être présentée comme une version stable à long terme. Ce guide distingue les spécifications officielles et benchmarks du fournisseur DeepSeek, les exemples de tiers et l’état de la route publique de cette passerelle. Au 22 août 2026, le catalogue tarifaire public de cette passerelle ne listait pas encore le nouvel ID : cet article ne suppose donc aucun multiplicateur tarifaire.
Vérifiez d’abord la route en direct : confirmez que
deepseek-v4-flash-vision-expapparaît dans les tarifs des modèles avant d’ouvrir un petit solde depuis la page d’achat API. La disponibilité et les relevés de facturation au moment de la requête font foi.
Chiffres clés de DeepSeek-V4-Flash-Vision-Exp
| Élément | Information publiée officiellement |
|---|---|
| Date de sortie | 21 août 2026 |
| ID exact du modèle | deepseek-v4-flash-vision-exp |
| Statut | Modèle API multimodal expérimental |
| Fenêtre de contexte | 1M de tokens |
| Sortie maximale | 384K tokens |
| Consommation d’une image | Selon les dimensions ; au plus 384 tokens par image |
| Nombre maximal d’images par requête | 600 |
| Méthodes d’entrée | Texte + image via base64, URL externe ou file_id de la Files API |
| Formats d’API | Chat Completions, Anthropic Messages et Responses API |
| Appels d’outils | Pris en charge |
| Modes de réflexion | Avec et sans réflexion ; réflexion par défaut |
| Complétion FIM | Non prise en charge |
| Limite officielle de concurrence | 2 500 |

Source : publication DeepSeek du 21 août 2026. Il s’agit d’évaluations publiées par le fournisseur, et non de tests indépendants réalisés par ce site.
Analyse des benchmarks : proche d’Opus-4.8 ne signifie pas gagner tous les tests
DeepSeek affirme que V4-Flash-Vision-Exp progresse fortement par rapport à V4 Flash sur les benchmarks d’agents multimodaux et que ses performances globales se rapprochent d’Opus-4.8. Le tableau publié étaye ce positionnement, mais les résultats détaillés montrent une comparaison contrastée plutôt qu’une victoire systématique.
| Benchmark | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83,9 | 82,7 | 85,0 |
| NL2Repo | 57,7 | 54,2 | 69,7 |
| Cybergym | 75,3 | 76,7 | 78,3 |
| DeepSWE | 59,3 | 54,4 | 58,0 |
| Toolathlon-Verified | 75,9 | 70,3 | 76,2 |
| DSBench-Hard | 63,6 | 59,6 | 71,7 |
| AutomationBench (Public) | 25,7 | 25,1 | 27,2 |
| ApexBench (Pass@1) | 36,5 | 26,2 | 39,4 |
| Agents' Last Exam | 27,3 | 25,2 | 25,7 |
| Chartography | 64,3 | — | 65,0 |
| ZeroBench (Pass@5) | 35,0 | — | 34,0 |
Vision-Exp dépasse le résultat Opus-4.8 présenté sur DeepSWE, Agents' Last Exam et ZeroBench, mais reste derrière sur Terminal Bench, NL2Repo et DSBench-Hard. Il surpasse V4-Flash-0731 sur huit des neuf lignes directement comparables, Cybergym étant l’exception.
Les conditions d’évaluation comptent. DeepSeek a exécuté les tâches publiques textuelles de Code Agent avec DeepSeek Harness en mode Minimal, le nombre maximal de tokens de sortie, top_p=0.95 et temperature=1.0. Sur ApexBench et Agents' Last Exam, le modèle V4 Flash purement textuel ignore les éléments multimodaux : ces lignes ne constituent donc pas une comparaison équivalente entre deux modèles vision.
Quel est le coût réel d’une image de 384 tokens ?
DeepSeek redimensionne et découpe l’image selon ses dimensions, puis facture le résultat en tokens d’entrée. Le maximum est de 384 tokens par image. Plusieurs images sont comptées séparément : il n’existe pas de plafond partagé de 384 tokens pour toute la requête.
L’API directe affiche Vision-Exp au même tarif que V4 Flash :
| API DeepSeek directe | Heures creuses | Heures pleines |
|---|---|---|
| Entrée avec cache / 1M tokens | 0,007 $ | 0,014 $ |
| Entrée sans cache / 1M tokens | 0,22 $ | 0,44 $ |
| Sortie / 1M tokens | 0,66 $ | 1,32 $ |
Dans l’hypothèse prudente où chaque image atteint 384 tokens et est facturée comme entrée sans cache, 1 000 images coûtent environ 0,0845 $ en heures creuses ou 0,169 $ en heures pleines pour la seule entrée image. Ce calcul exclut le texte d’entrée, la sortie du modèle, les boucles d’outils et les nouvelles tentatives.
La page tarifaire chinoise de DeepSeek indique des prix régionaux de 1,50 CNY/M en heures creuses et 3,00 CNY/M en heures pleines pour l’entrée sans cache. Avec la même hypothèse d’image maximale, 1 000 images coûtent environ 0,576 CNY ou 1,152 CNY en entrée image. Les tableaux USD et CNY correspondent à des tarifs régionaux officiels, pas à une conversion de change en temps réel.
Le rapport chinois fourni comparait ces coûts à ceux d’autres API vision et avançait un écart de 25x à 50x. Cet article ne reprend pas ce ratio, car les modèles concurrents, les règles de tokens image, les créneaux tarifaires et les coûts de sortie n’ont pas été vérifiés selon une méthode homogène.
Vérifiez avec un relevé réel : si le modèle apparaît dans le catalogue en direct de cette passerelle, rechargez une clé existante d’un petit montant et testez une image non sensible. Notez les tokens image, texte et sortie, la latence et le montant réellement facturé.
Trois méthodes d’entrée d’image
1. Base64 en ligne
Encodez un JPEG, PNG, GIF ou WebP sous forme de data URL. Cette méthode convient aux images petites ou privées et temporaires. Le corps de requête en ligne est limité à 48 Mio, avec un maximum de 32 Mio pour une image.
2. URL externe
Fournissez une image HTTP(S) téléchargeable publiquement. DeepSeek limite une image par URL à 32 Mio et impose un téléchargement en moins de 60 secondes. Évitez les liens dépendant de cookies, d’un réseau privé ou de signatures éphémères sans avoir testé précisément la route.
3. file_id de la Files API
Téléversez une image une fois et réutilisez son file_id dans plusieurs requêtes. La Files API officielle est gratuite, accepte des fichiers jusqu’à 64 Mio et permet une expiration facultative comprise entre une heure et 30 jours. Elle réduit les transferts répétés pour les agents qui revisitent le même design, tableau de bord ou écran ; les tokens image restent facturés lorsque le modèle lit le fichier.
Requête image avec Chat Completions
Cet exemple minimal appelle le point de terminaison direct de DeepSeek compatible OpenAI :
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Analyse cette capture de page et liste ses sections, couleurs et risques responsive principaux."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
Chat Completions utilise un tableau de blocs texte et image. Responses API transmet les images dans des blocs input_image, tandis qu’Anthropic Messages peut utiliser le point de terminaison https://api.deepseek.com/anthropic. Ne copiez pas tel quel un corps Chat dans Responses ou Messages : leurs schémas de blocs de contenu diffèrent.
Pour cette passerelle, vérifiez d’abord que l’ID exact figure dans le catalogue en direct, puis utilisez l’URL de base et la méthode d’authentification documentées par la passerelle. La disponibilité officielle chez DeepSeek ne prouve pas que chaque passerelle tierce ait déjà activé le transfert d’images, la Files API, tous les protocoles ou la facturation.
Workflows pratiques pour agents multimodaux
Le contenu chinois fourni décrit deux exemples : reconstruire un site depuis une capture d’écran et transformer un brief commercial général en présentation B2B. Ce sont des démonstrations tierces, pas des tests indépendants de ce site, mais elles illustrent des workflows utiles.
De la capture d’écran au HTML
Le modèle doit repérer la mise en page, la hiérarchie, les couleurs, la typographie, les espacements et le placement des images avant qu’un outil de code ne produise HTML, CSS et JavaScript. Une évaluation réelle doit comparer les différences visuelles, le comportement mobile à 375 px, le focus clavier, les états de survol et la réduction des animations, plutôt que de juger une seule capture finale.
Rapports, diapositives et revue de design
Vision-Exp peut lire graphiques, texte OCR, style visuel et structure de page, puis transmettre ces éléments à des outils de document, de présentation ou de code. La qualité du livrable dépend toujours du framework d’agent, des outils disponibles, des ressources sources et du processus d’acceptation. La seule compréhension d’images ne garantit pas une présentation prête à envoyer à un client.
Validation visuelle pour agents
Un agent peut examiner des captures après des actions importantes dans un navigateur ou sur le bureau et comparer l’état observé au résultat attendu. Le plafond de tokens image réduit le coût d’entrée des contrôles visuels répétés, mais les sorties et appels d’outils restent inclus dans le budget total.
Pour les charges sans image, comparez d’abord le guide DeepSeek V4 Flash Responses API. Pour le raisonnement et le code textuels plus exigeants, consultez aussi le guide API DeepSeek-V4-Pro-0813. Une nouvelle route vision expérimentale ne justifie pas de déplacer immédiatement toutes les requêtes textuelles.
Compréhension d’image ne signifie pas génération d’image
La documentation DeepSeek définit deepseek-v4-flash-vision-exp comme un modèle qui accepte du texte et des images pour décrire des visuels, lire le texte des captures et analyser des graphiques. Il n’est pas répertorié comme modèle de génération d’images.
Si un site ou une présentation générés contiennent des images, celles-ci peuvent provenir du prompt, d’une banque d’images, de code de dessin, d’un autre outil de génération ou de fichiers accessibles à l’agent. Un résultat final visuel ne prouve pas que Vision-Exp en a généré les images.
Liste de contrôle pour l’évaluation en production
- Utilisez l’ID exact
deepseek-v4-flash-vision-exp; n’inventez pas d’alias daté. - Confirmez que le catalogue actuel du fournisseur ou de la passerelle liste réellement cet ID.
- Testez séparément base64, URL et Files API ; la prise en charge tierce peut varier.
- Utilisez une petite image sans secret, donnée personnelle, URL privée ni information client.
- Journalisez le nombre d’images, les tokens image, texte et sortie, la latence et la facturation.
- Créez des tests notés pour l’OCR, les graphiques, la mise en page et les petits caractères au lieu d’accepter des réponses approximatives.
- Encadrez les autorisations d’outils, d’accès réseau, d’écriture et de suppression de fichiers, de déploiement et de paiement.
- Conservez un repli vers
deepseek-v4-flash,deepseek-v4-proou un autre modèle vision, car cette route est expérimentale.
À retenir
deepseek-v4-flash-vision-expest une route API multimodale expérimentale active chez DeepSeek, pas un générateur d’images.- Elle offre un contexte de 1M de tokens, jusqu’à 384K tokens en sortie et au plus 384 tokens d’entrée par image.
- Elle prend en charge Chat Completions, Anthropic Messages et Responses API, avec des images en base64, par URL ou via la Files API.
- DeepSeek affirme que les performances des agents multimodaux sont proches d’Opus-4.8 ; son tableau montre trois victoires et plusieurs résultats inférieurs dans cette comparaison.
- L’API directe DeepSeek applique le prix de V4 Flash ; les tarifs et protocoles des routes tierces doivent être vérifiés séparément.
- Le statut expérimental rend essentiels les tests d’acceptation, le contrôle du budget et une route de repli avant la production.
Questions fréquentes
DeepSeek-V4-Flash-Vision-Exp est-il officiellement disponible ?
Oui. DeepSeek l’a lancé sur sa plateforme API officielle le 21 août 2026. Il s’agit d’une route expérimentale, pas d’une garantie de comportement stable à long terme.
Quel est l’ID exact du modèle ?
Utilisez deepseek-v4-flash-vision-exp. Conservez l’ID API en minuscules avec des traits d’union plutôt que le nom d’affichage capitalisé.
Chaque image utilise-t-elle toujours 384 tokens ?
Non. Le nombre réel dépend des règles de redimensionnement et de découpage de DeepSeek. Une image utilise au plus 384 tokens et les images multiples sont comptées séparément.
Vision-Exp peut-il générer des images ?
DeepSeek documente la compréhension d’images, l’OCR, la lecture de captures et l’analyse de graphiques, pas la génération native d’images. Les images d’un site ou d’une présentation peuvent provenir d’autres outils ou ressources fournies.
Est-il beaucoup plus puissant que V4 Flash ?
Vision-Exp est supérieur sur huit des neuf lignes directement comparables du tableau DeepSeek et inférieur sur Cybergym. Les benchmarks du fournisseur ne garantissent pas une amélioration pour chaque tâche de texte ou de dépôt.
Puis-je réutiliser une image avec la Files API ?
Oui. Téléversez-la une fois et référencez le file_id renvoyé dans les requêtes suivantes. Le stockage et le téléversement sont gratuits, mais le modèle facture toujours les tokens image lorsqu’il la traite.
Puis-je l’utiliser avec Codex ?
DeepSeek confirme les images dans Responses API, mais leur transport via Codex dépend de la version du client, du format des blocs de contenu et de la passerelle. Testez séparément le texte, l’entrée image et les images issues d’outils.
Quel est le multiplicateur Vision-Exp de cette passerelle ?
Au 22 août 2026, le catalogue tarifaire public de cette passerelle ne listait pas cet ID. Ne supposez pas qu’il correspond à la route deepseek-v4-flash existante ; consultez les tarifs des modèles en direct.
Sources principales
- DeepSeek : sortie de V4 Flash Vision Exp : date, ID, positionnement multimodal, benchmarks fournisseur, formats d’API et Harness 0.1.1
- Guide Vision DeepSeek : méthodes d’image, calcul des tokens, formats, tailles et limites de requête
- Modèles et tarifs DeepSeek : contexte 1M, sortie 384K, tarification directe par créneau, concurrence de 2 500 et fonctionnalités
- Files API DeepSeek : téléversements,
file_id, limites de taille et expiration - Annonce officielle DeepSeek sur X : annonce de lancement originale