Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Volver al blog

DeepSeek-V4-Flash-Vision-Exp: guía API 2026

DeepSeek V4 Flash VisionAPI de DeepSeekagentes multimodalesAPI VisionAPI Responses

DeepSeek lanzó su primer modelo API multimodal oficial, deepseek-v4-flash-vision-exp, el 21 de agosto de 2026. Añade comprensión de imágenes a las capacidades de texto, razonamiento y agentes de DeepSeek V4 Flash, con una ventana de contexto de 1M de tokens, hasta 384K tokens de salida y un máximo facturable de 384 tokens de entrada por imagen al precio de la API directa de V4 Flash.

El sufijo exp significa experimental. La ruta se puede llamar desde la API oficial de DeepSeek, pero no debe presentarse como una versión estable a largo plazo. Esta guía separa las especificaciones oficiales y benchmarks del proveedor DeepSeek, los ejemplos de terceros y el estado de la ruta pública de esta pasarela. Al comprobarlo el 22 de agosto de 2026, el catálogo público de precios de esta pasarela aún no incluía el nuevo ID, por lo que el artículo no inventa un multiplicador de la pasarela.

Comprueba primero la ruta en vivo: confirma que deepseek-v4-flash-vision-exp aparece en precios de modelos antes de abrir un saldo pequeño desde la página de compra de API. La disponibilidad y los registros de facturación en el momento de la solicitud son la referencia definitiva.

Datos clave de DeepSeek-V4-Flash-Vision-Exp

Elemento Información publicada oficialmente
Fecha de lanzamiento 21 de agosto de 2026
ID exacto del modelo deepseek-v4-flash-vision-exp
Estado de la versión Modelo API multimodal experimental
Ventana de contexto 1M de tokens
Salida máxima 384K tokens
Uso de tokens de imagen Depende de las dimensiones; no más de 384 tokens por imagen
Máximo de imágenes por solicitud 600
Métodos de entrada Texto + imagen mediante base64, URL externa o file_id de Files API
Formatos de API Chat Completions, Anthropic Messages y Responses API
Llamadas a herramientas Compatibles
Modos de pensamiento Con y sin pensamiento; pensamiento por defecto
Completado FIM No compatible
Límite oficial de concurrencia 2.500

Comparativa oficial de benchmarks de DeepSeek entre V4 Flash Vision Exp, V4 Flash y Opus-4.8

Fuente: lanzamiento de DeepSeek del 21 de agosto de 2026. Son evaluaciones publicadas por el proveedor, no pruebas independientes de este sitio.

Análisis de benchmarks: acercarse a Opus-4.8 no equivale a ganar todas las pruebas

DeepSeek afirma que V4-Flash-Vision-Exp da un salto importante frente a V4 Flash en benchmarks de agentes multimodales y que el rendimiento general se aproxima a Opus-4.8. La tabla publicada respalda ese posicionamiento, pero los resultados individuales muestran una comparación mixta, no una victoria completa.

Benchmark Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83,9 82,7 85,0
NL2Repo 57,7 54,2 69,7
Cybergym 75,3 76,7 78,3
DeepSWE 59,3 54,4 58,0
Toolathlon-Verified 75,9 70,3 76,2
DSBench-Hard 63,6 59,6 71,7
AutomationBench (Public) 25,7 25,1 27,2
ApexBench (Pass@1) 36,5 26,2 39,4
Agents' Last Exam 27,3 25,2 25,7
Chartography 64,3 65,0
ZeroBench (Pass@5) 35,0 34,0

Vision-Exp supera el resultado mostrado de Opus-4.8 en DeepSWE, Agents' Last Exam y ZeroBench, pero queda por debajo en Terminal Bench, NL2Repo y DSBench-Hard. Obtiene una puntuación mayor que V4-Flash-0731 en ocho de las nueve filas directamente comparables; Cybergym es la excepción.

Las condiciones de evaluación importan. DeepSeek ejecutó las tareas públicas de Code Agent basadas en texto con DeepSeek Harness en Minimal Mode, el máximo de tokens de salida, top_p=0.95 y temperature=1.0. En ApexBench y Agents' Last Exam, el modelo V4 Flash solo de texto ignora los elementos multimodales, por lo que esas filas no son una comparación equivalente entre dos modelos con visión.

¿Cuánto cuesta realmente una imagen de 384 tokens?

DeepSeek cambia el tamaño y divide en mosaicos una imagen según sus dimensiones, y luego factura el resultado como tokens de entrada. El máximo es de 384 tokens por imagen. Varias imágenes se cuentan por separado; no existe un límite común de 384 tokens para toda la solicitud.

La API directa muestra Vision-Exp al mismo precio que V4 Flash:

API directa de DeepSeek Horario valle Horario punta
Entrada con acierto de caché / 1M tokens 0,007 $ 0,014 $
Entrada sin acierto de caché / 1M tokens 0,22 $ 0,44 $
Salida / 1M tokens 0,66 $ 1,32 $

En el supuesto conservador de que cada imagen alcance 384 tokens y se facture como entrada sin acierto de caché, 1.000 imágenes cuestan aproximadamente 0,0845 $ en horario valle o 0,169 $ en horario punta solo por la entrada de imagen. Quedan fuera el texto de entrada, la salida del modelo, los bucles de herramientas y los reintentos.

La página china de precios de DeepSeek muestra tarifas regionales de 1,50 CNY/M en horario valle y 3,00 CNY/M en horario punta para entradas sin acierto de caché. Bajo el mismo supuesto máximo por imagen, 1.000 imágenes cuestan unos 0,576 CNY o 1,152 CNY en entrada de imagen. Las tablas en USD y CNY son precios regionales oficiales, no una conversión de divisas en tiempo real.

El informe chino proporcionado comparaba estos costes con otras APIs de visión y describía una diferencia de 25x a 50x. Este artículo no repite esa proporción porque los modelos rivales, las reglas de tokens de imagen, las franjas horarias y los cargos de salida no se verificaron con una metodología uniforme.

Verifica con un registro real: si el modelo aparece en el catálogo en vivo de esta pasarela, recarga una clave existente con un importe pequeño y prueba una imagen no sensible. Registra tokens de imagen, texto y salida, latencia y cargo real.

Tres métodos de entrada de imágenes

1. Base64 en línea

Codifica un JPEG, PNG, GIF o WebP como data URL. Sirve para imágenes pequeñas o privadas y temporales. El cuerpo de la solicitud en línea está limitado a 48 MiB, con un máximo de 32 MiB para una imagen.

2. URL externa

Proporciona una imagen HTTP(S) que pueda descargarse públicamente. DeepSeek limita una imagen por URL a 32 MiB y exige que la descarga finalice en 60 segundos. Evita enlaces que dependan de cookies, acceso a redes privadas o firmas de corta duración salvo que hayas probado la ruta exacta.

3. file_id de Files API

Sube una imagen una vez y reutiliza su file_id en varias solicitudes. La Files API oficial es gratuita, acepta archivos de hasta 64 MiB y admite una caducidad opcional de entre una hora y 30 días. Reduce el ancho de banda de cargas repetidas para agentes que vuelven al mismo diseño, panel o captura; los tokens de imagen siguen facturándose cuando el modelo lee el archivo.

Solicitud de imagen con Chat Completions

Este ejemplo mínimo llama al endpoint directo de DeepSeek compatible con OpenAI:

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Analiza esta captura de página y enumera sus secciones, colores y riesgos responsive principales."},
        {"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
      ]
    }]
  }'

Chat Completions utiliza una matriz de bloques de texto e imagen. Responses API transporta imágenes en bloques input_image, mientras Anthropic Messages puede utilizar el endpoint https://api.deepseek.com/anthropic. No copies el cuerpo de una solicitud Chat sin cambios en Responses o Messages porque sus esquemas de bloques de contenido son distintos.

Para esta pasarela, confirma primero que el ID exacto esté presente en el catálogo en vivo y después usa la URL base y el método de autenticación documentados por la pasarela. La disponibilidad oficial de DeepSeek no demuestra que todas las pasarelas de terceros ya hayan activado el reenvío de imágenes, Files API, todos los protocolos o la facturación.

Flujos prácticos para agentes multimodales

El material chino proporcionado describe dos ejemplos: reconstruir un sitio web desde una captura y convertir un briefing empresarial general en una presentación B2B. Son demostraciones de terceros, no pruebas independientes de este sitio, pero ilustran patrones de trabajo útiles.

De captura de pantalla a HTML

El modelo debe identificar diseño, jerarquía, colores, tipografía, espacios y colocación de imágenes antes de que una herramienta de código genere HTML, CSS y JavaScript. Una evaluación real debería comparar diferencias visuales, comportamiento móvil a 375 px, foco de teclado, estados hover y reducción de movimiento, en lugar de juzgar solo una captura final.

Informes, diapositivas y revisión de diseño

Vision-Exp puede leer gráficos, texto por OCR, estilo visual y estructura de página, y pasar esas pruebas a herramientas de documentos, presentaciones o código. La calidad del resultado sigue dependiendo del framework del agente, las herramientas disponibles, los recursos fuente y el proceso de aceptación. Comprender imágenes por sí solo no garantiza una presentación lista para el cliente.

Aceptación visual para agentes

Un agente puede inspeccionar capturas después de acciones importantes en el navegador o escritorio y comparar el estado observado con el resultado esperado. El límite de tokens por imagen reduce el coste de entrada de comprobaciones visuales repetidas, pero la salida y las llamadas a herramientas siguen formando parte del presupuesto total.

Para cargas sin imágenes, compara primero la guía de DeepSeek V4 Flash Responses API. Para razonamiento y programación más difíciles solo con texto, consulta también la guía de la API DeepSeek-V4-Pro-0813. Una nueva ruta experimental con visión no es motivo para mover de inmediato todas las solicitudes de texto.

Comprender imágenes no es generar imágenes

La documentación de DeepSeek define deepseek-v4-flash-vision-exp como un modelo que acepta texto e imágenes para describir imágenes, leer texto de capturas y analizar gráficos. No figura como modelo de generación de imágenes.

Si un sitio web o una presentación generados incluyen imágenes, estas pueden proceder del prompt, un banco de recursos, código de dibujo, otra herramienta de generación o archivos disponibles para el agente. Un producto final visual no demuestra que Vision-Exp haya generado sus imágenes.

Lista de evaluación para producción

  1. Usa el ID exacto deepseek-v4-flash-vision-exp; no inventes un alias con fecha.
  2. Confirma que el catálogo actual del proveedor o la pasarela incluya realmente el ID.
  3. Prueba base64, URL y Files API por separado; el soporte de terceros puede variar.
  4. Usa una imagen pequeña sin secretos, datos personales, URLs privadas ni información de clientes.
  5. Registra número de imágenes, tokens de imagen, texto y salida, latencia y facturación.
  6. Crea pruebas puntuadas de OCR, gráficos, diseño y texto pequeño en vez de aceptar respuestas aproximadas.
  7. Limita los permisos de herramientas, red, escritura y eliminación de archivos, despliegue y pagos.
  8. Mantén una alternativa con deepseek-v4-flash, deepseek-v4-pro u otro modelo de visión porque esta ruta es experimental.

Conclusiones clave

  • deepseek-v4-flash-vision-exp es una ruta API multimodal experimental activa de DeepSeek, no un generador de imágenes.
  • Tiene una ventana de contexto de 1M de tokens, hasta 384K de salida y no más de 384 tokens de entrada por imagen.
  • Admite Chat Completions, Anthropic Messages y Responses API, con imágenes por base64, URL o Files API.
  • DeepSeek afirma que el rendimiento de agentes multimodales se acerca a Opus-4.8; su tabla muestra tres victorias y varias derrotas en esa comparación.
  • La API directa de DeepSeek coincide con el precio de V4 Flash; los precios y protocolos de rutas de terceros deben comprobarse por separado.
  • La etiqueta experimental hace importantes las pruebas de aceptación, los presupuestos y una ruta alternativa antes de producción.

Preguntas frecuentes

¿DeepSeek-V4-Flash-Vision-Exp está disponible oficialmente?

Sí. DeepSeek lo lanzó en su plataforma API oficial el 21 de agosto de 2026. Es una ruta experimental, no una promesa de comportamiento estable a largo plazo.

¿Cuál es el ID exacto del modelo?

Usa deepseek-v4-flash-vision-exp. Conserva el ID de API en minúsculas y con guiones en lugar del nombre de presentación con mayúsculas.

¿Todas las imágenes usan siempre 384 tokens?

No. La cantidad real sigue las reglas de cambio de tamaño y mosaico de DeepSeek. Una imagen usa como máximo 384 tokens y varias imágenes se cuentan por separado.

¿Vision-Exp puede generar imágenes?

DeepSeek documenta comprensión de imágenes, OCR, lectura de capturas y análisis de gráficos, no generación nativa de imágenes. Las imágenes de un sitio o presentación pueden venir de otras herramientas o recursos proporcionados.

¿Cuánto mejora frente a V4 Flash?

Vision-Exp queda por encima en ocho de las nueve filas directamente comparables de la tabla de DeepSeek y por debajo en Cybergym. Los benchmarks del proveedor no garantizan que mejore cada tarea de texto o repositorio.

¿Puedo reutilizar una imagen con Files API?

Sí. Súbela una vez y referencia el file_id devuelto en solicitudes posteriores. El almacenamiento y la carga son gratuitos, pero el modelo sigue facturando tokens de imagen cuando la procesa.

¿Puedo usarlo con Codex?

DeepSeek confirma el soporte de imágenes en Responses API, pero su transporte mediante Codex depende de la versión del cliente, el formato de bloques de contenido y la pasarela. Prueba por separado texto, entrada de imágenes e imágenes producidas por herramientas.

¿Cuál es el multiplicador Vision-Exp de esta pasarela?

Al comprobarlo el 22 de agosto de 2026, el catálogo público de precios de esta pasarela no incluía el ID. No supongas que coincide con la ruta deepseek-v4-flash existente; consulta precios de modelos en vivo.

Fuentes principales