Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Volver al blog

DeepSeek V4 Flash con Codex: guía de la API Responses

DeepSeek V4 FlashCodexAPI Responsesagentes de IAmodelo de programación

DeepSeek lanzó la beta pública de la API oficial DeepSeek-V4-Flash el 31 de julio de 2026. El modelo mantiene la arquitectura y el tamaño de V4-Flash Preview, pero incorpora un nuevo posentrenamiento centrado en la ejecución de agentes, la programación y el uso de herramientas.

El principal cambio para desarrolladores es la compatibilidad nativa con la API Responses de OpenAI y una adaptación específica para Codex. La documentación actual de DeepSeek indica que deepseek-v4-flash es el único modelo DeepSeek que puede conectarse directamente a Codex. La compatibilidad con V4 Pro se espera en una actualización posterior.

Este gateway ofrece deepseek-v4-flash mediante /v1/responses para Codex y otros clientes de agentes basados en el protocolo Responses.

Novedades de DeepSeek-V4-Flash-0731

DeepSeek afirma que DeepSeek-V4-Flash-0731 utiliza la misma arquitectura y el mismo tamaño de modelo que V4-Flash Preview. La versión del 31 de julio cambia el posentrenamiento, no la estructura subyacente. La API V4 Pro y los modelos de la aplicación y la web de DeepSeek no se actualizaron en esta versión.

Elemento Información actual
ID del modelo en el gateway deepseek-v4-flash
Fecha de lanzamiento 31 de julio de 2026
Estado Beta pública de la API oficial
Mejora principal Ejecución de agentes, programación y uso de herramientas
API Responses Compatibilidad nativa
Codex Adaptación oficial
Contexto 1M en el catálogo del gateway
Multiplicador del gateway 2,5x
Tarifa de referencia Aproximadamente CNY 1 por 1 millón de tokens
Entrada de imágenes Actualmente figura como no compatible en el catálogo

La disponibilidad y las tarifas pueden cambiar. Revisa la página de precios y la guía de modelos antes de usar la ruta en producción.

Resultados oficiales de benchmarks de Agent

DeepSeek publicó los siguientes resultados para la versión oficial V4 Flash:

Benchmark Resultado oficial
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

Estos resultados describen una dirección de capacidad, no una tasa de éxito garantizada para tu repositorio. DeepSeek señala que las evaluaciones públicas de Code Agent utilizaron un DeepSeek Harness mínimo aún no publicado, el nivel de esfuerzo max, top_p=0.95 y temperature=1.0. DSBench-FullStack y DSBench-Hard son conjuntos de pruebas internos.

Para seleccionar un modelo, evalúalo con repositorios, herramientas, permisos y pruebas de aceptación fijos. Mide el éxito en el primer intento, los errores de herramientas, el tiempo total, el consumo de tokens y el trabajo de corrección del equipo.

API Responses frente a Chat Completions

Chat Completions es adecuada para conversación, redacción, traducción, resúmenes y preguntas sencillas de programación. Su flujo básico consiste en enviar una lista de mensajes y recibir texto generado.

La API Responses está diseñada para agentes y para continuar una tarea después de llamadas a herramientas. Una ejecución puede incluir salida del modelo, llamadas a funciones, acciones de terminal, resultados de herramientas y razonamiento posterior. Codex utiliza este protocolo más rico para inspeccionar código, editar archivos, ejecutar pruebas y continuar a partir de cada resultado.

Capacidad Chat Completions API Responses
Chat y generación de texto Buena opción Compatible
Llamadas estructuradas a herramientas Disponibles Flujo nativo
Ejecución continuada de varias herramientas Gestionada por el cliente Mejor opción
Integración con Codex No es el protocolo de Codex Necesaria
Estructura de eventos de Agent Más sencilla Más completa
Flujos largos de ingeniería Requiere orquestación adicional Caso de uso principal

Usa Chat Completions para generación sencilla y de gran volumen. Usa /v1/responses cuando el trabajo requiera Codex, herramientas de terminal o ejecución de ingeniería en varios pasos.

Límites de herramientas en este gateway

La compatibilidad con el protocolo Responses no significa que estén disponibles todas las herramientas alojadas de OpenAI. En una llamada directa a este gateway, mcp, file_search, code_interpreter y computer_use no son herramientas nativas del servidor.

En Codex, la lectura y modificación de archivos, Shell y los servidores MCP son orquestados por el cliente Codex: el cliente ejecuta la herramienta autorizada, devuelve el resultado al modelo y continúa la tarea mediante Responses. Prueba por separado las funciones que expone el cliente y no supongas que una herramienta alojada está disponible solo porque /v1/responses acepta la solicitud.

Llamar a DeepSeek V4 Flash mediante la API Responses

Empieza con una solicitud pequeña:

curl https://api.llm-token.cn/v1/responses \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect this repository and propose the smallest fix for the failing tests."
  }'

Verifica la Base URL, la clave API, el ID del modelo, el estado HTTP y la estructura de eventos antes de probar streaming, llamadas a funciones, contexto largo o tareas intensivas de terminal.

No sustituyas el modelo por otro modelo DeepSeek en Codex. DeepSeek solo documenta actualmente deepseek-v4-flash como compatible con Codex. Otros ID pueden provocar errores de protocolo, fallos en las herramientas, interrupciones de tareas o formatos de eventos incompatibles.

Configurar deepseek-v4-flash en Codex

Instala o actualiza Codex CLI:

npm install -g @openai/codex@latest
codex --version

Añade un proveedor Responses a ~/.codex/config.toml:

model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"

[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true

Proporciona la clave API del gateway mediante el método de autenticación seguro que admita tu versión de Codex. Nunca subas una clave real a Git, la pegues en código de ejemplo ni la expongas en los registros.

Empieza con una tarea de solo lectura:

Lee la estructura del repositorio e indica el comando de compilación, el comando de pruebas y los tres módulos principales. No modifiques archivos.

Concede permisos de escritura y Shell solo después de verificar el modelo, las llamadas a herramientas y el manejo del contexto. Consulta la guía de configuración de Codex para completar la instalación.

Cargas de trabajo recomendadas

  • Análisis de repositorios, diagnóstico de errores y correcciones acotadas
  • Iteración sobre el código después de pruebas fallidas
  • Comandos de terminal, búsqueda de código y tareas de ingeniería en varios pasos
  • Servidores MCP, llamadas a funciones y orquestación de herramientas externas por el cliente
  • Pruebas automatizadas, revisión de código y planificación de migraciones
  • Desarrollo sensible al coste que aun requiere comportamiento de agente

DeepSeek V4 Flash es más que una ruta de chat económica. Su valor principal consiste en incorporar Codex y flujos de agentes con un multiplicador de gateway menor. Los agentes de producción siguen necesitando límites de permisos, tiempos máximos, límites de reintentos, presupuestos de tokens y condiciones de intervención humana.

Lista de comprobación para producción

  1. Copia el ID exacto deepseek-v4-flash desde la guía de modelos.
  2. Usa https://api.llm-token.cn/v1 como Base URL y configura el protocolo de Codex como responses.
  3. Valida el estado, la estructura de eventos, el modelo seleccionado y la facturación con una solicitud corta.
  4. Usa una tarea de repositorio de solo lectura para probar el acceso a archivos, la búsqueda y la conservación del contexto.
  5. Prueba por separado Shell, parches, llamadas a funciones, MCP del cliente y ejecución de herramientas en varios pasos.
  6. Define límites explícitos para archivos, bases de datos, pagos, despliegues y servidores.
  7. Fija el repositorio, el commit inicial, las dependencias y los comandos de aceptación al comparar modelos.
  8. Registra la tasa de finalización, las duraciones P50/P95, los tipos de fallo y el coste por tarea aceptada.

Preguntas frecuentes

¿DeepSeek V4 Flash es compatible con Codex?

Sí. DeepSeek confirma que la versión oficial V4 Flash es compatible de forma nativa con la API Responses y está adaptada para Codex. deepseek-v4-flash es actualmente el único modelo DeepSeek documentado como compatible con Codex.

¿Qué endpoint debe usar Codex?

Usa /v1/responses, no /v1/chat/completions. En este gateway, configura la Base URL como https://api.llm-token.cn/v1 y establece wire_api = "responses".

¿MCP, file_search, Code Interpreter y computer_use son herramientas nativas?

No. Las llamadas directas a este gateway no ofrecen mcp, file_search, code_interpreter ni computer_use de forma nativa. En Codex, los archivos, Shell y MCP son herramientas ejecutadas y orquestadas por el cliente; sus resultados se devuelven después al modelo mediante Responses.

¿DeepSeek V4 Pro puede ejecutarse en Codex?

La documentación de DeepSeek indica que V4 Pro debería admitir Codex a principios de agosto de 2026. No lo consideres compatible hasta que la API oficial y la ruta del gateway confirmen la compatibilidad.

¿Cuánto cuesta DeepSeek V4 Flash?

El catálogo actual del gateway indica un multiplicador de 2,5x, aproximadamente CNY 1 por 1 millón de tokens. La página de precios y el registro de la cuenta son las fuentes autorizadas.

¿La API Responses siempre es mejor que Chat Completions?

No. Chat Completions es más sencilla para conversación y generación puntual. Responses resulta más útil para Codex, las herramientas orquestadas por el cliente y los flujos continuos de ingeniería.

¿Dónde puedo comprar o recargar acceso a la API?

Los nuevos clientes pueden empezar en la página de compra. Quienes ya tienen una clave API pueden usar la recarga. Empieza con pruebas pequeñas, de solo lectura y reversibles.

Fuentes principales