Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Voltar ao blog

DeepSeek V4 Flash no Codex: guia de configuração da Responses API

DeepSeek V4 FlashCodexResponses APIagentes de IAmodelo de programação

A DeepSeek lançou o beta público oficial da API do DeepSeek-V4-Flash em 31 de julho de 2026. O modelo mantém a arquitetura e o tamanho do V4-Flash Preview, mas recebeu um novo pós-treinamento voltado à execução de agentes, programação e uso de ferramentas.

A principal mudança para desenvolvedores é o suporte nativo à OpenAI Responses API e uma integração específica com o Codex. A documentação atual da DeepSeek informa que deepseek-v4-flash é o único modelo DeepSeek que pode se conectar diretamente ao Codex. O suporte ao V4 Pro é esperado em uma atualização posterior.

Este gateway disponibiliza deepseek-v4-flash por meio de /v1/responses para o Codex e outros clientes de agentes baseados no protocolo Responses.

O que mudou no DeepSeek-V4-Flash-0731

Segundo a DeepSeek, o DeepSeek-V4-Flash-0731 usa a mesma arquitetura e o mesmo tamanho de modelo do V4-Flash Preview. O lançamento de 31 de julho altera o pós-treinamento, não a estrutura subjacente. A API do V4 Pro e os modelos do aplicativo e da versão web da DeepSeek não foram atualizados neste lançamento.

Item Informação atual
ID do modelo no gateway deepseek-v4-flash
Data de lançamento 31 de julho de 2026
Status Beta público oficial da API
Principal melhoria Execução de agentes, programação e uso de ferramentas
Responses API Suporte nativo
Codex Adaptação oficial
Contexto 1M no catálogo do gateway
Multiplicador no gateway 2,5x
Tarifa de referência no gateway Cerca de CNY 1 por 1M de tokens
Entrada de imagem Atualmente marcada como não suportada no catálogo do gateway

A disponibilidade e as tarifas podem mudar. Consulte a página de preços e o guia de modelos antes de usar em produção.

Resultados oficiais em benchmarks de agentes

A DeepSeek publicou os seguintes resultados para a versão oficial do V4 Flash:

Benchmark Resultado oficial
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

Esses resultados indicam a direção das capacidades, não uma taxa de sucesso garantida no seu repositório. A DeepSeek afirma que as avaliações públicas de Code Agent usaram um DeepSeek Harness mínimo ainda não lançado, o nível de esforço max, top_p=0.95 e temperature=1.0. DSBench-FullStack e DSBench-Hard são conjuntos de testes internos.

Para uma decisão de compra, avalie o modelo em repositórios, ferramentas, permissões e testes de aceitação fixados. Meça conclusão na primeira tentativa, falhas de ferramentas, tempo total, consumo de tokens e retrabalho de engenharia.

Responses API vs. Chat Completions

Chat Completions é adequado para conversas, redação, tradução, resumos e perguntas simples de programação. Seu fluxo básico é uma lista de mensagens seguida pelo texto gerado.

A Responses API foi projetada para agentes e execução contínua de ferramentas. Uma tarefa pode conter saída do modelo, chamadas de função, ações no terminal, resultados de ferramentas e continuação do raciocínio. O Codex usa esse protocolo mais rico para inspecionar código, editar arquivos, executar testes e continuar depois de cada resultado.

Capacidade Chat Completions Responses API
Conversa e geração de texto Boa opção Suportado
Chamadas estruturadas de ferramentas Disponível Fluxo nativo
Execução contínua com várias ferramentas Gerenciada pelo cliente Mais adequada
Integração com o Codex Não é o protocolo do Codex Obrigatória
Estrutura de eventos de agentes Mais simples Mais rica
Fluxos longos de engenharia Exigem orquestração extra Caso de uso central

Use Chat Completions para geração simples e em grande volume. Use /v1/responses quando a carga de trabalho exigir Codex, terminal, chamadas de função ou execução de engenharia em várias etapas.

Limite importante das ferramentas

O endpoint direto /v1/responses deste gateway não oferece de forma nativa as ferramentas hospedadas MCP, file_search, code_interpreter ou computer_use. Leitura e edição de arquivos, comandos Shell e servidores MCP são orquestrados pelo cliente Codex, com as permissões e ferramentas disponíveis no ambiente local.

Em outras palavras, compatibilidade com o protocolo Responses não significa que toda ferramenta hospedada pela OpenAI esteja disponível no endpoint. Ao integrar sem o Codex, implemente suas próprias funções e o ciclo de execução das ferramentas no cliente.

Como chamar o DeepSeek V4 Flash pela Responses API

Comece com uma solicitação pequena:

curl https://api.llm-token.cn/v1/responses \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect this repository and propose the smallest fix for the failing tests."
  }'

Verifique a Base URL, a chave de API, o ID do modelo, o status HTTP e a estrutura de eventos da resposta antes de testar streaming, chamadas de função, contexto longo ou tarefas intensivas no terminal.

Não substitua o modelo por outro DeepSeek no Codex. Atualmente, a DeepSeek documenta apenas deepseek-v4-flash como compatível com o Codex. Outros IDs podem causar erros de protocolo, falhas em chamadas de ferramentas, interrupções ou eventos incompatíveis.

Como configurar deepseek-v4-flash no Codex

Instale ou atualize o Codex CLI:

npm install -g @openai/codex@latest
codex --version

Adicione um provedor Responses ao arquivo ~/.codex/config.toml:

model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"

[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true

Forneça a chave do gateway pelo método seguro de autenticação aceito pela sua versão do Codex. Nunca envie uma chave real ao Git, cole-a em exemplos ou exponha-a em logs.

Comece com uma tarefa somente de leitura:

Leia a estrutura do repositório e liste o comando de build, o comando de testes e os três módulos principais. Não modifique arquivos.

Conceda permissões de escrita e Shell apenas depois de confirmar o modelo, as chamadas de ferramentas e o tratamento do contexto. Consulte o guia completo de configuração do Codex.

Cargas de trabalho recomendadas

  • Análise de repositórios, diagnóstico de bugs e correções delimitadas
  • Iteração no código após falhas em testes
  • Comandos de terminal, busca no código e tarefas de engenharia em várias etapas
  • Servidores MCP, chamadas de função e orquestração de serviços externos pelo cliente Codex
  • Testes automatizados, revisão de código e planejamento de migrações
  • Desenvolvimento sensível a custos que ainda exige comportamento de agente

O DeepSeek V4 Flash é mais do que uma rota econômica para chat. Seu principal valor é levar um multiplicador menor do gateway aos fluxos de Codex e agentes. Agentes em produção ainda precisam de limites de permissão, timeouts, limites de repetição, orçamentos de tokens e condições de intervenção humana.

Checklist de validação para produção

  1. Copie o ID exato deepseek-v4-flash do guia de modelos.
  2. Use https://api.llm-token.cn/v1 como Base URL e defina o protocolo do Codex como responses.
  3. Valide status, estrutura de eventos, modelo selecionado e cobrança com uma solicitação curta.
  4. Use uma tarefa de leitura no repositório para testar acesso a arquivos, busca e retenção de contexto.
  5. Teste separadamente Shell, patches, chamadas de função, MCP e execução em várias rodadas pelo cliente Codex.
  6. Defina limites explícitos para arquivos, bancos de dados, pagamentos, implantações e servidores.
  7. Fixe repositório, commit inicial, dependências e comandos de aceitação ao comparar modelos.
  8. Registre taxa de conclusão, duração P50/P95, tipos de falha e custo por tarefa aceita.

Perguntas frequentes

O DeepSeek V4 Flash é compatível com o Codex?

Sim. A DeepSeek confirma que a versão oficial do V4 Flash oferece suporte nativo à Responses API e foi adaptada ao Codex. Atualmente, deepseek-v4-flash é documentado como o único modelo DeepSeek aceito no Codex.

Qual endpoint deve ser usado no Codex?

Use /v1/responses, não /v1/chat/completions. Neste gateway, defina a Base URL como https://api.llm-token.cn/v1 e configure wire_api = "responses".

A Responses API inclui MCP, busca de arquivos e execução de código?

Não diretamente neste gateway. MCP, file_search, code_interpreter e computer_use não são ferramentas nativas do endpoint. No Codex, arquivos, Shell e MCP são executados e coordenados pelo cliente conforme as permissões locais.

O DeepSeek V4 Pro funciona no Codex?

A documentação da DeepSeek informa que o suporte do V4 Pro ao Codex é esperado para o início de agosto de 2026. Não o considere compatível até que a API oficial e a rota do gateway confirmem o suporte.

Quanto custa o DeepSeek V4 Flash?

O catálogo atual do gateway lista multiplicador de 2,5x, aproximadamente CNY 1 por 1M de tokens. A página de preços e o extrato da conta são as referências definitivas.

A Responses API é sempre melhor que Chat Completions?

Não. Chat Completions é mais simples para conversas e geração pontual. Responses é mais útil para Codex, chamadas de ferramentas e fluxos contínuos de engenharia.

Onde posso comprar ou recarregar o acesso à API?

Novos clientes podem começar na página de compra. Quem já possui uma chave pode usar a recarga. Comece com testes pequenos, somente de leitura e reversíveis.

Fontes primárias