DeepSeek V4 Flash no Codex: guia de configuração da Responses API
A DeepSeek lançou o beta público oficial da API do DeepSeek-V4-Flash em 31 de julho de 2026. O modelo mantém a arquitetura e o tamanho do V4-Flash Preview, mas recebeu um novo pós-treinamento voltado à execução de agentes, programação e uso de ferramentas.
A principal mudança para desenvolvedores é o suporte nativo à OpenAI Responses API e uma integração específica com o Codex. A documentação atual da DeepSeek informa que deepseek-v4-flash é o único modelo DeepSeek que pode se conectar diretamente ao Codex. O suporte ao V4 Pro é esperado em uma atualização posterior.
Este gateway disponibiliza deepseek-v4-flash por meio de /v1/responses para o Codex e outros clientes de agentes baseados no protocolo Responses.
O que mudou no DeepSeek-V4-Flash-0731
Segundo a DeepSeek, o DeepSeek-V4-Flash-0731 usa a mesma arquitetura e o mesmo tamanho de modelo do V4-Flash Preview. O lançamento de 31 de julho altera o pós-treinamento, não a estrutura subjacente. A API do V4 Pro e os modelos do aplicativo e da versão web da DeepSeek não foram atualizados neste lançamento.
| Item | Informação atual |
|---|---|
| ID do modelo no gateway | deepseek-v4-flash |
| Data de lançamento | 31 de julho de 2026 |
| Status | Beta público oficial da API |
| Principal melhoria | Execução de agentes, programação e uso de ferramentas |
| Responses API | Suporte nativo |
| Codex | Adaptação oficial |
| Contexto | 1M no catálogo do gateway |
| Multiplicador no gateway | 2,5x |
| Tarifa de referência no gateway | Cerca de CNY 1 por 1M de tokens |
| Entrada de imagem | Atualmente marcada como não suportada no catálogo do gateway |
A disponibilidade e as tarifas podem mudar. Consulte a página de preços e o guia de modelos antes de usar em produção.
Resultados oficiais em benchmarks de agentes
A DeepSeek publicou os seguintes resultados para a versão oficial do V4 Flash:
| Benchmark | Resultado oficial |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
Esses resultados indicam a direção das capacidades, não uma taxa de sucesso garantida no seu repositório. A DeepSeek afirma que as avaliações públicas de Code Agent usaram um DeepSeek Harness mínimo ainda não lançado, o nível de esforço max, top_p=0.95 e temperature=1.0. DSBench-FullStack e DSBench-Hard são conjuntos de testes internos.
Para uma decisão de compra, avalie o modelo em repositórios, ferramentas, permissões e testes de aceitação fixados. Meça conclusão na primeira tentativa, falhas de ferramentas, tempo total, consumo de tokens e retrabalho de engenharia.
Responses API vs. Chat Completions
Chat Completions é adequado para conversas, redação, tradução, resumos e perguntas simples de programação. Seu fluxo básico é uma lista de mensagens seguida pelo texto gerado.
A Responses API foi projetada para agentes e execução contínua de ferramentas. Uma tarefa pode conter saída do modelo, chamadas de função, ações no terminal, resultados de ferramentas e continuação do raciocínio. O Codex usa esse protocolo mais rico para inspecionar código, editar arquivos, executar testes e continuar depois de cada resultado.
| Capacidade | Chat Completions | Responses API |
|---|---|---|
| Conversa e geração de texto | Boa opção | Suportado |
| Chamadas estruturadas de ferramentas | Disponível | Fluxo nativo |
| Execução contínua com várias ferramentas | Gerenciada pelo cliente | Mais adequada |
| Integração com o Codex | Não é o protocolo do Codex | Obrigatória |
| Estrutura de eventos de agentes | Mais simples | Mais rica |
| Fluxos longos de engenharia | Exigem orquestração extra | Caso de uso central |
Use Chat Completions para geração simples e em grande volume. Use /v1/responses quando a carga de trabalho exigir Codex, terminal, chamadas de função ou execução de engenharia em várias etapas.
Limite importante das ferramentas
O endpoint direto /v1/responses deste gateway não oferece de forma nativa as ferramentas hospedadas MCP, file_search, code_interpreter ou computer_use. Leitura e edição de arquivos, comandos Shell e servidores MCP são orquestrados pelo cliente Codex, com as permissões e ferramentas disponíveis no ambiente local.
Em outras palavras, compatibilidade com o protocolo Responses não significa que toda ferramenta hospedada pela OpenAI esteja disponível no endpoint. Ao integrar sem o Codex, implemente suas próprias funções e o ciclo de execução das ferramentas no cliente.
Como chamar o DeepSeek V4 Flash pela Responses API
Comece com uma solicitação pequena:
curl https://api.llm-token.cn/v1/responses \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"input": "Inspect this repository and propose the smallest fix for the failing tests."
}'
Verifique a Base URL, a chave de API, o ID do modelo, o status HTTP e a estrutura de eventos da resposta antes de testar streaming, chamadas de função, contexto longo ou tarefas intensivas no terminal.
Não substitua o modelo por outro DeepSeek no Codex. Atualmente, a DeepSeek documenta apenas deepseek-v4-flash como compatível com o Codex. Outros IDs podem causar erros de protocolo, falhas em chamadas de ferramentas, interrupções ou eventos incompatíveis.
Como configurar deepseek-v4-flash no Codex
Instale ou atualize o Codex CLI:
npm install -g @openai/codex@latest
codex --version
Adicione um provedor Responses ao arquivo ~/.codex/config.toml:
model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"
[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true
Forneça a chave do gateway pelo método seguro de autenticação aceito pela sua versão do Codex. Nunca envie uma chave real ao Git, cole-a em exemplos ou exponha-a em logs.
Comece com uma tarefa somente de leitura:
Leia a estrutura do repositório e liste o comando de build, o comando de testes e os três módulos principais. Não modifique arquivos.
Conceda permissões de escrita e Shell apenas depois de confirmar o modelo, as chamadas de ferramentas e o tratamento do contexto. Consulte o guia completo de configuração do Codex.
Cargas de trabalho recomendadas
- Análise de repositórios, diagnóstico de bugs e correções delimitadas
- Iteração no código após falhas em testes
- Comandos de terminal, busca no código e tarefas de engenharia em várias etapas
- Servidores MCP, chamadas de função e orquestração de serviços externos pelo cliente Codex
- Testes automatizados, revisão de código e planejamento de migrações
- Desenvolvimento sensível a custos que ainda exige comportamento de agente
O DeepSeek V4 Flash é mais do que uma rota econômica para chat. Seu principal valor é levar um multiplicador menor do gateway aos fluxos de Codex e agentes. Agentes em produção ainda precisam de limites de permissão, timeouts, limites de repetição, orçamentos de tokens e condições de intervenção humana.
Checklist de validação para produção
- Copie o ID exato
deepseek-v4-flashdo guia de modelos. - Use
https://api.llm-token.cn/v1como Base URL e defina o protocolo do Codex comoresponses. - Valide status, estrutura de eventos, modelo selecionado e cobrança com uma solicitação curta.
- Use uma tarefa de leitura no repositório para testar acesso a arquivos, busca e retenção de contexto.
- Teste separadamente Shell, patches, chamadas de função, MCP e execução em várias rodadas pelo cliente Codex.
- Defina limites explícitos para arquivos, bancos de dados, pagamentos, implantações e servidores.
- Fixe repositório, commit inicial, dependências e comandos de aceitação ao comparar modelos.
- Registre taxa de conclusão, duração P50/P95, tipos de falha e custo por tarefa aceita.
Perguntas frequentes
O DeepSeek V4 Flash é compatível com o Codex?
Sim. A DeepSeek confirma que a versão oficial do V4 Flash oferece suporte nativo à Responses API e foi adaptada ao Codex. Atualmente, deepseek-v4-flash é documentado como o único modelo DeepSeek aceito no Codex.
Qual endpoint deve ser usado no Codex?
Use /v1/responses, não /v1/chat/completions. Neste gateway, defina a Base URL como https://api.llm-token.cn/v1 e configure wire_api = "responses".
A Responses API inclui MCP, busca de arquivos e execução de código?
Não diretamente neste gateway. MCP, file_search, code_interpreter e computer_use não são ferramentas nativas do endpoint. No Codex, arquivos, Shell e MCP são executados e coordenados pelo cliente conforme as permissões locais.
O DeepSeek V4 Pro funciona no Codex?
A documentação da DeepSeek informa que o suporte do V4 Pro ao Codex é esperado para o início de agosto de 2026. Não o considere compatível até que a API oficial e a rota do gateway confirmem o suporte.
Quanto custa o DeepSeek V4 Flash?
O catálogo atual do gateway lista multiplicador de 2,5x, aproximadamente CNY 1 por 1M de tokens. A página de preços e o extrato da conta são as referências definitivas.
A Responses API é sempre melhor que Chat Completions?
Não. Chat Completions é mais simples para conversas e geração pontual. Responses é mais útil para Codex, chamadas de ferramentas e fluxos contínuos de engenharia.
Onde posso comprar ou recarregar o acesso à API?
Novos clientes podem começar na página de compra. Quem já possui uma chave pode usar a recarga. Comece com testes pequenos, somente de leitura e reversíveis.
Fontes primárias
- Registro de alterações da DeepSeek de 31 de julho de 2026: status do lançamento, benchmarks de agentes, condições de avaliação, Responses API e suporte ao Codex
- Guia de integração da DeepSeek com o Codex: modelo compatível e limites da integração
- Guia da Responses API da DeepSeek: protocolo e orientações de solicitação
- Guia de modelos do gateway: ID da rota, multiplicador, contexto e rótulos de capacidade atuais