DeepSeek-V4-Flash-Vision-Exp: Guia da API 2026
A DeepSeek lançou seu primeiro modelo oficial de API multimodal, deepseek-v4-flash-vision-exp, em 21 de agosto de 2026. Ele acrescenta compreensão de imagens aos recursos de texto, raciocínio e agentes do DeepSeek V4 Flash, com janela de contexto de 1M de tokens, até 384K tokens de saída e cobrança máxima de 384 tokens de entrada por imagem, pelo preço da API direta do V4 Flash.
O sufixo exp significa experimental. A rota já pode ser chamada na API oficial da DeepSeek, mas não deve ser apresentada como uma versão estável de longo prazo. Este guia separa especificações oficiais e benchmarks do fornecedor DeepSeek, exemplos de terceiros e o estado da rota pública deste gateway. Na verificação de 22 de agosto de 2026, o catálogo público de preços deste gateway ainda não listava o novo ID. Por isso, o artigo não presume um multiplicador do gateway.
Confira primeiro a rota ao vivo: confirme que
deepseek-v4-flash-vision-expaparece em preços dos modelos antes de abrir um saldo pequeno na página de compra da API. A disponibilidade e os registros de cobrança no momento da solicitação são a fonte definitiva.
Dados principais do DeepSeek-V4-Flash-Vision-Exp
| Item | Informação publicada oficialmente |
|---|---|
| Data de lançamento | 21 de agosto de 2026 |
| ID exato do modelo | deepseek-v4-flash-vision-exp |
| Status da versão | Modelo experimental de API multimodal |
| Janela de contexto | 1M de tokens |
| Saída máxima | 384K tokens |
| Uso de tokens de imagem | Depende das dimensões; no máximo 384 tokens por imagem |
| Máximo de imagens por solicitação | 600 |
| Métodos de entrada | Texto + imagem por base64, URL externa ou file_id da Files API |
| Formatos de API | Chat Completions, Anthropic Messages e Responses API |
| Chamadas de ferramentas | Compatíveis |
| Modos de pensamento | Com e sem pensamento; pensamento é o padrão |
| Completação FIM | Não compatível |
| Limite oficial de concorrência | 2.500 |

Fonte: lançamento da DeepSeek em 21 de agosto de 2026. Estas são avaliações publicadas pelo fornecedor, não testes independentes deste site.
Análise dos benchmarks: perto do Opus-4.8 não significa vencer todos os testes
A DeepSeek afirma que o V4-Flash-Vision-Exp dá um grande salto sobre o V4 Flash em benchmarks de agentes multimodais e aproxima o desempenho geral do Opus-4.8. A tabela publicada sustenta esse posicionamento, mas os resultados individuais mostram uma comparação mista, não uma vitória completa.
| Benchmark | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83,9 | 82,7 | 85,0 |
| NL2Repo | 57,7 | 54,2 | 69,7 |
| Cybergym | 75,3 | 76,7 | 78,3 |
| DeepSWE | 59,3 | 54,4 | 58,0 |
| Toolathlon-Verified | 75,9 | 70,3 | 76,2 |
| DSBench-Hard | 63,6 | 59,6 | 71,7 |
| AutomationBench (Public) | 25,7 | 25,1 | 27,2 |
| ApexBench (Pass@1) | 36,5 | 26,2 | 39,4 |
| Agents' Last Exam | 27,3 | 25,2 | 25,7 |
| Chartography | 64,3 | — | 65,0 |
| ZeroBench (Pass@5) | 35,0 | — | 34,0 |
O Vision-Exp supera o resultado apresentado do Opus-4.8 em DeepSWE, Agents' Last Exam e ZeroBench, mas fica atrás em Terminal Bench, NL2Repo e DSBench-Hard. Ele pontua acima do V4-Flash-0731 em oito das nove linhas diretamente comparáveis, com Cybergym como exceção.
As condições de avaliação importam. A DeepSeek executou as tarefas públicas textuais de Code Agent usando DeepSeek Harness em Minimal Mode, o máximo de tokens de saída, top_p=0.95 e temperature=1.0. No ApexBench e Agents' Last Exam, o V4 Flash somente de texto ignora elementos multimodais; portanto, essas linhas não representam uma comparação equivalente entre dois modelos de visão.
Quanto custa de fato uma imagem de 384 tokens?
A DeepSeek redimensiona e divide a imagem em blocos conforme suas dimensões e depois cobra o resultado como tokens de entrada. O máximo é de 384 tokens por imagem. Várias imagens são contabilizadas separadamente; não há um teto compartilhado de 384 tokens para toda a solicitação.
A API direta lista o Vision-Exp pelo mesmo preço do V4 Flash:
| API direta da DeepSeek | Fora do pico | Horário de pico |
|---|---|---|
| Entrada com cache / 1M tokens | US$ 0,007 | US$ 0,014 |
| Entrada sem cache / 1M tokens | US$ 0,22 | US$ 0,44 |
| Saída / 1M tokens | US$ 0,66 | US$ 1,32 |
No cenário conservador em que cada imagem atinge 384 tokens e é cobrada como entrada sem cache, 1.000 imagens custam cerca de US$ 0,0845 fora do pico ou US$ 0,169 no horário de pico apenas pela entrada da imagem. O cálculo exclui texto de entrada, saída do modelo, ciclos de ferramentas e novas tentativas.
A página chinesa de preços da DeepSeek informa valores regionais de CNY 1,50/M fora do pico e CNY 3,00/M no pico para entrada sem cache. Com a mesma hipótese de imagem máxima, 1.000 imagens custam aproximadamente CNY 0,576 ou CNY 1,152 em entrada de imagem. As tabelas em USD e CNY são preços regionais oficiais, não uma conversão cambial em tempo real.
O relatório chinês fornecido comparava esses custos com outras APIs de visão e citava uma diferença de 25x a 50x. Este artigo não repete essa proporção porque modelos concorrentes, regras de tokens de imagem, faixas horárias e cobranças de saída não foram verificados com uma metodologia uniforme.
Valide com um extrato real: se o modelo aparecer no catálogo ao vivo deste gateway, recarregue uma chave existente com um valor pequeno e teste uma imagem não sensível. Registre tokens de imagem, texto e saída, latência e cobrança efetiva.
Três métodos de entrada de imagem
1. Base64 embutido
Codifique um JPEG, PNG, GIF ou WebP como data URL. Isso funciona para imagens pequenas ou privadas e temporárias. O corpo da solicitação embutida tem limite de 48 MiB, com máximo de 32 MiB para uma imagem.
2. URL externa
Forneça uma imagem HTTP(S) publicamente acessível para download. A DeepSeek limita cada imagem por URL a 32 MiB e exige que o download termine em 60 segundos. Evite links que dependam de cookies, acesso a rede privada ou assinaturas de curta duração, a menos que a rota exata tenha sido testada.
3. file_id da Files API
Faça upload de uma imagem uma vez e reutilize seu file_id em várias solicitações. A Files API oficial é gratuita, aceita arquivos de até 64 MiB e permite validade opcional entre uma hora e 30 dias. Ela reduz uploads repetidos para agentes que revisitam o mesmo design, painel ou screenshot; os tokens de imagem continuam sendo cobrados quando o modelo lê o arquivo.
Solicitação de imagem com Chat Completions
Este exemplo mínimo chama o endpoint direto da DeepSeek compatível com OpenAI:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Analise este screenshot de página e liste suas principais seções, cores e riscos responsivos."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
Chat Completions usa uma matriz de blocos de texto e imagem. A Responses API transporta imagens em blocos input_image, enquanto Anthropic Messages pode usar o endpoint https://api.deepseek.com/anthropic. Não copie sem alterações o corpo de uma solicitação Chat para Responses ou Messages, pois os esquemas de blocos de conteúdo são diferentes.
Para este gateway, confirme primeiro se o ID exato está no catálogo ao vivo e então use a URL base e o método de autenticação documentados pelo gateway. A disponibilidade oficial na DeepSeek não comprova que todos os gateways de terceiros já habilitaram encaminhamento de imagens, Files API, todos os protocolos ou cobrança.
Fluxos práticos para agentes multimodais
O material chinês fornecido descreve dois exemplos: reconstruir um site a partir de um screenshot e transformar um briefing comercial amplo em uma apresentação B2B. São demonstrações de terceiros, não testes independentes deste site, mas ilustram padrões úteis de trabalho.
De screenshot para HTML
O modelo precisa identificar layout, hierarquia, cores, tipografia, espaçamento e posicionamento de imagens antes que uma ferramenta de código gere HTML, CSS e JavaScript. Uma avaliação real deve comparar diferenças visuais, comportamento móvel em 375 px, foco do teclado, estados de hover e movimento reduzido, em vez de julgar apenas um screenshot final.
Relatórios, slides e revisão de design
O Vision-Exp pode ler gráficos, texto por OCR, estilo visual e estrutura de página, e passar essas evidências para ferramentas de documentos, apresentações ou código. A qualidade da entrega ainda depende do framework do agente, das ferramentas disponíveis, dos ativos de origem e do processo de aceite. A compreensão de imagem sozinha não garante uma apresentação pronta para o cliente.
Aceite visual para agentes
Um agente pode inspecionar screenshots após ações importantes no navegador ou desktop e comparar o estado observado com o resultado esperado. O teto de tokens de imagem reduz o custo de entrada de verificações visuais repetidas, mas saídas e chamadas de ferramentas continuam no orçamento total.
Para cargas sem imagens, compare primeiro o guia da Responses API do DeepSeek V4 Flash. Para raciocínio e programação mais difíceis somente com texto, consulte também o guia da API DeepSeek-V4-Pro-0813. Uma nova rota experimental de visão não é motivo para migrar imediatamente toda solicitação textual.
Compreensão de imagem não é geração de imagem
A documentação da DeepSeek define deepseek-v4-flash-vision-exp como um modelo que aceita texto e imagens para descrever figuras, ler texto de screenshots e analisar gráficos. Ele não é listado como modelo de geração de imagens.
Se um site ou uma apresentação gerados contiverem imagens, elas podem vir do prompt, de um banco de mídia, de código de desenho, de outra ferramenta de geração ou de arquivos disponíveis para o agente. Um resultado final visual não prova que o Vision-Exp gerou suas imagens.
Checklist de avaliação para produção
- Use o ID exato
deepseek-v4-flash-vision-exp; não invente um alias com data. - Confirme se o catálogo atual do provedor ou gateway realmente lista o ID.
- Teste base64, URL e Files API separadamente; o suporte de terceiros pode variar.
- Use uma imagem pequena sem segredos, dados pessoais, URLs privadas ou informações de clientes.
- Registre quantidade de imagens, tokens de imagem, texto e saída, latência e cobrança.
- Crie testes pontuados de OCR, gráficos, layout e texto pequeno em vez de aceitar respostas aproximadas.
- Restrinja permissões de ferramentas, rede, escrita e exclusão de arquivos, implantação e pagamentos.
- Mantenha fallback para
deepseek-v4-flash,deepseek-v4-proou outro modelo de visão, pois esta rota é experimental.
Principais conclusões
deepseek-v4-flash-vision-expé uma rota experimental multimodal ativa da API DeepSeek, não um gerador de imagens.- Ela oferece contexto de 1M de tokens, até 384K tokens de saída e no máximo 384 tokens de entrada por imagem.
- Compatível com Chat Completions, Anthropic Messages e Responses API, recebendo imagens por base64, URL ou Files API.
- A DeepSeek diz que o desempenho de agentes multimodais está próximo do Opus-4.8; sua tabela mostra três vitórias e várias derrotas nessa comparação.
- A API direta da DeepSeek usa o mesmo preço do V4 Flash; preços e cobertura de protocolos em rotas de terceiros precisam de verificação separada.
- O rótulo experimental torna importantes testes de aceite, limites de orçamento e uma rota de fallback antes da produção.
Perguntas frequentes
O DeepSeek-V4-Flash-Vision-Exp está oficialmente disponível?
Sim. A DeepSeek o lançou na plataforma oficial de API em 21 de agosto de 2026. É uma rota experimental, não uma promessa de comportamento estável no longo prazo.
Qual é o ID exato do modelo?
Use deepseek-v4-flash-vision-exp. Mantenha o ID da API em minúsculas e com hífens, em vez do nome de exibição capitalizado.
Toda imagem sempre usa 384 tokens?
Não. A contagem real segue as regras de redimensionamento e divisão da DeepSeek. Uma imagem usa no máximo 384 tokens e várias imagens são contabilizadas separadamente.
O Vision-Exp pode gerar imagens?
A DeepSeek documenta compreensão de imagens, OCR, leitura de screenshots e análise de gráficos, não geração nativa de imagens. As imagens de um site ou apresentação podem vir de outras ferramentas ou recursos fornecidos.
Quanto ele melhora sobre o V4 Flash?
O Vision-Exp fica acima em oito das nove linhas diretamente comparáveis da tabela da DeepSeek e abaixo em Cybergym. Benchmarks do fornecedor não garantem melhoria em toda tarefa de texto ou repositório.
Posso reutilizar uma imagem com a Files API?
Sim. Faça upload uma vez e referencie o file_id retornado em solicitações posteriores. Armazenamento e upload são gratuitos, mas o modelo ainda cobra tokens de imagem ao processá-la.
Posso usá-lo com o Codex?
A DeepSeek confirma suporte a imagens na Responses API, mas o transporte delas pelo Codex depende da versão do cliente, do formato dos blocos de conteúdo e do gateway. Teste separadamente texto puro, entrada de imagem e imagens resultantes de ferramentas.
Qual é o multiplicador Vision-Exp deste gateway?
Na verificação de 22 de agosto de 2026, o catálogo público de preços deste gateway não listava o ID. Não presuma que ele seja igual à rota deepseek-v4-flash existente; consulte os preços dos modelos ao vivo.
Fontes primárias
- DeepSeek: lançamento do V4 Flash Vision Exp: data, ID, posicionamento multimodal, benchmarks do fornecedor, formatos de API e Harness 0.1.1
- Guia Vision da DeepSeek: métodos de imagem, cálculo de tokens, formatos, tamanhos e limites de solicitação
- Modelos e preços da DeepSeek: contexto de 1M, saída de 384K, preços diretos por horário, concorrência de 2.500 e recursos
- Files API da DeepSeek: uploads,
file_id, limites de tamanho e controles de expiração - Anúncio oficial da DeepSeek no X: anúncio original do lançamento