Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Voltar ao blog

DeepSeek-V4-Flash-Vision-Exp: Guia da API 2026

DeepSeek V4 Flash VisionAPI DeepSeekagentes multimodaisAPI VisionAPI Responses

A DeepSeek lançou seu primeiro modelo oficial de API multimodal, deepseek-v4-flash-vision-exp, em 21 de agosto de 2026. Ele acrescenta compreensão de imagens aos recursos de texto, raciocínio e agentes do DeepSeek V4 Flash, com janela de contexto de 1M de tokens, até 384K tokens de saída e cobrança máxima de 384 tokens de entrada por imagem, pelo preço da API direta do V4 Flash.

O sufixo exp significa experimental. A rota já pode ser chamada na API oficial da DeepSeek, mas não deve ser apresentada como uma versão estável de longo prazo. Este guia separa especificações oficiais e benchmarks do fornecedor DeepSeek, exemplos de terceiros e o estado da rota pública deste gateway. Na verificação de 22 de agosto de 2026, o catálogo público de preços deste gateway ainda não listava o novo ID. Por isso, o artigo não presume um multiplicador do gateway.

Confira primeiro a rota ao vivo: confirme que deepseek-v4-flash-vision-exp aparece em preços dos modelos antes de abrir um saldo pequeno na página de compra da API. A disponibilidade e os registros de cobrança no momento da solicitação são a fonte definitiva.

Dados principais do DeepSeek-V4-Flash-Vision-Exp

Item Informação publicada oficialmente
Data de lançamento 21 de agosto de 2026
ID exato do modelo deepseek-v4-flash-vision-exp
Status da versão Modelo experimental de API multimodal
Janela de contexto 1M de tokens
Saída máxima 384K tokens
Uso de tokens de imagem Depende das dimensões; no máximo 384 tokens por imagem
Máximo de imagens por solicitação 600
Métodos de entrada Texto + imagem por base64, URL externa ou file_id da Files API
Formatos de API Chat Completions, Anthropic Messages e Responses API
Chamadas de ferramentas Compatíveis
Modos de pensamento Com e sem pensamento; pensamento é o padrão
Completação FIM Não compatível
Limite oficial de concorrência 2.500

Comparação oficial de benchmarks da DeepSeek entre V4 Flash Vision Exp, V4 Flash e Opus-4.8

Fonte: lançamento da DeepSeek em 21 de agosto de 2026. Estas são avaliações publicadas pelo fornecedor, não testes independentes deste site.

Análise dos benchmarks: perto do Opus-4.8 não significa vencer todos os testes

A DeepSeek afirma que o V4-Flash-Vision-Exp dá um grande salto sobre o V4 Flash em benchmarks de agentes multimodais e aproxima o desempenho geral do Opus-4.8. A tabela publicada sustenta esse posicionamento, mas os resultados individuais mostram uma comparação mista, não uma vitória completa.

Benchmark Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83,9 82,7 85,0
NL2Repo 57,7 54,2 69,7
Cybergym 75,3 76,7 78,3
DeepSWE 59,3 54,4 58,0
Toolathlon-Verified 75,9 70,3 76,2
DSBench-Hard 63,6 59,6 71,7
AutomationBench (Public) 25,7 25,1 27,2
ApexBench (Pass@1) 36,5 26,2 39,4
Agents' Last Exam 27,3 25,2 25,7
Chartography 64,3 65,0
ZeroBench (Pass@5) 35,0 34,0

O Vision-Exp supera o resultado apresentado do Opus-4.8 em DeepSWE, Agents' Last Exam e ZeroBench, mas fica atrás em Terminal Bench, NL2Repo e DSBench-Hard. Ele pontua acima do V4-Flash-0731 em oito das nove linhas diretamente comparáveis, com Cybergym como exceção.

As condições de avaliação importam. A DeepSeek executou as tarefas públicas textuais de Code Agent usando DeepSeek Harness em Minimal Mode, o máximo de tokens de saída, top_p=0.95 e temperature=1.0. No ApexBench e Agents' Last Exam, o V4 Flash somente de texto ignora elementos multimodais; portanto, essas linhas não representam uma comparação equivalente entre dois modelos de visão.

Quanto custa de fato uma imagem de 384 tokens?

A DeepSeek redimensiona e divide a imagem em blocos conforme suas dimensões e depois cobra o resultado como tokens de entrada. O máximo é de 384 tokens por imagem. Várias imagens são contabilizadas separadamente; não há um teto compartilhado de 384 tokens para toda a solicitação.

A API direta lista o Vision-Exp pelo mesmo preço do V4 Flash:

API direta da DeepSeek Fora do pico Horário de pico
Entrada com cache / 1M tokens US$ 0,007 US$ 0,014
Entrada sem cache / 1M tokens US$ 0,22 US$ 0,44
Saída / 1M tokens US$ 0,66 US$ 1,32

No cenário conservador em que cada imagem atinge 384 tokens e é cobrada como entrada sem cache, 1.000 imagens custam cerca de US$ 0,0845 fora do pico ou US$ 0,169 no horário de pico apenas pela entrada da imagem. O cálculo exclui texto de entrada, saída do modelo, ciclos de ferramentas e novas tentativas.

A página chinesa de preços da DeepSeek informa valores regionais de CNY 1,50/M fora do pico e CNY 3,00/M no pico para entrada sem cache. Com a mesma hipótese de imagem máxima, 1.000 imagens custam aproximadamente CNY 0,576 ou CNY 1,152 em entrada de imagem. As tabelas em USD e CNY são preços regionais oficiais, não uma conversão cambial em tempo real.

O relatório chinês fornecido comparava esses custos com outras APIs de visão e citava uma diferença de 25x a 50x. Este artigo não repete essa proporção porque modelos concorrentes, regras de tokens de imagem, faixas horárias e cobranças de saída não foram verificados com uma metodologia uniforme.

Valide com um extrato real: se o modelo aparecer no catálogo ao vivo deste gateway, recarregue uma chave existente com um valor pequeno e teste uma imagem não sensível. Registre tokens de imagem, texto e saída, latência e cobrança efetiva.

Três métodos de entrada de imagem

1. Base64 embutido

Codifique um JPEG, PNG, GIF ou WebP como data URL. Isso funciona para imagens pequenas ou privadas e temporárias. O corpo da solicitação embutida tem limite de 48 MiB, com máximo de 32 MiB para uma imagem.

2. URL externa

Forneça uma imagem HTTP(S) publicamente acessível para download. A DeepSeek limita cada imagem por URL a 32 MiB e exige que o download termine em 60 segundos. Evite links que dependam de cookies, acesso a rede privada ou assinaturas de curta duração, a menos que a rota exata tenha sido testada.

3. file_id da Files API

Faça upload de uma imagem uma vez e reutilize seu file_id em várias solicitações. A Files API oficial é gratuita, aceita arquivos de até 64 MiB e permite validade opcional entre uma hora e 30 dias. Ela reduz uploads repetidos para agentes que revisitam o mesmo design, painel ou screenshot; os tokens de imagem continuam sendo cobrados quando o modelo lê o arquivo.

Solicitação de imagem com Chat Completions

Este exemplo mínimo chama o endpoint direto da DeepSeek compatível com OpenAI:

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Analise este screenshot de página e liste suas principais seções, cores e riscos responsivos."},
        {"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
      ]
    }]
  }'

Chat Completions usa uma matriz de blocos de texto e imagem. A Responses API transporta imagens em blocos input_image, enquanto Anthropic Messages pode usar o endpoint https://api.deepseek.com/anthropic. Não copie sem alterações o corpo de uma solicitação Chat para Responses ou Messages, pois os esquemas de blocos de conteúdo são diferentes.

Para este gateway, confirme primeiro se o ID exato está no catálogo ao vivo e então use a URL base e o método de autenticação documentados pelo gateway. A disponibilidade oficial na DeepSeek não comprova que todos os gateways de terceiros já habilitaram encaminhamento de imagens, Files API, todos os protocolos ou cobrança.

Fluxos práticos para agentes multimodais

O material chinês fornecido descreve dois exemplos: reconstruir um site a partir de um screenshot e transformar um briefing comercial amplo em uma apresentação B2B. São demonstrações de terceiros, não testes independentes deste site, mas ilustram padrões úteis de trabalho.

De screenshot para HTML

O modelo precisa identificar layout, hierarquia, cores, tipografia, espaçamento e posicionamento de imagens antes que uma ferramenta de código gere HTML, CSS e JavaScript. Uma avaliação real deve comparar diferenças visuais, comportamento móvel em 375 px, foco do teclado, estados de hover e movimento reduzido, em vez de julgar apenas um screenshot final.

Relatórios, slides e revisão de design

O Vision-Exp pode ler gráficos, texto por OCR, estilo visual e estrutura de página, e passar essas evidências para ferramentas de documentos, apresentações ou código. A qualidade da entrega ainda depende do framework do agente, das ferramentas disponíveis, dos ativos de origem e do processo de aceite. A compreensão de imagem sozinha não garante uma apresentação pronta para o cliente.

Aceite visual para agentes

Um agente pode inspecionar screenshots após ações importantes no navegador ou desktop e comparar o estado observado com o resultado esperado. O teto de tokens de imagem reduz o custo de entrada de verificações visuais repetidas, mas saídas e chamadas de ferramentas continuam no orçamento total.

Para cargas sem imagens, compare primeiro o guia da Responses API do DeepSeek V4 Flash. Para raciocínio e programação mais difíceis somente com texto, consulte também o guia da API DeepSeek-V4-Pro-0813. Uma nova rota experimental de visão não é motivo para migrar imediatamente toda solicitação textual.

Compreensão de imagem não é geração de imagem

A documentação da DeepSeek define deepseek-v4-flash-vision-exp como um modelo que aceita texto e imagens para descrever figuras, ler texto de screenshots e analisar gráficos. Ele não é listado como modelo de geração de imagens.

Se um site ou uma apresentação gerados contiverem imagens, elas podem vir do prompt, de um banco de mídia, de código de desenho, de outra ferramenta de geração ou de arquivos disponíveis para o agente. Um resultado final visual não prova que o Vision-Exp gerou suas imagens.

Checklist de avaliação para produção

  1. Use o ID exato deepseek-v4-flash-vision-exp; não invente um alias com data.
  2. Confirme se o catálogo atual do provedor ou gateway realmente lista o ID.
  3. Teste base64, URL e Files API separadamente; o suporte de terceiros pode variar.
  4. Use uma imagem pequena sem segredos, dados pessoais, URLs privadas ou informações de clientes.
  5. Registre quantidade de imagens, tokens de imagem, texto e saída, latência e cobrança.
  6. Crie testes pontuados de OCR, gráficos, layout e texto pequeno em vez de aceitar respostas aproximadas.
  7. Restrinja permissões de ferramentas, rede, escrita e exclusão de arquivos, implantação e pagamentos.
  8. Mantenha fallback para deepseek-v4-flash, deepseek-v4-pro ou outro modelo de visão, pois esta rota é experimental.

Principais conclusões

  • deepseek-v4-flash-vision-exp é uma rota experimental multimodal ativa da API DeepSeek, não um gerador de imagens.
  • Ela oferece contexto de 1M de tokens, até 384K tokens de saída e no máximo 384 tokens de entrada por imagem.
  • Compatível com Chat Completions, Anthropic Messages e Responses API, recebendo imagens por base64, URL ou Files API.
  • A DeepSeek diz que o desempenho de agentes multimodais está próximo do Opus-4.8; sua tabela mostra três vitórias e várias derrotas nessa comparação.
  • A API direta da DeepSeek usa o mesmo preço do V4 Flash; preços e cobertura de protocolos em rotas de terceiros precisam de verificação separada.
  • O rótulo experimental torna importantes testes de aceite, limites de orçamento e uma rota de fallback antes da produção.

Perguntas frequentes

O DeepSeek-V4-Flash-Vision-Exp está oficialmente disponível?

Sim. A DeepSeek o lançou na plataforma oficial de API em 21 de agosto de 2026. É uma rota experimental, não uma promessa de comportamento estável no longo prazo.

Qual é o ID exato do modelo?

Use deepseek-v4-flash-vision-exp. Mantenha o ID da API em minúsculas e com hífens, em vez do nome de exibição capitalizado.

Toda imagem sempre usa 384 tokens?

Não. A contagem real segue as regras de redimensionamento e divisão da DeepSeek. Uma imagem usa no máximo 384 tokens e várias imagens são contabilizadas separadamente.

O Vision-Exp pode gerar imagens?

A DeepSeek documenta compreensão de imagens, OCR, leitura de screenshots e análise de gráficos, não geração nativa de imagens. As imagens de um site ou apresentação podem vir de outras ferramentas ou recursos fornecidos.

Quanto ele melhora sobre o V4 Flash?

O Vision-Exp fica acima em oito das nove linhas diretamente comparáveis da tabela da DeepSeek e abaixo em Cybergym. Benchmarks do fornecedor não garantem melhoria em toda tarefa de texto ou repositório.

Posso reutilizar uma imagem com a Files API?

Sim. Faça upload uma vez e referencie o file_id retornado em solicitações posteriores. Armazenamento e upload são gratuitos, mas o modelo ainda cobra tokens de imagem ao processá-la.

Posso usá-lo com o Codex?

A DeepSeek confirma suporte a imagens na Responses API, mas o transporte delas pelo Codex depende da versão do cliente, do formato dos blocos de conteúdo e do gateway. Teste separadamente texto puro, entrada de imagem e imagens resultantes de ferramentas.

Qual é o multiplicador Vision-Exp deste gateway?

Na verificação de 22 de agosto de 2026, o catálogo público de preços deste gateway não listava o ID. Não presuma que ele seja igual à rota deepseek-v4-flash existente; consulte os preços dos modelos ao vivo.

Fontes primárias