DeepSeek-V4-Flash-Vision-Exp API 가이드 2026
DeepSeek는 2026년 8월 21일 첫 공식 멀티모달 API 모델 deepseek-v4-flash-vision-exp를 출시했습니다. 이 모델은 DeepSeek V4 Flash의 텍스트·추론·에이전트 능력에 이미지 이해를 더했으며, 1M 토큰 컨텍스트 윈도, 최대 384K 출력 토큰, 이미지 한 장당 최대 384 입력 토큰을 제공합니다. DeepSeek 공식 직결 API 가격은 V4 Flash와 같습니다.
exp 접미사는 실험 버전이라는 뜻입니다. DeepSeek 공식 API에서 호출할 수 있지만 장기적으로 안정적인 정식 버전으로 표현해서는 안 됩니다. 이 가이드는 DeepSeek 공식 사양과 공급사 벤치마크, 제3자 활용 사례, 이 게이트웨이의 공개 라우트 상태를 구분합니다. 2026년 8월 22일 확인 시 이 게이트웨이의 공개 가격 카탈로그에는 새 ID가 아직 없었으므로, 이 글에서는 게이트웨이 배율을 추정하지 않습니다.
먼저 실시간 라우트를 확인하세요. 모델 가격에
deepseek-v4-flash-vision-exp가 표시되는지 확인한 뒤 API 구매 페이지에서 소액 잔액으로 시작하세요. 요청 시점의 실제 가용성과 과금 기록이 최종 기준입니다.
DeepSeek-V4-Flash-Vision-Exp 핵심 정보
| 항목 | 공식 공개 정보 |
|---|---|
| 출시일 | 2026년 8월 21일 |
| 정확한 모델 ID | deepseek-v4-flash-vision-exp |
| 출시 상태 | 실험용 멀티모달 API 모델 |
| 컨텍스트 윈도 | 1M 토큰 |
| 최대 출력 | 384K 토큰 |
| 이미지 토큰 사용량 | 크기에 따라 계산되며 이미지당 최대 384토큰 |
| 요청당 최대 이미지 수 | 600장 |
| 입력 방식 | base64, 외부 URL 또는 Files API file_id를 통한 텍스트 + 이미지 |
| API 형식 | Chat Completions, Anthropic Messages, Responses API |
| 도구 호출 | 지원 |
| 사고 모드 | 사고·비사고 모드 지원, 사고 모드가 기본값 |
| FIM 완성 | 미지원 |
| 공식 동시성 한도 | 2,500 |

출처: DeepSeek의 2026년 8월 21일 발표. 공급사가 공개한 평가이며 이 사이트가 수행한 독립 테스트가 아닙니다.
벤치마크 분석: Opus-4.8에 근접했다는 말은 모든 테스트에서 앞섰다는 뜻이 아닙니다
DeepSeek는 V4-Flash-Vision-Exp가 멀티모달 에이전트 벤치마크에서 V4 Flash보다 크게 향상됐고 종합 성능이 Opus-4.8에 근접했다고 설명합니다. 공개 표는 이 포지셔닝을 뒷받침하지만, 개별 결과는 전면적인 우위가 아니라 우열이 섞여 있습니다.
| 벤치마크 | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-Exp는 표에 제시된 Opus-4.8 결과보다 DeepSWE, Agents' Last Exam, ZeroBench에서 높지만 Terminal Bench, NL2Repo, DSBench-Hard에서는 낮습니다. V4-Flash-0731과 직접 비교할 수 있는 9개 항목 중 8개에서 더 높고, Cybergym만 더 낮습니다.
평가 조건도 중요합니다. DeepSeek는 공개 텍스트 기반 Code Agent 과제를 DeepSeek Harness Minimal Mode, 최대 출력 토큰, top_p=0.95, temperature=1.0 조건으로 실행했습니다. ApexBench와 Agents' Last Exam에서 텍스트 전용 V4 Flash는 멀티모달 요소를 무시하므로, 해당 행은 두 비전 모델을 동일 조건에서 비교한 결과가 아닙니다.
384토큰 이미지의 실제 비용은 얼마인가요?
DeepSeek는 이미지 크기에 따라 리사이즈하고 타일로 나눈 뒤 결과를 입력 토큰으로 과금합니다. 최대치는 이미지 한 장당 384토큰입니다. 여러 이미지는 각각 계산되며 요청 전체에 384토큰의 공통 상한이 적용되는 것은 아닙니다.
DeepSeek 직결 API에서 Vision-Exp 가격은 V4 Flash와 같습니다.
| DeepSeek 직결 API | 비혼잡 시간 | 혼잡 시간 |
|---|---|---|
| 캐시 적중 입력 / 1M 토큰 | $0.007 | $0.014 |
| 캐시 미적중 입력 / 1M 토큰 | $0.22 | $0.44 |
| 출력 / 1M 토큰 | $0.66 | $1.32 |
모든 이미지가 최대 384토큰에 도달하고 캐시 미적중 입력으로 과금된다는 보수적인 조건에서, 이미지 1,000장의 이미지 입력 비용은 비혼잡 시간 약 $0.0845, 혼잡 시간 약 $0.169입니다. 텍스트 입력, 모델 출력, 도구 반복 호출, 재시도 비용은 포함하지 않습니다.
DeepSeek 중국어 가격 페이지에는 캐시 미적중 입력의 지역 CNY 가격이 비혼잡 시간 CNY 1.50/M, 혼잡 시간 CNY 3.00/M으로 표시됩니다. 같은 최대 이미지 가정에서 이미지 1,000장의 이미지 입력 비용은 각각 약 CNY 0.576과 CNY 1.152입니다. USD와 CNY 표는 지역별 공식 가격이며 실시간 환율 변환값이 아닙니다.
제공된 중국어 자료는 이 비용을 다른 비전 API와 비교해 25배에서 50배 차이라고 표현했습니다. 그러나 경쟁 모델, 이미지 토큰 계산 규칙, 시간대별 가격, 출력 과금을 하나의 동일한 방법으로 검증하지 않았으므로 이 글에서는 해당 배율을 반복하지 않습니다.
실제 원장으로 검증하세요. 이 게이트웨이의 실시간 카탈로그에 모델이 표시되면 기존 키에 소액을 충전하고 민감하지 않은 이미지 한 장을 테스트하세요. 이미지·텍스트·출력 토큰, 지연 시간, 실제 청구액을 기록해야 합니다.
이미지 입력 세 가지 방법
1. 인라인 base64
JPEG, PNG, GIF 또는 WebP를 data URL로 인코딩합니다. 작거나 일시적으로 비공개인 이미지에 적합합니다. 인라인 요청 본문은 48 MiB, 이미지 한 장은 최대 32 MiB로 제한됩니다.
2. 외부 URL
공개적으로 다운로드할 수 있는 HTTP(S) 이미지 주소를 제공합니다. DeepSeek는 URL 이미지 한 장을 32 MiB로 제한하고 다운로드가 60초 안에 끝나도록 요구합니다. 정확한 라우트를 테스트하지 않았다면 쿠키, 사설망 접근 또는 단기 서명에 의존하는 링크는 피하세요.
3. Files API file_id
이미지를 한 번 업로드하고 여러 요청에서 해당 file_id를 재사용합니다. 공식 Files API는 무료이며 최대 64 MiB 파일을 받고, 선택적으로 1시간에서 30일 사이의 만료 시간을 설정할 수 있습니다. 같은 디자인, 대시보드 또는 스크린샷을 반복해서 보는 에이전트의 업로드 대역폭을 줄이지만, 모델이 파일을 읽을 때 이미지 처리 토큰은 계속 과금됩니다.
Chat Completions 이미지 요청
다음 최소 예시는 DeepSeek의 OpenAI 호환 직결 엔드포인트를 호출합니다.
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "이 페이지 스크린샷을 분석하고 주요 영역, 색상, 반응형 위험을 나열해 주세요."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
Chat Completions는 텍스트와 이미지 블록 배열을 사용합니다. Responses API는 input_image 블록으로 이미지를 전달하며, Anthropic Messages는 https://api.deepseek.com/anthropic 엔드포인트를 사용할 수 있습니다. 콘텐츠 블록 스키마가 서로 다르므로 Chat 요청 본문을 Responses 또는 Messages에 그대로 복사하면 안 됩니다.
이 게이트웨이를 이용할 때는 정확한 모델 ID가 실시간 카탈로그에 있는지 먼저 확인한 후 문서에 나온 게이트웨이 Base URL과 인증 방식을 사용하세요. DeepSeek 공식 API에서 지원된다는 사실만으로 모든 제3자 게이트웨이가 이미지 전달, Files API, 모든 프로토콜 및 과금을 이미 지원한다고 볼 수 없습니다.
실용적인 멀티모달 에이전트 워크플로
제공된 중국어 자료에는 스크린샷으로 웹사이트를 재구성하는 사례와 포괄적인 비즈니스 요구를 B2B 프레젠테이션으로 만드는 사례가 담겨 있습니다. 이들은 이 사이트의 독립 테스트가 아니라 제3자 시연이지만 유용한 워크플로 패턴을 보여 줍니다.
스크린샷에서 HTML로
모델은 코딩 도구가 HTML, CSS, JavaScript를 생성하기 전에 레이아웃, 계층, 색상, 타이포그래피, 간격, 이미지 위치를 파악해야 합니다. 실제 평가는 최종 스크린샷 한 장만 보지 말고 시각적 diff, 375px 모바일 동작, 키보드 포커스, hover 상태, 동작 줄이기 설정을 비교해야 합니다.
보고서, 슬라이드, 디자인 검토
Vision-Exp는 차트, OCR 텍스트, 시각 스타일, 페이지 구조를 읽고 그 근거를 문서·프레젠테이션·코딩 도구로 전달할 수 있습니다. 결과물 품질은 여전히 에이전트 프레임워크, 사용 가능한 도구, 원본 자산, 검수 절차에 달려 있습니다. 이미지 이해 능력만으로 고객에게 바로 보낼 수 있는 슬라이드가 보장되지는 않습니다.
에이전트의 시각적 검수
에이전트는 중요한 브라우저 또는 데스크톱 동작 후 스크린샷을 확인하고 관찰된 상태를 예상 결과와 비교할 수 있습니다. 이미지 토큰 상한은 반복적인 시각 검사의 입력 비용을 낮추지만, 출력 및 도구 호출도 전체 예산에 포함됩니다.
이미지 없는 작업이라면 먼저 DeepSeek V4 Flash Responses API 가이드를 비교하세요. 더 어려운 텍스트 전용 추론과 코딩에는 DeepSeek-V4-Pro-0813 API 가이드도 확인하세요. 새로운 실험용 비전 라우트가 나왔다고 모든 텍스트 요청을 즉시 옮길 필요는 없습니다.
이미지 이해는 이미지 생성이 아닙니다
DeepSeek 문서는 deepseek-v4-flash-vision-exp를 텍스트와 이미지를 입력받아 그림을 설명하고, 스크린샷의 텍스트를 읽고, 차트를 분석하는 모델로 정의합니다. 이미지 생성 모델로는 분류하지 않습니다.
생성된 웹사이트나 슬라이드에 이미지가 있다면 해당 자산은 프롬프트, 스톡 소스, 드로잉 코드, 다른 이미지 생성 도구 또는 에이전트가 접근할 수 있는 파일에서 왔을 수 있습니다. 시각적 결과물이 있다고 해서 Vision-Exp가 그 이미지를 생성했다는 뜻은 아닙니다.
프로덕션 평가 체크리스트
- 정확한 ID
deepseek-v4-flash-vision-exp를 사용하고 임의의 날짜 별칭을 만들지 마세요. - 현재 공급사 또는 게이트웨이 카탈로그에 실제로 이 ID가 있는지 확인하세요.
- base64, URL, Files API를 따로 테스트하세요. 제3자 지원 범위는 다를 수 있습니다.
- 비밀, 개인정보, 사설 URL, 고객 정보가 없는 작은 이미지를 사용하세요.
- 이미지 수, 이미지·텍스트·출력 토큰, 지연 시간, 과금을 기록하세요.
- 대략적인 답을 받아들이지 말고 OCR, 차트, 레이아웃, 작은 글자에 점수형 테스트를 만드세요.
- 도구, 네트워크 접근, 파일 쓰기·삭제, 배포, 결제 권한을 제한하세요.
- 이 라우트는 실험 버전이므로
deepseek-v4-flash,deepseek-v4-pro또는 다른 비전 모델로의 폴백을 유지하세요.
핵심 요약
deepseek-v4-flash-vision-exp는 현재 호출 가능한 DeepSeek의 실험용 멀티모달 API 라우트이며 이미지 생성 모델이 아닙니다.- 1M 토큰 컨텍스트 윈도, 최대 384K 출력, 이미지당 최대 384 입력 토큰을 제공합니다.
- base64, URL, Files API로 이미지를 넣을 수 있고 Chat Completions, Anthropic Messages, Responses API를 지원합니다.
- DeepSeek는 멀티모달 에이전트 성능이 Opus-4.8에 근접했다고 설명하지만, 공개 표에서는 세 항목에서 앞서고 여러 항목에서 뒤집니다.
- DeepSeek 직결 API 가격은 V4 Flash와 같지만 제3자 라우트의 가격과 프로토콜 지원은 별도로 확인해야 합니다.
- 실험 버전인 만큼 프로덕션 적용 전 인수 테스트, 예산 제한, 폴백 라우트가 중요합니다.
자주 묻는 질문
DeepSeek-V4-Flash-Vision-Exp는 공식적으로 사용할 수 있나요?
네. DeepSeek가 2026년 8월 21일 공식 API 플랫폼에 출시했습니다. 실험용 라우트이며 장기적으로 안정된 동작을 보장하는 버전은 아닙니다.
정확한 모델 ID는 무엇인가요?
deepseek-v4-flash-vision-exp를 사용하세요. 대문자가 포함된 표시 이름이 아니라 소문자와 하이픈으로 된 API ID를 유지해야 합니다.
모든 이미지가 항상 384토큰을 사용하나요?
아닙니다. 실제 수치는 DeepSeek의 리사이즈 및 타일링 규칙에 따라 달라집니다. 이미지 한 장은 최대 384토큰을 사용하며, 여러 이미지는 각각 계산됩니다.
Vision-Exp로 이미지를 생성할 수 있나요?
DeepSeek는 이미지 이해, OCR, 스크린샷 읽기, 차트 분석을 문서화했지만 네이티브 이미지 생성은 명시하지 않았습니다. 웹사이트나 슬라이드의 이미지는 다른 도구 또는 제공된 자산에서 올 수 있습니다.
V4 Flash보다 얼마나 강해졌나요?
DeepSeek 표에서 직접 비교 가능한 9개 항목 중 8개는 Vision-Exp가 높고 Cybergym은 낮습니다. 공급사 벤치마크가 모든 텍스트 또는 저장소 작업의 향상을 보장하지는 않습니다.
Files API로 이미지를 재사용할 수 있나요?
네. 한 번 업로드하고 반환된 file_id를 이후 요청에서 참조할 수 있습니다. 파일 저장과 업로드는 무료지만 모델이 이미지를 처리할 때 이미지 토큰은 계속 과금됩니다.
Codex에서 사용할 수 있나요?
DeepSeek는 Responses API의 이미지 지원을 확인했지만, Codex를 통한 이미지 전달은 클라이언트 버전, 콘텐츠 블록 형식, 게이트웨이에 따라 달라집니다. 일반 텍스트, 이미지 입력, 도구 결과 이미지를 각각 테스트하세요.
이 게이트웨이의 Vision-Exp 배율은 얼마인가요?
2026년 8월 22일 확인 시 이 게이트웨이의 공개 가격 카탈로그에는 해당 ID가 없었습니다. 기존 deepseek-v4-flash 라우트와 같다고 추정하지 말고 실시간 모델 가격을 확인하세요.
주요 출처
- DeepSeek: V4 Flash Vision Exp 출시: 출시일, 모델 ID, 멀티모달 포지셔닝, 공급사 벤치마크, API 형식, Harness 0.1.1
- DeepSeek Vision 가이드: 이미지 입력 방식, 토큰 계산, 형식, 크기 및 요청 한도
- DeepSeek 모델 및 가격: 1M 컨텍스트, 384K 출력, 시간대별 직결 가격, 동시성 2,500 및 기능
- DeepSeek Files API: 업로드,
file_id, 크기 제한, 만료 설정 - DeepSeek 공식 X 발표: 최초 출시 공지