DeepSeek-V4-Flash-Vision-Exp API 指南 2026
**DeepSeek 於 2026 年 8 月 21 日上線首個官方多模態 API 模型 deepseek-v4-flash-vision-exp。**它在 DeepSeek V4 Flash 的文字、推理與 Agent 能力上增加圖片理解,提供 1M 上下文、最大 384K 輸出,單張圖片最高計入 384 Tokens,官方直連 API 與 deepseek-v4-flash 同價。
模型名稱中的 exp 代表 experimental。它已經可透過 DeepSeek 官方 API 呼叫,但仍是實驗型路由,不應被寫成長期穩定版。本文將 DeepSeek 官方規格與廠商跑分、第三方案例 和 本站路由狀態 分開說明:截至 2026 年 8 月 22 日複核時,本站公開價格目錄尚未列出該新 ID,因此本文不猜測本站倍率。
**先看即時路由:**請在模型價格確認
deepseek-v4-flash-vision-exp是否已出現,再從 API 購買頁開通小額餘額。模型可用性與扣費以請求當時的即時目錄和帳單為準。
DeepSeek-V4-Flash-Vision-Exp 核心資料
| 項目 | 官方已公布資訊 |
|---|---|
| 發布日期 | 2026 年 8 月 21 日 |
| 準確模型 ID | deepseek-v4-flash-vision-exp |
| 發布狀態 | 實驗型多模態 API 模型 |
| 上下文視窗 | 1M Tokens |
| 最大輸出 | 384K Tokens |
| 圖片 Token | 按尺寸換算,每張最高 384 Tokens |
| 單次最多圖片 | 600 張 |
| 輸入格式 | 文字 + 圖片;base64、外部 URL、Files API file_id |
| API 格式 | Chat Completions、Anthropic Messages、Responses API |
| 工具呼叫 | 支援 |
| 思考模式 | 支援非思考與思考模式,預設思考 |
| FIM 補全 | 不支援 |
| 官方並發上限 | 2500 |

圖片來源:DeepSeek 官方 2026-08-21 發布稿。表中成績是廠商公布的評測結果,不是本站獨立複測。
跑分怎麼看:接近 Opus-4.8,但不是「全面超越」
DeepSeek 官方表示,V4-Flash-Vision-Exp 在多模態 Agent 基準上相比 V4 Flash 明顯躍升,整體表現接近 Opus-4.8。這一定位有官方跑分支撐,但逐項資料顯示的是「互有勝負」,不是全項領先。
| 基準 | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-Exp 在 DeepSWE、Agents' Last Exam 和 ZeroBench 這三項高於圖片中的 Opus-4.8,在 Terminal Bench、NL2Repo、DSBench-Hard 等項目仍落後。它在上表 9 個可與 V4-Flash-0731 直接比較的項目中有 8 項更高,只有 Cybergym 更低。
需要注意評測條件:DeepSeek 系列的公開 Code Agent 文字任務使用 DeepSeek Harness Minimal Mode,將最大輸出設到上限,top_p=0.95、temperature=1.0。ApexBench 和 Agents' Last Exam 中,純文字 V4 Flash 會忽略測試中的多模態元素,因此兩者並不是完全同等條件下的視覺模型比較。
384 Tokens 一張圖,真實成本是多少?
DeepSeek 會根據圖片尺寸進行縮放和分塊,然後將圖片換算為輸入 Tokens。單張圖片的上限是 384 Tokens;多圖請求中每張圖獨立計算,沒有共享的總 Token 上限。
官方人民幣價格表中,Vision-Exp 與 V4 Flash 同價:
| 官方直連 API | 離峰時段 | 尖峰時段 |
|---|---|---|
| 快取命中輸入 / 百萬 Tokens | ¥0.05 | ¥0.10 |
| 快取未命中輸入 / 百萬 Tokens | ¥1.50 | ¥3.00 |
| 輸出 / 百萬 Tokens | ¥4.50 | ¥9.00 |
按「單圖達到 384 Tokens,且作為快取未命中輸入」的保守方式計算,1000 張圖片的純圖片輸入成本約為:
- 離峰時段:
384 × 1000 × ¥1.50 / 1,000,000 = ¥0.576 - 尖峰時段:
384 × 1000 × ¥3.00 / 1,000,000 = ¥1.152
這只是圖片輸入部分,不包含文字輸入、模型輸出、工具循環和重試。「一千張圖約一元」只在每張都達到上限、尖峰期快取未命中,且只計圖片輸入時成立。本文不沿用未經同口徑複核的「比其他模型便宜 25 倍或 50 倍」說法。
DeepSeek 英文官方價格頁同時列出美元口徑:快取未命中輸入為 $0.22/M(離峰)和 $0.44/M(尖峰),輸出為 $0.66/M 和 $1.32/M。美元與人民幣頁是不同計費地區的官方標價,不應當成即時匯率換算。
**用真實帳單驗證:**如果本站即時目錄已出現新模型,可以為現有 Key 小額儲值,用一張低風險測試圖片核對輸入 Tokens、輸出 Tokens 和實際扣費。
三種圖片輸入方式
1. Base64 內嵌
將 JPEG、PNG、GIF 或 WebP 編碼成 data URL,適合小圖和不能對外公開的臨時圖片。內嵌請求主體總上限為 48 MiB,單圖上限 32 MiB。
2. 外部 URL
傳入可公開下載的 HTTP(S) 圖片 URL。官方要求單圖不超過 32 MiB,且在 60 秒內完成下載。不要使用需要 Cookie、內網登入或短時效簽章的 URL,除非你已驗證實際路由能穩定讀取。
3. Files API file_id
先上傳圖片,再在多次請求中重複使用 file_id。官方 Files API 免費,支援單檔最大 64 MiB,可設定 1 小時到 30 天的到期時間,也可不設自動到期。對需要反覆檢查同一張設計稿、報表或頁面截圖的 Agent,這能減少每輪重複上傳的請求頻寬;圖片 Tokens 仍會按官方規則計費。
Chat Completions 圖片呼叫範例
以下是直連 DeepSeek 官方 OpenAI 相容介面的最小範例:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "讀取這張頁面截圖,列出主要區塊、顏色和回應式風險。"},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
圖片可以與文字混合,也可同時傳入多張圖。在 Responses API 中使用 input_image,Anthropic Messages 格式則可以透過 https://api.deepseek.com/anthropic 呼叫。不同協定的內容區塊欄位不同,不要把 Chat 請求主體原樣複製到 Responses 或 Messages。
如果透過本站網關呼叫,必須先在即時模型目錄確認該 ID 已開放,再將 Base URL 和認證方式替換為本站說明。不要只因為 DeepSeek 官方已上線,就假設所有第三方網關已同步路由、圖片轉送和計費。
從素材中提煉的實用場景
你提供的中文案例主要展示了兩類工作流程:把網頁截圖還原為可執行的 HTML,以及把模糊商業需求整理為一份 B 端提案。這些屬於第三方展示,不是本站獨立複測;但它們能很好地說明多模態 Agent 的實用價值。
截圖到 HTML
模型需要先識別版面配置、層級、色值、字號、間距和圖片位置,再結合程式碼工具產生 HTML/CSS/JS。評估時應比較像素級差異、375px 窄螢幕、鍵盤焦點、hover 和動畫降級,而不是只看一張最終截圖。
報表、簡報與設計稿分析
它可以讀取圖表、OCR 文字、視覺風格和頁面結構,再交給文件、投影片或程式設計工具產生內容。實際品質仍取決於 Agent 框架、可用工具、圖片素材和驗收流程,不能把「模型能看圖」等同於「自動產出可交付簡報」。
視覺化 Agent 驗收
對網頁、桌面軟體和工作流程自動化,可讓 Agent 在關鍵步驟讀取截圖,將介面狀態與預期狀態對照。單圖 Token 上限降低了重複視覺檢查的輸入成本,但每輪的模型輸出和工具呼叫仍需計入總預算。
如果任務不需要圖片,可先比較 DeepSeek V4 Flash 與 Responses API 指南;對更高難度的純文字推理和程式碼任務,也可參考 DeepSeek-V4-Pro-0813 API 指南。不要只因為 Vision-Exp 是新模型,就將所有純文字流量全量切換。
不要混淆:看圖不等於生圖
deepseek-v4-flash-vision-exp 的官方文件定位是「接收文字與圖片,描述圖片、讀取截圖文字、分析圖表」。它不是官方文件中的圖片生成模型。
當 Agent 複刻網頁或製作簡報時,頁面中的圖片可能來自輸入素材、外部圖庫、程式碼繪製、另一個圖片生成工具,或 Agent 執行環境中的檔案。不能只根據最終作品中「有圖」,就推斷 Vision-Exp 自己生成了圖片。
生產接入檢查清單
- 使用準確 ID
deepseek-v4-flash-vision-exp,不自行縮寫或猜測日期別名。 - 確認目前供應商或網關的即時目錄已出現該 ID。
- 分別測試 base64、外部 URL 和 Files API,不假設三種輸入在每個網關都已打通。
- 使用不含個人隱私、金鑰、內網位址和客戶資料的小圖做 Smoke Test。
- 記錄輸入圖片數、圖片 Tokens、文字 Tokens、輸出 Tokens、延遲和扣費。
- 對 OCR、圖表、版面配置和小文字分別建立可評分的驗收集,不只看「大概說對了」。
- 為工具呼叫、外部網路、寫入檔案、刪除、發布和付款保留權限邊界。
- 為實驗型路由準備退回
deepseek-v4-flash、deepseek-v4-pro或其他視覺模型的方案。
關鍵結論
deepseek-v4-flash-vision-exp是 DeepSeek 已上線的實驗型多模態 API 模型,不是生圖模型。- 它提供 1M 上下文和最大 384K 輸出,單圖最高換算為 384 Tokens。
- 它支援 Chat Completions、Anthropic Messages 和 Responses API,可用 base64、URL 或 Files API 傳圖。
- DeepSeek 官方表示多模態 Agent 表現接近 Opus-4.8;逐項資料顯示它有三項領先,也有多項落後。
- 官方直連 API 與 V4 Flash 同價,但第三方網關的倍率和能力必須單獨驗證。
- 它是 experimental 路由,不建議在沒有驗收、限額與回退方案的情況下直接替換生產預設模型。
常見問題
DeepSeek-V4-Flash-Vision-Exp 正式上線了嗎?
是。DeepSeek 於 2026 年 8 月 21 日將它上線官方 API 平台。它的狀態是 experimental,不等於已經成為長期穩定版。
準確的模型 ID 是什麼?
使用 deepseek-v4-flash-vision-exp。不要使用文章標題中的大寫展示名稱代替 API ID。
一張圖片固定是 384 Tokens 嗎?
不是。384 是單張圖片的上限。實際 Tokens 由圖片尺寸和官方縮放、分塊規則決定;多張圖會逐張計算。
Vision-Exp 會生成圖片嗎?
官方文件只確認圖片理解、OCR、截圖和圖表分析等輸入能力,沒有將它列為圖片生成模型。複刻網頁中出現圖片,也可能來自素材、繪圖程式碼或其他工具。
它比 DeepSeek V4 Flash 強多少?
官方圖表的 9 個可直接比較項目中,Vision-Exp 有 8 項高於 V4-Flash-0731,Cybergym 一項更低。這只代表官方評測集,不代表每個文字或程式碼庫任務都會變強。
可以用 Files API 重複使用同一張圖嗎?
可以。上傳後可以在多次請求中引用 file_id,避免重複上傳檔案。Files API 本身免費,但圖片進入模型時仍按圖片 Tokens 計費。
它可以直接接入 Codex 嗎?
官方確認它支援 Responses API,但 Codex 或其他 Agent 能否傳遞圖片,還取決於用戶端版本、內容區塊格式和網關能力。請分別驗證純文字、圖片輸入和工具回傳。
本站的 Vision-Exp 倍率是多少?
截至 2026 年 8 月 22 日本文複核時,本站公開價格目錄還沒有列出該 ID,因此不應推斷其與本站 deepseek-v4-flash 的倍率相同。請查看即時模型價格。
主要來源
- DeepSeek:Vision-Exp 正式發布:發布日期、模型 ID、多模態定位、官方跑分、API 格式和 Harness 0.1.1
- DeepSeek:圖片理解指南:圖片輸入方式、Token 換算、格式、尺寸與數量限制
- DeepSeek:模型與價格:1M 上下文、384K 輸出、分時價格、2500 並發與功能表
- DeepSeek:Files API:上傳、
file_id、檔案大小與到期設定 - DeepSeek 官方 X 公告:發布公告原始連結