Hướng dẫn DeepSeek-V4-Flash-Vision-Exp API 2026
Ngày 21 tháng 8 năm 2026, DeepSeek ra mắt mô hình API đa phương thức chính thức đầu tiên, deepseek-v4-flash-vision-exp. Mô hình bổ sung khả năng hiểu hình ảnh vào năng lực văn bản, suy luận và agent của DeepSeek V4 Flash, với cửa sổ ngữ cảnh 1M token, đầu ra tối đa 384K token và mỗi ảnh được tính không quá 384 token đầu vào. Trên API trực tiếp của DeepSeek, giá bằng V4 Flash.
Hậu tố exp có nghĩa là experimental — thử nghiệm. Tuyến đã gọi được qua API chính thức nhưng không nên mô tả như một bản ổn định dài hạn. Bài viết tách rõ thông số và benchmark do DeepSeek công bố, ví dụ từ bên thứ ba và trạng thái tuyến trên cổng này. Khi kiểm tra ngày 22 tháng 8 năm 2026, danh mục giá công khai của cổng chưa có ID mới, vì vậy bài không suy đoán hệ số cổng.
Kiểm tra tuyến trực tiếp trước: xác nhận
deepseek-v4-flash-vision-expxuất hiện trong bảng giá mô hình, rồi mới mở số dư nhỏ ở trang mua API. Khả dụng và sổ tính phí tại thời điểm gọi mới là căn cứ cuối cùng.
Thông số chính của DeepSeek-V4-Flash-Vision-Exp
| Hạng mục | Thông tin chính thức đã công bố |
|---|---|
| Ngày phát hành | 21/08/2026 |
| ID mô hình chính xác | deepseek-v4-flash-vision-exp |
| Trạng thái | Mô hình API đa phương thức thử nghiệm |
| Cửa sổ ngữ cảnh | 1M token |
| Đầu ra tối đa | 384K token |
| Token hình ảnh | Theo kích thước; không quá 384 token mỗi ảnh |
| Số ảnh tối đa mỗi yêu cầu | 600 |
| Phương thức đầu vào | Văn bản + ảnh qua base64, URL ngoài hoặc file_id của Files API |
| Định dạng API | Chat Completions, Anthropic Messages và Responses API |
| Tool calls | Có hỗ trợ |
| Chế độ suy luận | Có suy luận và không suy luận; mặc định bật suy luận |
| FIM completion | Không hỗ trợ |
| Giới hạn đồng thời chính thức | 2500 |

Nguồn: thông báo DeepSeek ngày 21/08/2026. Đây là kết quả do nhà cung cấp công bố, không phải kiểm thử độc lập của trang này.
Đọc benchmark: gần Opus-4.8 không có nghĩa là thắng mọi bài
DeepSeek cho biết V4-Flash-Vision-Exp tiến bộ mạnh so với V4 Flash trên benchmark agent đa phương thức và hiệu năng tổng thể gần Opus-4.8. Bảng công bố phù hợp với định vị đó, nhưng kết quả từng bài là thắng thua đan xen, không phải vượt toàn diện.
| Benchmark | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-Exp cao hơn kết quả Opus-4.8 trong hình ở DeepSWE, Agents' Last Exam và ZeroBench, nhưng thấp hơn ở Terminal Bench, NL2Repo và DSBench-Hard. Trong chín dòng so sánh trực tiếp được với V4-Flash-0731, nó cao hơn tám dòng; Cybergym là ngoại lệ.
Điều kiện đánh giá rất quan trọng. DeepSeek chạy các bài Code Agent công khai dạng văn bản bằng Harness Minimal Mode, đầu ra tối đa, top_p=0.95 và temperature=1.0. Ở ApexBench và Agents' Last Exam, V4 Flash chỉ-văn-bản bỏ qua yếu tố đa phương thức, nên đây không phải phép so sánh ngang bằng giữa hai mô hình thị giác.
Một ảnh tối đa 384 token thực sự tốn bao nhiêu?
DeepSeek thay đổi kích thước và chia ảnh thành các ô theo kích thước rồi quy đổi thành token đầu vào. 384 là mức trần cho một ảnh, không phải con số cố định. Nhiều ảnh được tính riêng từng ảnh; toàn yêu cầu không dùng chung một mức trần 384 token.
API trực tiếp niêm yết Vision-Exp cùng giá với V4 Flash:
| API trực tiếp DeepSeek | Giờ thấp điểm | Giờ cao điểm |
|---|---|---|
| Đầu vào cache hit / 1M token | $0.007 | $0.014 |
| Đầu vào cache miss / 1M token | $0.22 | $0.44 |
| Đầu ra / 1M token | $0.66 | $1.32 |
Theo giả định thận trọng rằng mỗi ảnh đều đạt 384 token và bị tính là đầu vào cache miss, 1.000 ảnh tốn khoảng $0.0845 lúc thấp điểm hoặc $0.169 lúc cao điểm chỉ riêng phần ảnh đầu vào.
Trang giá tiếng Trung của DeepSeek niêm yết mức vùng CNY 1,50/M lúc thấp điểm và CNY 3,00/M lúc cao điểm cho đầu vào cache miss. Với cùng giả định tối đa:
- thấp điểm:
384 × 1000 × CNY 1.50 / 1,000,000 = CNY 0.576; - cao điểm:
384 × 1000 × CNY 3.00 / 1,000,000 = CNY 1.152.
Chi phí này chưa gồm văn bản đầu vào, đầu ra, vòng lặp công cụ và thử lại. Bảng USD và CNY là giá vùng chính thức, không phải quy đổi tỷ giá trực tiếp. Bài cũng không lặp lại tuyên bố chênh 25–50 lần trong tài liệu bên thứ ba vì quy tắc token ảnh, khung giờ và phí đầu ra của các mô hình khác chưa được chuẩn hóa cùng một phương pháp.
Xác minh bằng sổ thực tế: nếu mô hình đã xuất hiện trong danh mục cổng, hãy nạp số dư nhỏ và thử một ảnh không nhạy cảm. Ghi lại token ảnh, token văn bản, đầu ra, độ trễ và khoản trừ thực tế.
Ba cách đưa hình ảnh vào
1. Base64 nội tuyến
Mã hóa JPEG, PNG, GIF hoặc WebP thành data URL. Cách này hợp với ảnh nhỏ hoặc ảnh tạm thời riêng tư. Tổng thân yêu cầu nội tuyến tối đa 48 MiB, một ảnh tối đa 32 MiB.
2. URL bên ngoài
Cung cấp URL HTTP(S) có thể tải công khai. Một ảnh tối đa 32 MiB và phải tải xong trong 60 giây. Tránh liên kết cần cookie, truy cập mạng riêng hoặc chữ ký hết hạn nhanh nếu chưa thử chính tuyến đó.
3. file_id của Files API
Tải ảnh lên một lần rồi dùng lại file_id ở nhiều yêu cầu. Files API chính thức miễn phí, nhận tệp tối đa 64 MiB và cho phép thời hạn từ một giờ đến 30 ngày. Nó giảm băng thông tải lặp lại cùng bản thiết kế, báo cáo hoặc ảnh chụp; token ảnh vẫn bị tính mỗi lần mô hình đọc tệp.
Yêu cầu ảnh bằng Chat Completions
Ví dụ tối thiểu gọi endpoint tương thích OpenAI trực tiếp của DeepSeek:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Đọc ảnh chụp trang này và liệt kê các phần chính, màu sắc và rủi ro responsive."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
Responses API dùng khối input_image, còn Anthropic Messages có thể gọi qua https://api.deepseek.com/anthropic. Cấu trúc khối nội dung khác nhau, vì vậy không sao chép nguyên thân Chat sang Responses hoặc Messages.
Với cổng này, hãy xác nhận ID chính xác có trong danh mục trực tiếp rồi dùng Base URL và cách xác thực theo tài liệu cổng. Việc API chính thức đã mở không chứng minh mọi cổng bên thứ ba đã hỗ trợ chuyển tiếp ảnh, Files API, mọi giao thức hay tính phí.
Quy trình agent đa phương thức thực tế
Tài liệu tiếng Trung được cung cấp mô tả hai ví dụ: dựng lại website từ ảnh chụp và biến một brief kinh doanh rộng thành bài trình bày B2B. Đây là minh họa của bên thứ ba, không phải kiểm thử độc lập của trang này, nhưng thể hiện các quy trình hữu ích.
Từ ảnh chụp sang HTML
Mô hình phải nhận ra bố cục, phân cấp, màu sắc, kiểu chữ và khoảng cách trước khi công cụ lập trình tạo HTML, CSS và JavaScript. Đánh giá nghiêm túc nên đo sai khác hình ảnh, hành vi ở chiều rộng 375px, focus bàn phím, trạng thái hover và reduced motion thay vì chỉ nhìn một ảnh kết quả.
Báo cáo, slide và đánh giá thiết kế
Vision-Exp có thể đọc biểu đồ, OCR văn bản, phong cách thị giác và cấu trúc trang rồi chuyển bằng chứng cho công cụ tài liệu, trình chiếu hoặc code. Chất lượng bàn giao vẫn phụ thuộc framework agent, bộ công cụ, tài sản nguồn và quy trình nghiệm thu; hiểu ảnh không tự động đảm bảo slide sẵn sàng gửi khách hàng.
Nghiệm thu trực quan cho agent
Agent có thể kiểm tra ảnh chụp sau hành động quan trọng trong trình duyệt hoặc desktop và so sánh trạng thái quan sát với kết quả mong đợi. Trần token ảnh giảm phí đầu vào cho kiểm tra lặp lại, nhưng đầu ra và tool call vẫn thuộc tổng ngân sách.
Với khối lượng không có ảnh, hãy đối chiếu hướng dẫn DeepSeek V4 Flash và Responses API. Với suy luận và coding chỉ-văn-bản khó hơn, xem hướng dẫn DeepSeek-V4-Pro-0813. Không nên chuyển mọi yêu cầu văn bản sang một tuyến vision thử nghiệm chỉ vì nó mới.
Hiểu ảnh không phải sinh ảnh
Tài liệu DeepSeek định nghĩa deepseek-v4-flash-vision-exp là mô hình nhận văn bản và ảnh để mô tả hình, đọc chữ trên ảnh chụp và phân tích biểu đồ. Nó không được niêm yết là mô hình tạo ảnh.
Hình trong website hay bộ slide được tạo có thể đến từ prompt, kho ảnh, mã vẽ, công cụ sinh ảnh khác hoặc tệp của agent. Sản phẩm có hình không chứng minh Vision-Exp đã tự sinh ra chúng.
Danh sách kiểm tra trước production
- Dùng đúng ID
deepseek-v4-flash-vision-exp, không tự tạo alias có ngày. - Xác nhận nhà cung cấp hoặc cổng hiện tại thật sự liệt kê ID.
- Thử riêng base64, URL và Files API; mỗi cổng có thể hỗ trợ khác nhau.
- Dùng ảnh nhỏ không chứa bí mật, dữ liệu cá nhân, URL nội bộ hay dữ liệu khách hàng.
- Ghi số ảnh, token ảnh, token văn bản, token đầu ra, độ trễ và tính phí.
- Xây bộ test chấm điểm cho OCR, biểu đồ, bố cục và chữ nhỏ.
- Giữ giới hạn quyền cho công cụ, mạng, ghi/xóa tệp, triển khai và thanh toán.
- Chuẩn bị fallback sang
deepseek-v4-flash,deepseek-v4-prohoặc mô hình vision khác vì tuyến còn thử nghiệm.
Kết luận chính
deepseek-v4-flash-vision-explà tuyến API đa phương thức thử nghiệm đang hoạt động, không phải mô hình sinh ảnh.- Nó có ngữ cảnh 1M, đầu ra tối đa 384K và mỗi ảnh không quá 384 token đầu vào.
- Nó hỗ trợ Chat Completions, Anthropic Messages và Responses API; ảnh qua base64, URL hoặc Files API.
- DeepSeek nói hiệu năng agent đa phương thức gần Opus-4.8; bảng cho thấy có cả thắng lẫn thua.
- API trực tiếp cùng giá V4 Flash, còn giá và phạm vi giao thức của cổng bên thứ ba phải kiểm tra riêng.
- Nhãn experimental đòi hỏi kiểm thử chấp nhận, ngân sách và tuyến dự phòng trước production.
Câu hỏi thường gặp
DeepSeek-V4-Flash-Vision-Exp đã chính thức khả dụng chưa?
Có. DeepSeek mở mô hình trên nền tảng API chính thức ngày 21/08/2026. Đây là tuyến thử nghiệm, không phải cam kết hành vi ổn định lâu dài.
ID mô hình chính xác là gì?
Dùng deepseek-v4-flash-vision-exp, giữ nguyên chữ thường và dấu gạch nối thay vì tên hiển thị viết hoa.
Mỗi ảnh luôn dùng 384 token phải không?
Không. Số thực tế theo quy tắc resize và chia ô của DeepSeek. Một ảnh không quá 384 token và nhiều ảnh được tính riêng.
Vision-Exp có thể sinh ảnh không?
DeepSeek chỉ tài liệu hóa khả năng hiểu ảnh, OCR, đọc ảnh chụp và biểu đồ, không xác nhận tạo ảnh gốc.
Nó mạnh hơn V4 Flash bao nhiêu?
Trong bảng chính thức, Vision-Exp cao hơn V4-Flash-0731 ở tám trên chín dòng so sánh trực tiếp và thấp hơn ở Cybergym. Benchmark nhà cung cấp không đảm bảo mọi bài văn bản hoặc kho mã đều cải thiện.
Có thể dùng lại ảnh bằng Files API không?
Có. Tải một lần rồi tham chiếu file_id trong yêu cầu sau. Lưu trữ và tải lên miễn phí, nhưng mô hình vẫn tính token khi xử lý ảnh.
Có dùng được với Codex không?
DeepSeek xác nhận hỗ trợ ảnh trong Responses API, nhưng truyền ảnh qua Codex phụ thuộc phiên bản client, định dạng khối và cổng. Hãy thử riêng văn bản, ảnh đầu vào và ảnh do tool trả về.
Hệ số Vision-Exp trên cổng này là bao nhiêu?
Khi kiểm tra ngày 22/08/2026, ID chưa có trong danh mục giá công khai. Không suy ra nó giống tuyến deepseek-v4-flash; hãy xem bảng giá trực tiếp.
Nguồn chính
- DeepSeek: phát hành V4 Flash Vision Exp: ngày phát hành, ID, định vị, benchmark, định dạng API và Harness 0.1.1
- Hướng dẫn Vision của DeepSeek: phương thức ảnh, cách tính token, định dạng, kích thước và giới hạn
- Mô hình và giá DeepSeek: ngữ cảnh 1M, đầu ra 384K, giá theo giờ, đồng thời 2500 và tính năng
- DeepSeek Files API: tải lên,
file_id, giới hạn tệp và thời hạn - Thông báo chính thức của DeepSeek trên X: thông báo ra mắt gốc