Panduan DeepSeek-V4-Flash-Vision-Exp API 2026
DeepSeek melancarkan model API multimodal rasmi pertamanya, deepseek-v4-flash-vision-exp, pada 21 Ogos 2026. Model ini menambah pemahaman imej kepada keupayaan teks, penaakulan dan ejen DeepSeek V4 Flash, dengan tetingkap konteks 1M token, output sehingga 384K token dan caj maksimum 384 token input bagi setiap imej. Harga API langsung DeepSeek adalah sama dengan V4 Flash.
Akhiran exp bermaksud experimental atau percubaan. Laluan ini sudah boleh dipanggil melalui API rasmi, tetapi tidak patut digambarkan sebagai keluaran stabil jangka panjang. Panduan ini memisahkan spesifikasi dan benchmark rasmi DeepSeek, contoh pihak ketiga dan status laluan pada gerbang ini. Semasa disemak pada 22 Ogos 2026, katalog harga awam gerbang belum menyenaraikan ID baharu, maka tiada pengganda gerbang yang diteka.
Semak laluan secara langsung dahulu: pastikan
deepseek-v4-flash-vision-expmuncul dalam harga model, kemudian barulah buka baki kecil melalui halaman pembelian API. Ketersediaan dan rekod bil pada masa permintaan tetap menjadi rujukan utama.
Statistik utama DeepSeek-V4-Flash-Vision-Exp
| Perkara | Maklumat rasmi yang diterbitkan |
|---|---|
| Tarikh pelancaran | 21 Ogos 2026 |
| ID model tepat | deepseek-v4-flash-vision-exp |
| Status keluaran | Model API multimodal percubaan |
| Tetingkap konteks | 1M token |
| Output maksimum | 384K token |
| Penggunaan token imej | Mengikut dimensi; tidak lebih 384 token bagi setiap imej |
| Imej maksimum setiap permintaan | 600 |
| Kaedah input | Teks + imej melalui base64, URL luar atau file_id Files API |
| Format API | Chat Completions, Anthropic Messages dan Responses API |
| Tool calls | Disokong |
| Mod penaakulan | Mod berfikir dan tanpa berfikir; berfikir ialah lalai |
| FIM completion | Tidak disokong |
| Had konkurensi rasmi | 2500 |

Sumber: pelancaran DeepSeek pada 21 Ogos 2026. Ini ialah penilaian terbitan vendor, bukan ujian bebas oleh laman ini.
Analisis benchmark: hampir kepada Opus-4.8 bukan bermakna menang semuanya
DeepSeek menyatakan V4-Flash-Vision-Exp meningkat besar berbanding V4 Flash pada benchmark ejen multimodal dan prestasi keseluruhan hampir kepada Opus-4.8. Jadual rasmi menyokong kedudukan itu, tetapi keputusan mengikut ujian adalah bercampur, bukannya kemenangan menyeluruh.
| Benchmark | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-Exp mengatasi skor Opus-4.8 yang dipaparkan pada DeepSWE, Agents' Last Exam dan ZeroBench, namun ketinggalan pada Terminal Bench, NL2Repo dan DSBench-Hard. Daripada sembilan baris yang boleh dibandingkan terus dengan V4-Flash-0731, ia lebih tinggi pada lapan; Cybergym ialah pengecualian.
Keadaan penilaian juga penting. DeepSeek menjalankan tugasan Code Agent teks awam menggunakan Harness Minimal Mode, output maksimum, top_p=0.95 dan temperature=1.0. Pada ApexBench dan Agents' Last Exam, V4 Flash teks sahaja mengabaikan unsur multimodal, jadi baris tersebut bukan perbandingan sama rata antara dua model vision.
Berapakah kos sebenar imej maksimum 384 token?
DeepSeek mengubah saiz dan membahagi imej mengikut dimensinya, kemudian menukarnya kepada token input. 384 ialah had maksimum satu imej, bukan angka tetap. Beberapa imej dikira secara berasingan; tiada satu had bersama 384 token bagi seluruh permintaan.
API langsung menyenaraikan Vision-Exp pada harga yang sama dengan V4 Flash:
| API langsung DeepSeek | Luar waktu puncak | Waktu puncak |
|---|---|---|
| Input cache hit / 1M token | $0.007 | $0.014 |
| Input cache miss / 1M token | $0.22 | $0.44 |
| Output / 1M token | $0.66 | $1.32 |
Dalam andaian konservatif bahawa setiap imej mencapai 384 token dan dicaj sebagai input cache miss, 1,000 imej berharga kira-kira $0.0845 di luar waktu puncak atau $0.169 pada waktu puncak untuk input imej sahaja.
Halaman harga bahasa Cina DeepSeek menyenaraikan kadar rantau CNY 1.50/M di luar puncak dan CNY 3.00/M pada waktu puncak untuk input cache miss. Dengan andaian maksimum yang sama:
- luar waktu puncak:
384 × 1000 × CNY 1.50 / 1,000,000 = CNY 0.576; - waktu puncak:
384 × 1000 × CNY 3.00 / 1,000,000 = CNY 1.152.
Ini tidak termasuk input teks, output model, gelung alat dan percubaan semula. Jadual USD dan CNY ialah harga rasmi rantau, bukannya penukaran kadar tukaran langsung. Kami juga tidak mengulang perbandingan pihak ketiga 25–50 kali lebih murah kerana peraturan token imej, peringkat masa dan caj output pesaing belum disahkan dengan metodologi yang sama.
Sahkan melalui lejar sebenar: jika model muncul dalam katalog langsung gerbang, buat tambah nilai kecil dan uji satu imej tidak sensitif. Rekod token imej, token teks, output, kependaman dan caj sebenar.
Tiga kaedah input imej
1. Base64 sebaris
Kodkan JPEG, PNG, GIF atau WebP sebagai data URL. Ia sesuai untuk imej kecil atau imej sementara peribadi. Badan permintaan sebaris terhad kepada 48 MiB, dan satu imej kepada 32 MiB.
2. URL luar
Berikan URL HTTP(S) yang boleh dimuat turun secara umum. Satu imej terhad kepada 32 MiB dan muat turun mesti selesai dalam 60 saat. Elakkan pautan yang memerlukan cookie, rangkaian peribadi atau tandatangan singkat melainkan laluan sebenar telah diuji.
3. file_id Files API
Muat naik imej sekali dan gunakan semula file_id dalam beberapa permintaan. Files API rasmi adalah percuma, menerima fail sehingga 64 MiB dan membenarkan tempoh luput antara satu jam hingga 30 hari. Ia mengurangkan muat naik berulang untuk reka bentuk, laporan atau tangkapan skrin yang sama; token imej masih dicaj apabila model membaca fail.
Permintaan imej Chat Completions
Contoh minimum untuk endpoint langsung DeepSeek yang serasi OpenAI:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Periksa tangkapan skrin halaman ini dan senaraikan bahagian utama, warna serta risiko reka bentuk responsif."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
Responses API menggunakan blok input_image, manakala Anthropic Messages boleh menggunakan https://api.deepseek.com/anthropic. Skema blok kandungan berbeza, jadi jangan salin badan Chat ke Responses atau Messages tanpa perubahan.
Untuk gerbang ini, sahkan dahulu bahawa ID tepat ada dalam katalog langsung, kemudian gunakan Base URL dan kaedah pengesahan yang didokumenkan. Ketersediaan rasmi DeepSeek tidak membuktikan setiap gerbang pihak ketiga sudah mengaktifkan penghantaran imej, Files API, semua protokol atau bil.
Aliran kerja ejen multimodal yang praktikal
Bahan bahasa Cina yang diberikan menerangkan dua contoh: membina semula laman daripada tangkapan skrin dan menukar ringkasan perniagaan umum kepada pembentangan B2B. Itu demonstrasi pihak ketiga, bukan ujian bebas laman ini, tetapi berguna untuk menerangkan corak kerja.
Tangkapan skrin kepada HTML
Model perlu mengenal pasti susun atur, hierarki, warna, tipografi dan jarak sebelum alat pengekodan menghasilkan HTML, CSS dan JavaScript. Penilaian sebenar harus membandingkan visual diff, paparan 375px, fokus papan kekunci, keadaan hover dan reduced motion, bukan hanya satu tangkapan skrin akhir.
Laporan, slaid dan semakan reka bentuk
Vision-Exp boleh membaca carta, teks OCR, gaya visual dan struktur halaman, lalu menyerahkan bukti kepada alat dokumen, pembentangan atau kod. Mutu hasil masih bergantung pada rangka kerja ejen, alat, aset sumber dan proses penerimaan; memahami imej sahaja tidak menjamin slaid sedia dihantar kepada pelanggan.
Penerimaan visual untuk ejen
Ejen boleh menyemak tangkapan skrin selepas tindakan penting dalam pelayar atau desktop dan membandingkan keadaan yang dilihat dengan hasil yang dijangka. Had token imej merendahkan kos input untuk semakan berulang, tetapi output dan tool calls kekal dalam jumlah bajet.
Bagi beban kerja tanpa imej, bandingkan dahulu panduan DeepSeek V4 Flash dan Responses API. Untuk penaakulan dan coding teks yang lebih sukar, baca panduan DeepSeek-V4-Pro-0813. Laluan vision percubaan yang baharu bukan alasan untuk memindahkan semua permintaan teks serta-merta.
Pemahaman imej bukan penjanaan imej
Dokumentasi mentakrifkan deepseek-v4-flash-vision-exp sebagai model yang menerima teks dan imej untuk menghuraikan gambar, membaca teks tangkapan skrin dan menganalisis carta. Ia tidak disenaraikan sebagai model penjana imej.
Imej dalam laman atau dek yang dihasilkan mungkin datang daripada prompt, stok, kod lukisan, alat penjana imej lain atau fail ejen. Hasil visual tidak membuktikan Vision-Exp menjana imej tersebut.
Senarai semak sebelum production
- Gunakan ID tepat
deepseek-v4-flash-vision-exp; jangan cipta alias bertarikh. - Sahkan pembekal atau gerbang semasa benar-benar menyenaraikan ID dalam katalog langsung.
- Uji base64, URL dan Files API secara berasingan; sokongan gerbang boleh berbeza.
- Gunakan imej kecil tanpa rahsia, data peribadi, URL dalaman atau data pelanggan.
- Log jumlah imej, token imej dan teks, output, kependaman serta bil.
- Bina ujian berskor untuk OCR, carta, susun atur dan teks kecil.
- Hadkan kebenaran alat, rangkaian, tulis/padam fail, deployment dan pembayaran.
- Sediakan fallback ke
deepseek-v4-flash,deepseek-v4-proatau model vision lain kerana laluan ini percubaan.
Rumusan utama
deepseek-v4-flash-vision-expialah laluan API multimodal percubaan yang aktif, bukan penjana imej.- Ia menawarkan konteks 1M, output maksimum 384K dan tidak lebih 384 token input bagi setiap imej.
- Ia menyokong Chat Completions, Anthropic Messages dan Responses API; imej melalui base64, URL atau Files API.
- DeepSeek menyatakan prestasi ejen hampir kepada Opus-4.8; jadual menunjukkan kemenangan dan kekalahan.
- API langsung berharga sama dengan V4 Flash, tetapi harga dan liputan protokol gerbang pihak ketiga perlu diperiksa sendiri.
- Label experimental memerlukan ujian penerimaan, bajet dan laluan sandaran sebelum production.
Soalan lazim
Adakah DeepSeek-V4-Flash-Vision-Exp tersedia secara rasmi?
Ya. DeepSeek melancarkannya di platform API rasmi pada 21 Ogos 2026. Ia masih laluan percubaan, bukan janji kelakuan stabil jangka panjang.
Apakah ID model yang tepat?
Gunakan deepseek-v4-flash-vision-exp dalam huruf kecil dan tanda sempang seperti ditunjukkan, bukan nama paparan berhuruf besar.
Adakah setiap imej sentiasa menggunakan 384 token?
Tidak. Bilangan sebenar mengikut peraturan ubah saiz dan pembahagian. Satu imej tidak melebihi 384 token dan beberapa imej dikira secara berasingan.
Bolehkah Vision-Exp menjana imej?
DeepSeek mendokumenkan pemahaman imej, OCR, pembacaan tangkapan skrin dan analisis carta, bukan penjanaan imej natif.
Sejauh mana ia lebih kuat daripada V4 Flash?
Dalam jadual rasmi, Vision-Exp lebih tinggi daripada V4-Flash-0731 pada lapan daripada sembilan baris yang boleh dibandingkan terus dan lebih rendah pada Cybergym. Benchmark vendor tidak menjamin setiap tugasan teks atau repositori bertambah baik.
Bolehkah imej digunakan semula melalui Files API?
Ya. Muat naik sekali dan rujuk file_id kemudian. Muat naik dan penyimpanan adalah percuma, tetapi token imej masih dicaj apabila diproses.
Bolehkah ia digunakan dengan Codex?
DeepSeek mengesahkan imej dalam Responses API, tetapi penghantaran melalui Codex bergantung pada versi klien, format blok dan gerbang. Uji teks, input imej dan imej hasil alat secara berasingan.
Berapakah pengganda Vision-Exp pada gerbang ini?
Semasa disemak pada 22 Ogos 2026, ID itu belum disenaraikan dalam katalog harga awam. Jangan anggap ia sama dengan deepseek-v4-flash; rujuk harga model langsung.
Sumber utama
- DeepSeek: pelancaran V4 Flash Vision Exp: tarikh, ID, kedudukan, benchmark, format API dan Harness 0.1.1
- Panduan DeepSeek Vision: kaedah imej, pengiraan token, format, saiz dan had
- Model dan harga DeepSeek: konteks 1M, output 384K, harga mengikut masa, konkurensi 2500 dan ciri
- DeepSeek Files API: muat naik,
file_id, saiz dan tempoh luput - Pengumuman rasmi DeepSeek di X: pengumuman pelancaran asal