Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

กลับไปที่บล็อก

คู่มือ DeepSeek-V4-Flash-Vision-Exp API 2026

DeepSeek V4 Flash VisionDeepSeek APIเอเจนต์มัลติโหมดVision APIResponses API

DeepSeek เปิดตัวโมเดล API แบบมัลติโหมดอย่างเป็นทางการตัวแรก deepseek-v4-flash-vision-exp เมื่อวันที่ 21 สิงหาคม 2026 โมเดลนี้เพิ่มความเข้าใจภาพให้กับความสามารถด้านข้อความ การให้เหตุผล และเอเจนต์ของ DeepSeek V4 Flash มีหน้าต่างบริบท 1M โทเค็น เอาต์พุตสูงสุด 384K โทเค็น และคิดโทเค็นอินพุตไม่เกิน 384 โทเค็นต่อภาพ ราคา API โดยตรงเท่ากับ V4 Flash

คำต่อท้าย exp หมายถึง experimental หรือรุ่นทดลอง แม้เรียกใช้ผ่าน API ทางการได้แล้ว แต่ไม่ควรอธิบายว่าเป็นรุ่นเสถียรระยะยาว บทความนี้แยก ข้อกำหนดและผลทดสอบที่ DeepSeek เผยแพร่ ตัวอย่างจากบุคคลที่สาม และ สถานะเส้นทางของเกตเวย์นี้ ออกจากกัน ณ วันที่ตรวจสอบ 22 สิงหาคม 2026 แค็ตตาล็อกราคาสาธารณะของเกตเวย์ยังไม่แสดง ID ใหม่ จึงไม่มีการคาดเดาตัวคูณราคา

ตรวจสอบเส้นทางจริงก่อน: ยืนยันว่า deepseek-v4-flash-vision-exp ปรากฏในหน้า ราคาโมเดล แล้วจึงเปิดยอดคงเหลือเล็กน้อยจาก หน้าซื้อ API ความพร้อมใช้งานและรายการคิดเงินจริง ณ เวลาส่งคำขอถือเป็นข้อมูลหลัก

ข้อมูลสำคัญของ DeepSeek-V4-Flash-Vision-Exp

รายการ ข้อมูลที่ประกาศอย่างเป็นทางการ
วันที่เปิดตัว 21 สิงหาคม 2026
ID โมเดลที่ถูกต้อง deepseek-v4-flash-vision-exp
สถานะ โมเดล API มัลติโหมดรุ่นทดลอง
หน้าต่างบริบท 1M โทเค็น
เอาต์พุตสูงสุด 384K โทเค็น
โทเค็นภาพ คำนวณตามขนาด ไม่เกิน 384 โทเค็นต่อภาพ
จำนวนภาพสูงสุดต่อคำขอ 600 ภาพ
วิธีป้อนข้อมูล ข้อความ + ภาพผ่าน base64, URL ภายนอก หรือ file_id ของ Files API
รูปแบบ API Chat Completions, Anthropic Messages และ Responses API
Tool calls รองรับ
โหมดคิด รองรับโหมดคิดและไม่คิด โดยค่าเริ่มต้นใช้โหมดคิด
FIM completion ไม่รองรับ
ขีดจำกัดคำขอพร้อมกันอย่างเป็นทางการ 2500

การเปรียบเทียบ benchmark ทางการระหว่าง DeepSeek V4 Flash Vision Exp, V4 Flash และ Opus-4.8

ที่มา: ประกาศของ DeepSeek วันที่ 21 สิงหาคม 2026 คะแนนเหล่านี้เป็นผลประเมินที่ผู้ให้บริการเผยแพร่ ไม่ใช่การทดสอบอิสระของเว็บไซต์นี้

อ่าน benchmark อย่างไร: ใกล้ Opus-4.8 ไม่ได้แปลว่าชนะทุกข้อ

DeepSeek ระบุว่า V4-Flash-Vision-Exp ก้าวกระโดดเหนือ V4 Flash ใน benchmark ของเอเจนต์มัลติโหมด และประสิทธิภาพโดยรวมใกล้ Opus-4.8 ตารางที่เผยแพร่สนับสนุนแนวทางนี้ แต่ผลรายข้อเป็นแบบชนะบ้างแพ้บ้าง ไม่ใช่เหนือกว่าทั้งหมด

Benchmark Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83.9 82.7 85.0
NL2Repo 57.7 54.2 69.7
Cybergym 75.3 76.7 78.3
DeepSWE 59.3 54.4 58.0
Toolathlon-Verified 75.9 70.3 76.2
DSBench-Hard 63.6 59.6 71.7
AutomationBench (Public) 25.7 25.1 27.2
ApexBench (Pass@1) 36.5 26.2 39.4
Agents' Last Exam 27.3 25.2 25.7
Chartography 64.3 65.0
ZeroBench (Pass@5) 35.0 34.0

Vision-Exp สูงกว่าคะแนน Opus-4.8 ในภาพสำหรับ DeepSWE, Agents' Last Exam และ ZeroBench แต่ต่ำกว่าใน Terminal Bench, NL2Repo และ DSBench-Hard เมื่อเทียบโดยตรงกับ V4-Flash-0731 ได้ 9 รายการ รุ่นใหม่สูงกว่า 8 รายการ โดย Cybergym เป็นข้อยกเว้น

เงื่อนไขการประเมินมีผล DeepSeek ใช้ Harness Minimal Mode สำหรับงาน Code Agent แบบข้อความ ตั้งเอาต์พุตสูงสุด top_p=0.95 และ temperature=1.0 ใน ApexBench และ Agents' Last Exam โมเดล V4 Flash แบบข้อความจะละองค์ประกอบมัลติโหมด จึงไม่ใช่การเปรียบเทียบ vision สองโมเดลภายใต้เงื่อนไขเท่ากัน

ภาพสูงสุด 384 โทเค็นมีค่าใช้จ่ายจริงเท่าไร

DeepSeek ปรับขนาดและแบ่งภาพตามมิติ ก่อนแปลงเป็นโทเค็นอินพุต 384 คือเพดานต่อภาพ ไม่ใช่จำนวนคงที่ หากส่งหลายภาพ แต่ละภาพจะถูกนับแยก ไม่มีเพดานรวม 384 โทเค็นสำหรับทั้งคำขอ

API โดยตรงกำหนดราคา Vision-Exp เท่ากับ V4 Flash:

API โดยตรงของ DeepSeek ช่วงนอกพีก ช่วงพีก
อินพุต cache hit / 1M โทเค็น $0.007 $0.014
อินพุต cache miss / 1M โทเค็น $0.22 $0.44
เอาต์พุต / 1M โทเค็น $0.66 $1.32

ในกรณีเผื่อสูงสุดที่ทุกภาพถึง 384 โทเค็นและคิดเป็นอินพุต cache miss ภาพ 1,000 ภาพมีต้นทุนเฉพาะอินพุตภาพประมาณ $0.0845 นอกพีก หรือ $0.169 ช่วงพีก

หน้าราคาภาษาจีนระบุราคาภูมิภาค CNY 1.50/M นอกพีก และ CNY 3.00/M ช่วงพีกสำหรับ cache miss ด้วยสมมติฐานเดียวกัน:

  • นอกพีก: 384 × 1000 × CNY 1.50 / 1,000,000 = CNY 0.576
  • ช่วงพีก: 384 × 1000 × CNY 3.00 / 1,000,000 = CNY 1.152

ตัวเลขนี้ไม่รวมข้อความอินพุต เอาต์พุตของโมเดล วงรอบเครื่องมือ และการลองใหม่ ตาราง USD กับ CNY เป็นราคาทางการของแต่ละภูมิภาค ไม่ใช่การแปลงอัตราแลกเปลี่ยน บทความไม่ใช้คำกล่าวเปรียบเทียบว่าถูกกว่า 25–50 เท่า เพราะกติกาโทเค็นภาพ ช่วงเวลา และค่าเอาต์พุตของคู่แข่งไม่ได้ตรวจสอบด้วยวิธีเดียวกัน

ยืนยันด้วยบัญชีจริง: หากโมเดลปรากฏในแค็ตตาล็อกของเกตเวย์แล้ว ให้ เติมยอดเล็กน้อย และทดสอบภาพที่ไม่อ่อนไหวหนึ่งภาพ บันทึกโทเค็นภาพ โทเค็นข้อความ เอาต์พุต ความหน่วง และยอดหักจริง

วิธีป้อนภาพสามแบบ

1. Base64 แบบ inline

เข้ารหัส JPEG, PNG, GIF หรือ WebP เป็น data URL เหมาะกับภาพขนาดเล็กหรือภาพส่วนตัวชั่วคราว ขนาดตัวคำขอรวมสูงสุด 48 MiB และภาพเดียวสูงสุด 32 MiB

2. URL ภายนอก

ส่ง URL HTTP(S) ที่ดาวน์โหลดได้แบบสาธารณะ ภาพเดียวสูงสุด 32 MiB และต้องดาวน์โหลดเสร็จใน 60 วินาที หลีกเลี่ยง URL ที่ต้องใช้คุกกี้ เครือข่ายส่วนตัว หรือลายเซ็นอายุสั้นหากยังไม่ทดสอบเส้นทางจริง

3. file_id จาก Files API

อัปโหลดภาพครั้งเดียวแล้วใช้ file_id ซ้ำในหลายคำขอ Files API ทางการใช้งานฟรี รองรับไฟล์สูงสุด 64 MiB และกำหนดอายุได้ตั้งแต่หนึ่งชั่วโมงถึง 30 วัน ช่วยลดแบนด์วิดท์การอัปโหลดงานออกแบบ รายงาน หรือภาพหน้าจอเดิมซ้ำ แต่โทเค็นภาพยังถูกคิดเมื่อโมเดลอ่านไฟล์

ตัวอย่างส่งภาพด้วย Chat Completions

ตัวอย่างขั้นต่ำสำหรับ endpoint ที่เข้ากันได้กับ OpenAI ของ DeepSeek:

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "ตรวจภาพหน้าจอนี้และระบุส่วนหลัก สี และความเสี่ยงของ responsive layout"},
        {"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
      ]
    }]
  }'

Responses API ใช้บล็อก input_image ส่วน Anthropic Messages เรียกได้ผ่าน https://api.deepseek.com/anthropic โครงสร้าง content block ต่างกัน จึงไม่ควรคัดลอก body ของ Chat ไปใช้กับ Responses หรือ Messages โดยไม่ปรับ

สำหรับเกตเวย์นี้ ให้ยืนยัน ID ในแค็ตตาล็อกสดก่อน จากนั้นใช้ Base URL และการยืนยันตัวตนตามเอกสารเกตเวย์ การเปิดใช้บน API ทางการไม่ได้ยืนยันว่าเกตเวย์ภายนอกรองรับภาพ Files API ทุกโปรโตคอล หรือการคิดเงินแล้ว

เวิร์กโฟลว์เอเจนต์มัลติโหมดที่ใช้งานได้จริง

เนื้อหาภาษาจีนที่ผู้ใช้ให้มามีสองตัวอย่าง: สร้างเว็บไซต์จากภาพหน้าจอ และแปลงบรีฟธุรกิจเป็นงานนำเสนอ B2B นี่เป็นการสาธิตของบุคคลที่สาม ไม่ใช่ผลทดสอบของเว็บไซต์ แต่ช่วยอธิบายเวิร์กโฟลว์ได้ดี

จากภาพหน้าจอเป็น HTML

โมเดลต้องแยกเลย์เอาต์ ลำดับชั้น สี ตัวอักษร และระยะห่าง ก่อนให้เครื่องมือเขียน HTML, CSS และ JavaScript การประเมินควรตรวจ visual diff หน้าจอ 375px โฟกัสคีย์บอร์ด hover และ reduced motion ไม่ใช่ดูภาพปลายทางเพียงภาพเดียว

รายงาน สไลด์ และการรีวิวดีไซน์

Vision-Exp อ่านกราฟ OCR ข้อความ สไตล์ภาพ และโครงสร้างหน้า แล้วส่งหลักฐานให้เครื่องมือเอกสาร สไลด์ หรือโค้ดได้ คุณภาพชิ้นงานยังขึ้นกับเฟรมเวิร์กเอเจนต์ เครื่องมือ สินทรัพย์ต้นฉบับ และการตรวจรับ ความเข้าใจภาพอย่างเดียวไม่รับประกันสไลด์พร้อมส่งลูกค้า

การตรวจรับด้วยภาพสำหรับเอเจนต์

เอเจนต์สามารถอ่านภาพหน้าจอหลังขั้นตอนสำคัญในเบราว์เซอร์หรือเดสก์ท็อป แล้วเทียบสถานะจริงกับที่คาดไว้ เพดานโทเค็นต่อภาพช่วยลดค่าอินพุตของการตรวจซ้ำ แต่เอาต์พุตและ tool calls ยังเป็นต้นทุน

หากงานไม่มีภาพ ให้เทียบ คู่มือ DeepSeek V4 Flash และ Responses API ก่อน สำหรับการให้เหตุผลและโค้ดแบบข้อความที่ยากขึ้น ดู คู่มือ DeepSeek-V4-Pro-0813 โมเดล vision ทดลองรุ่นใหม่ไม่จำเป็นต้องแทนที่ทราฟฟิกข้อความทั้งหมดทันที

เข้าใจภาพไม่ใช่สร้างภาพ

เอกสารกำหนด deepseek-v4-flash-vision-exp เป็นโมเดลที่รับข้อความและภาพเพื่อบรรยายภาพ อ่านข้อความในหน้าจอ และวิเคราะห์กราฟ ไม่ได้ระบุว่าเป็นโมเดลสร้างภาพ

ภาพในเว็บไซต์หรือสไลด์ที่ได้อาจมาจาก prompt คลังภาพ โค้ดวาด เครื่องมือสร้างภาพอื่น หรือไฟล์ของเอเจนต์ ผลลัพธ์ที่มีภาพไม่ได้พิสูจน์ว่า Vision-Exp สร้างภาพนั้นเอง

เช็กลิสต์ก่อนใช้ใน production

  1. ใช้ ID deepseek-v4-flash-vision-exp ให้ตรง ห้ามเดา alias ที่มีวันที่
  2. ยืนยันว่าผู้ให้บริการหรือเกตเวย์ปัจจุบันแสดง ID ในแค็ตตาล็อกจริง
  3. ทดสอบ base64, URL และ Files API แยกกัน เพราะการรองรับอาจต่างกัน
  4. ใช้ภาพเล็กที่ไม่มีความลับ ข้อมูลส่วนบุคคล URL ภายใน หรือข้อมูลลูกค้า
  5. บันทึกจำนวนภาพ โทเค็นภาพ/ข้อความ/เอาต์พุต ความหน่วง และยอดเรียกเก็บ
  6. สร้างชุดทดสอบให้คะแนนได้สำหรับ OCR กราฟ เลย์เอาต์ และตัวอักษรเล็ก
  7. จำกัดสิทธิ์เครื่องมือ เครือข่าย การเขียน/ลบไฟล์ การ deploy และการชำระเงิน
  8. เตรียม fallback ไป deepseek-v4-flash, deepseek-v4-pro หรือ vision รุ่นอื่น เพราะเส้นทางยังทดลอง

สรุปสำคัญ

  • deepseek-v4-flash-vision-exp เป็นเส้นทาง API มัลติโหมดรุ่นทดลอง ไม่ใช่โมเดลสร้างภาพ
  • มีบริบท 1M เอาต์พุตสูงสุด 384K และภาพละไม่เกิน 384 โทเค็นอินพุต
  • รองรับ Chat Completions, Anthropic Messages และ Responses API โดยส่งภาพผ่าน base64, URL หรือ Files API
  • DeepSeek ระบุว่าประสิทธิภาพเอเจนต์ใกล้ Opus-4.8 แต่ตารางมีทั้งผลชนะและแพ้
  • API โดยตรงราคาเท่ากับ V4 Flash ส่วนราคาและโปรโตคอลของเกตเวย์ต้องตรวจแยก
  • ป้าย experimental ทำให้ต้องมีการทดสอบ งบประมาณ และเส้นทางสำรองก่อน production

คำถามที่พบบ่อย

DeepSeek-V4-Flash-Vision-Exp เปิดใช้อย่างเป็นทางการแล้วหรือยัง

เปิดแล้วบน API ทางการตั้งแต่ 21 สิงหาคม 2026 แต่ยังเป็นเส้นทางทดลอง ไม่ใช่คำรับรองความเสถียรระยะยาว

ID โมเดลที่ถูกต้องคืออะไร

ใช้ deepseek-v4-flash-vision-exp ตัวพิมพ์เล็กและมีขีดกลางตามนี้ ไม่ใช้ชื่อแสดงผลตัวพิมพ์ใหญ่

ทุกภาพใช้ 384 โทเค็นคงที่หรือไม่

ไม่ จำนวนจริงขึ้นกับการปรับขนาดและแบ่งภาพ 384 คือค่าสูงสุดต่อภาพ และหลายภาพนับแยกกัน

Vision-Exp สร้างภาพได้หรือไม่

DeepSeek ระบุความเข้าใจภาพ OCR ภาพหน้าจอ และกราฟ แต่ไม่ได้ระบุการสร้างภาพในตัว

แรงกว่า V4 Flash แค่ไหน

จากตารางทางการ Vision-Exp สูงกว่า V4-Flash-0731 ใน 8 จาก 9 แถวที่เทียบตรงได้ และต่ำกว่าใน Cybergym benchmark ผู้ผลิตไม่ได้รับประกันว่างานข้อความหรือ repository ทุกงานจะดีขึ้น

ใช้ภาพเดิมซ้ำผ่าน Files API ได้หรือไม่

ได้ อัปโหลดครั้งเดียวแล้วอ้าง file_id ภายหลัง Files API ฟรี แต่เมื่อโมเดลประมวลผลภาพยังคิดโทเค็นภาพ

ใช้กับ Codex ได้หรือไม่

DeepSeek ยืนยันภาพใน Responses API แต่การส่งผ่าน Codex ขึ้นกับเวอร์ชันไคลเอนต์ รูปแบบบล็อก และเกตเวย์ ควรทดสอบข้อความ ภาพอินพุต และภาพจากผลเครื่องมือแยกกัน

ตัวคูณ Vision-Exp บนเกตเวย์นี้เท่าไร

เมื่อเช็กวันที่ 22 สิงหาคม 2026 ยังไม่มี ID ในแค็ตตาล็อกราคาสาธารณะ ห้ามอนุมานว่าเท่ากับ deepseek-v4-flash; ดู ราคาโมเดลสด

แหล่งข้อมูลหลัก