دليل DeepSeek-V4-Flash-Vision-Exp API لعام 2026
أطلقت DeepSeek في 21 أغسطس 2026 أول نموذج رسمي متعدد الوسائط عبر API، وهو deepseek-v4-flash-vision-exp. يضيف النموذج فهم الصور إلى قدرات النص والاستدلال والوكلاء في DeepSeek V4 Flash، مع نافذة سياق تبلغ 1M رمز، ومخرجات تصل إلى 384K رمز، وبحد أقصى 384 رمز إدخال لكل صورة. وسعره في واجهة DeepSeek المباشرة مطابق لسعر V4 Flash.
تعني اللاحقة exp أن الإصدار experimental، أي تجريبي. يمكن استدعاء المسار عبر API الرسمي الآن، لكن لا ينبغي تقديمه على أنه إصدار مستقر طويل الأجل. يفصل هذا الدليل بين المواصفات والاختبارات التي نشرتها DeepSeek وأمثلة الجهات الخارجية وحالة المسار في هذه البوابة. وحتى مراجعة 22 أغسطس 2026 لم يكن المعرّف الجديد مدرجًا في كتالوج الأسعار العام للبوابة، لذلك لا نفترض له معامل تسعير.
تحقق من المسار المباشر أولًا: تأكد من ظهور
deepseek-v4-flash-vision-expفي صفحة أسعار النماذج، ثم ابدأ برصيد صغير من صفحة شراء API. التوفر وسجل الفوترة الفعلي وقت الطلب هما المرجع النهائي.
أهم مواصفات DeepSeek-V4-Flash-Vision-Exp
| البند | المعلومات المنشورة رسميًا |
|---|---|
| تاريخ الإطلاق | 21 أغسطس 2026 |
| معرّف النموذج الدقيق | deepseek-v4-flash-vision-exp |
| حالة الإصدار | نموذج API تجريبي متعدد الوسائط |
| نافذة السياق | 1M رمز |
| الحد الأقصى للمخرجات | 384K رمز |
| رموز الصورة | بحسب الأبعاد؛ لا تتجاوز 384 رمزًا للصورة |
| الحد الأقصى للصور في الطلب | 600 صورة |
| طرق الإدخال | نص + صورة عبر base64 أو رابط خارجي أو file_id من Files API |
| صيغ API | Chat Completions وAnthropic Messages وResponses API |
| استدعاء الأدوات | مدعوم |
| أوضاع التفكير | التفكير وعدم التفكير؛ التفكير هو الافتراضي |
| إكمال FIM | غير مدعوم |
| حد التزامن الرسمي | 2500 |

المصدر: إعلان DeepSeek بتاريخ 21 أغسطس 2026. هذه نتائج نشرها المورّد وليست اختبارات مستقلة أجراها هذا الموقع.
قراءة النتائج: الاقتراب من Opus-4.8 لا يعني التفوق في كل اختبار
تقول DeepSeek إن V4-Flash-Vision-Exp حقق قفزة كبيرة على V4 Flash في اختبارات الوكلاء متعددة الوسائط، وإن أداءه الإجمالي قريب من Opus-4.8. يدعم الجدول المنشور هذا الوصف، لكن النتائج التفصيلية تظهر مزيجًا من الفوز والخسارة لا تفوقًا شاملًا.
| الاختبار | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
يتفوق Vision-Exp على النتيجة المعروضة لـ Opus-4.8 في DeepSWE وAgents' Last Exam وZeroBench، لكنه يتأخر في Terminal Bench وNL2Repo وDSBench-Hard. ومن تسعة صفوف قابلة للمقارنة مباشرة مع V4-Flash-0731، يتقدم في ثمانية؛ والاستثناء هو Cybergym.
كما تهم شروط التقييم. شغّلت DeepSeek مهام Code Agent النصية العامة عبر Harness Minimal Mode، مع أقصى مخرجات وtop_p=0.95 وtemperature=1.0. وفي ApexBench وAgents' Last Exam يتجاهل V4 Flash النصي العناصر متعددة الوسائط، لذلك ليست هذه مقارنة متكافئة بين نموذجي رؤية.
ما التكلفة الفعلية لصورة يصل حدها إلى 384 رمزًا؟
تغيّر DeepSeek حجم الصورة وتجزئها بحسب أبعادها، ثم تحولها إلى رموز إدخال. الرقم 384 حد أقصى للصورة الواحدة وليس عددًا ثابتًا. وعند إرسال صور متعددة تُحسب كل صورة بصورة مستقلة؛ فلا يوجد سقف مشترك قدره 384 رمزًا للطلب كله.
تسعّر واجهة DeepSeek المباشرة Vision-Exp مثل V4 Flash:
| API المباشر من DeepSeek | خارج الذروة | وقت الذروة |
|---|---|---|
| إدخال مع إصابة الذاكرة المؤقتة / 1M رمز | $0.007 | $0.014 |
| إدخال دون إصابة الذاكرة المؤقتة / 1M رمز | $0.22 | $0.44 |
| مخرجات / 1M رمز | $0.66 | $1.32 |
في السيناريو المتحفظ الذي تصل فيه كل صورة إلى 384 رمزًا وتُحسب كإدخال غير مصاب للذاكرة المؤقتة، تبلغ كلفة إدخال 1000 صورة وحدها نحو $0.0845 خارج الذروة أو $0.169 في الذروة.
تدرج صفحة الأسعار الصينية أسعار المنطقة بقيمة CNY 1.50/M خارج الذروة وCNY 3.00/M في الذروة للإدخال غير المصاب. وبنفس افتراض الحد الأقصى:
- خارج الذروة:
384 × 1000 × CNY 1.50 / 1,000,000 = CNY 0.576؛ - وقت الذروة:
384 × 1000 × CNY 3.00 / 1,000,000 = CNY 1.152.
لا تشمل هذه الأرقام النص المدخل أو مخرجات النموذج أو دورات الأدوات أو إعادة المحاولة. جداول الدولار واليوان أسعار إقليمية رسمية وليست تحويلًا بسعر الصرف. ولا نكرر الادعاء الخارجي بفرق 25 إلى 50 مرة لأن قواعد رموز الصور والفترات الزمنية ورسوم المخرجات لدى المنافسين لم تُراجع بمنهجية موحدة.
تحقق بسجل حقيقي: إذا ظهر النموذج في كتالوج البوابة، قم بشحن مبلغ صغير واختبر صورة واحدة غير حساسة. سجّل رموز الصورة والنص والمخرجات وزمن الاستجابة والتكلفة الفعلية.
ثلاث طرق لإدخال الصور
1. base64 داخل الطلب
يمكن ترميز JPEG أو PNG أو GIF أو WebP في data URL. يناسب ذلك الصور الصغيرة أو الخاصة والمؤقتة. الحد الأقصى لجسم الطلب المضمّن 48 MiB، وللصورة الواحدة 32 MiB.
2. رابط خارجي
أدخل رابط HTTP(S) قابلًا للتنزيل علنًا. الحد الأقصى للصورة 32 MiB ويجب إكمال التنزيل خلال 60 ثانية. تجنب الروابط التي تحتاج إلى ملفات تعريف ارتباط أو شبكة خاصة أو توقيع قصير العمر ما لم تختبر المسار نفسه.
3. file_id من Files API
ارفع الصورة مرة واحدة ثم أعد استخدام file_id في طلبات متعددة. Files API الرسمي مجاني، يقبل ملفات حتى 64 MiB، ويسمح بفترة صلاحية من ساعة إلى 30 يومًا. يقلل ذلك تكرار رفع التصميم أو التقرير أو لقطة الشاشة نفسها، لكن رموز الصورة تُحسب عندما يقرأ النموذج الملف.
مثال صورة عبر Chat Completions
هذا طلب أدنى إلى نقطة DeepSeek المباشرة المتوافقة مع OpenAI:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "افحص لقطة الصفحة وحدد أقسامها الرئيسية وألوانها ومخاطر التصميم المتجاوب."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
تستخدم Responses API كتل input_image، بينما يمكن استدعاء Anthropic Messages عبر https://api.deepseek.com/anthropic. تختلف مخططات كتل المحتوى، لذلك لا تنسخ جسم طلب Chat كما هو إلى Responses أو Messages.
في هذه البوابة، تأكد أولًا من ظهور المعرّف الدقيق في الكتالوج المباشر، ثم استخدم Base URL وطريقة المصادقة الموثقة للبوابة. إتاحة النموذج رسميًا لا تثبت أن كل بوابة خارجية فعّلت تمرير الصور وFiles API وجميع البروتوكولات والفوترة.
مسارات عمل عملية للوكلاء متعددي الوسائط
تتضمن المادة الصينية التي زوّدنا بها المستخدم مثالين: إعادة بناء موقع من لقطة شاشة، وتحويل موجز عمل عام إلى عرض B2B. هذه عروض خارجية وليست اختبارات مستقلة للموقع، لكنها توضح أنماط استخدام عملية.
من لقطة الشاشة إلى HTML
يحتاج النموذج إلى فهم التخطيط والتسلسل البصري والألوان والخطوط والمسافات قبل أن ينشئ وسيط برمجي HTML وCSS وJavaScript. ينبغي أن يقيس الاختبار فرق الصورة، وعرض 375px، وتركيز لوحة المفاتيح، وحالات hover، ووضع تقليل الحركة بدل الاكتفاء بصورة نهائية واحدة.
التقارير والعروض ومراجعة التصميم
يستطيع Vision-Exp قراءة المخططات والنص عبر OCR والأسلوب البصري وبنية الصفحة، ثم تمرير الأدلة إلى أدوات المستندات أو الشرائح أو البرمجة. تظل جودة التسليم مرتبطة بإطار الوكيل والأدوات والأصول المصدرية ومعايير القبول؛ فهم الصورة وحده لا يضمن عرضًا جاهزًا للعميل.
التحقق البصري للوكلاء
يمكن للوكيل قراءة لقطات الشاشة بعد إجراءات مهمة في المتصفح أو سطح المكتب ومقارنة الحالة المرصودة بالنتيجة المتوقعة. يخفض سقف رموز الصورة تكلفة الإدخال للفحص المتكرر، لكن المخرجات واستدعاءات الأدوات تبقى ضمن الميزانية.
إذا كانت المهمة بلا صور، فقارن أولًا دليل DeepSeek V4 Flash وResponses API. وللاستدلال والبرمجة النصية الأصعب، راجع دليل DeepSeek-V4-Pro-0813. ظهور مسار رؤية تجريبي ليس سببًا لنقل كل الطلبات النصية إليه فورًا.
فهم الصور ليس توليد الصور
تعرّف وثائق DeepSeek deepseek-v4-flash-vision-exp كنموذج يستقبل النص والصور لوصفها وقراءة نص لقطات الشاشة وتحليل المخططات. ولا تدرجه كنموذج لتوليد الصور.
قد تأتي الصور داخل موقع أو عرض مولّد من الطلب أو مكتبة صور أو كود رسم أو أداة توليد أخرى أو ملفات متاحة للوكيل. وجود صور في المنتج النهائي لا يثبت أن Vision-Exp ولّدها.
قائمة فحص قبل الإنتاج
- استخدم المعرّف الدقيق
deepseek-v4-flash-vision-expولا تخترع اسمًا بديلًا مؤرخًا. - تأكد من أن المورّد أو البوابة الحالية تسرد المعرّف فعليًا في الكتالوج المباشر.
- اختبر base64 والرابط وFiles API بصورة منفصلة؛ فقد تختلف تغطية البوابات.
- استخدم صورة صغيرة بلا أسرار أو بيانات شخصية أو روابط داخلية أو معلومات عملاء.
- سجّل عدد الصور ورموز الصورة والنص والمخرجات وزمن الاستجابة والفاتورة.
- أنشئ اختبارات قابلة للتقييم لـ OCR والمخططات والتخطيط والنص الصغير.
- قيّد صلاحيات الأدوات والشبكة وكتابة/حذف الملفات والنشر والمدفوعات.
- جهّز مسارًا احتياطيًا إلى
deepseek-v4-flashأوdeepseek-v4-proأو نموذج رؤية آخر لأن هذا المسار تجريبي.
الخلاصات الرئيسية
deepseek-v4-flash-vision-expمسار API تجريبي متعدد الوسائط، وليس مولد صور.- يوفر سياق 1M ومخرجات حتى 384K، وبحد أقصى 384 رمز إدخال للصورة الواحدة.
- يدعم Chat Completions وAnthropic Messages وResponses API، عبر base64 أو URL أو Files API.
- تقول DeepSeek إن أداء الوكلاء قريب من Opus-4.8؛ ويعرض الجدول حالات تفوق وتأخر.
- سعر API المباشر يطابق V4 Flash، أما سعر البوابة الخارجية وتغطية البروتوكولات فيلزم التحقق منهما منفصلًا.
- تتطلب صفة experimental اختبارات قبول وميزانية ومسارًا احتياطيًا قبل الإنتاج.
الأسئلة الشائعة
هل أصبح DeepSeek-V4-Flash-Vision-Exp متاحًا رسميًا؟
نعم. أطلقته DeepSeek على منصة API الرسمية في 21 أغسطس 2026. لكنه مسار تجريبي، وليس ضمانًا لسلوك مستقر طويل الأجل.
ما معرّف النموذج الدقيق؟
استخدم deepseek-v4-flash-vision-exp بحروف صغيرة وواصلات كما هو، لا اسم العرض ذي الأحرف الكبيرة.
هل تستهلك كل صورة 384 رمزًا دائمًا؟
لا. العدد الفعلي يتبع قواعد تغيير الحجم والتقسيم. لا تتجاوز الصورة 384 رمزًا، وتُحسب الصور المتعددة بصورة مستقلة.
هل يستطيع Vision-Exp توليد الصور؟
توثق DeepSeek فهم الصور وOCR وقراءة لقطات الشاشة وتحليل المخططات، ولا توثق توليد صور أصليًا.
ما مقدار تفوقه على V4 Flash؟
في الجدول الرسمي يتفوق Vision-Exp على V4-Flash-0731 في ثمانية من تسعة صفوف قابلة للمقارنة مباشرة، ويتأخر في Cybergym. ولا تضمن اختبارات المورّد تحسن كل مهمة نصية أو مستودع.
هل يمكن إعادة استخدام الصورة عبر Files API؟
نعم. ارفعها مرة واحدة واستخدم file_id لاحقًا. الرفع والتخزين مجانيان، لكن معالجة الصورة تظل تستهلك رموزًا مدفوعة.
هل يمكن استخدامه مع Codex؟
تؤكد DeepSeek دعم الصور في Responses API، لكن النقل عبر Codex يعتمد على إصدار العميل وصيغة الكتل والبوابة. اختبر النص والصورة المدخلة وصور نتائج الأدوات منفصلة.
ما معامل Vision-Exp في هذه البوابة؟
حتى مراجعة 22 أغسطس 2026 لم يكن المعرّف مدرجًا في كتالوج الأسعار العام. لا تفترض أنه يطابق deepseek-v4-flash؛ راجع الأسعار المباشرة للنماذج.
المصادر الأساسية
- DeepSeek: إطلاق V4 Flash Vision Exp: التاريخ والمعرّف والتموضع والاختبارات وصيغ API وHarness 0.1.1
- دليل DeepSeek للرؤية: طرق الصور وحساب الرموز والصيغ والأحجام والحدود
- نماذج DeepSeek وأسعارها: سياق 1M ومخرجات 384K والأسعار الزمنية والتزامن 2500 والميزات
- DeepSeek Files API: الرفع و
file_idوالحجم وانتهاء الصلاحية - إعلان DeepSeek الرسمي على X: إعلان الإطلاق الأصلي