Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

العودة إلى المدونة

إطلاق النموذج متعدد الوسائط بالكامل Qwen3.8-Omni-Flash: دليل القدرات وواجهة API ووكلاء الصوت والفيديو

Qwen3.8-Omni-Flashنموذج متعدد الوسائط بالكاملواجهة API متعددة الوسائطوكلاء الصوت والفيديوQwen API

أصبح النموذج متعدد الوسائط بالكامل Qwen3.8-Omni-Flash متاحًا رسميًا. فهو يضع النصوص والصور والصوت والفيديو ضمن سير عمل واحد للوكيل، ولا يقتصر هدفه على «فهم المحتوى»، بل يمتد من فهم المواد والتخطيط للمهام واستدعاء الأدوات إلى تسليم النتائج. بالنسبة إلى المطورين الذين يحتاجون إلى معالجة الفيديوهات الطويلة وتسجيلات الاجتماعات ومقاطع الموسيقى والمواد السينمائية، ينصب تركيز هذا الإطلاق على وكلاء الصوت والفيديو، وليس على نموذج متعدد الوسائط آخر يقتصر على المحادثة.

أُعد هذا المقال استنادًا إلى المواد المنشورة في الحساب الرسمي لـ Qwen على WeChat، مع الإبقاء على صور الإطلاق والعروض التوضيحية الواردة في النص الأصلي؛ أما أرقام التقييمات الواردة في المقال فهي نتائج أفصحت عنها الجهة الرسمية وليست إعادة اختبار مستقلة من موقعنا. ويُرجى الرجوع إلى أسعار النماذج الفورية والفاتورة الفعلية لمعرفة ما إذا كان النموذج قد ظهر في دليل موقعنا، وكذلك معامل التسعير الفعلي والخصم.

النموذج متعدد الوسائط بالكامل Qwen3.8-Omni-Flash وسيناريوهات تطبيقه في بيئات الإنتاج

ما الإدخالات التي يدعمها Qwen3.8-Omni-Flash؟

العنصر المعلومات الواردة في مواد الإطلاق
اسم النموذج Qwen3.8-Omni-Flash
وسائط الإدخال النصوص والصور والصوت والفيديو
السياق تسلسل يصل إلى 1M Tokens
المجالات الرئيسية وكلاء الصوت والفيديو، البرمجة، العمل المعرفي النصي، تشغيل واجهات GUI
المهام طويلة المدى فهم الصوت والفيديو طويلَي المدة، محاضر الاجتماعات وعناصر المهام، تقارير أبحاث الفيديو، إنشاء المحتوى
الأدوات المصاحبة Qwen-MM-Plugins، Qwen-Live Harness

يجب تحديد معرّف نموذج API الفعلي والبروتوكول وحدود السياق والتوافر الإقليمي بالرجوع إلى الوثائق الحالية لمقدم الخدمة. لا تفترض أن جميع البوابات المتوافقة تدعم الصوت والفيديو وإرجاع نتائج الأدوات لمجرد أن بيان الإطلاق ذكر مصطلح «متعدد الوسائط بالكامل»؛ بل يجب التحقق بشكل منفصل من النصوص والصور والصوت والفيديو واستدعاءات الأدوات عند التكامل.

التقييمات الرسمية: تحسن ملحوظ في وكلاء الصوت والفيديو والمهام طويلة المدى

تذكر مواد الإطلاق أن Qwen3.8-Omni-Flash حقق، عبر 30 تقييمًا تراكميًا، تحسنًا متوسطًا يتجاوز 26% مقارنةً بالجيل السابق Qwen3.5-Omni-Plus. ومن التغييرات الأسهل فهمًا:

  • تحسن قدره 36.5 نقطة في WildClawBench-MM، الذي يركز على وكلاء الصوت والفيديو والبرمجة والمهام طويلة المدى؛
  • تحسن قدره 22.3 نقطة في AgenticVBench؛
  • حصل على 69.6 نقطة في UniClawBench؛
  • تحسن LongAudioSpan بمقدار 8.3 نقاط، وOmniVideoBench بمقدار 9.6 نقاط؛
  • تحسن كل من CSR وISR في OmniCap-IF بمقدار 8.5 و14.1 نقطة على التوالي؛
  • انخفض DER وcpWER في AliMeeting من 88.11 و89.61 إلى 3.35 و17.18.

ينبغي فهم هذه الأرقام بالاقتران مع مجموعات الاختبار والتعليمات وبيئة الأدوات ومقاييس التقييم. فعلى سبيل المثال، يُعد DER وcpWER مقياسين للأخطاء المرتبطة بالتعرّف على الاجتماعات، ويشير انخفاضهما عادةً إلى أداء أفضل؛ غير أن ارتفاع نتيجة معيار Agent لا يمكن تحويله مباشرةً إلى معدل نجاح جميع مهام الإنتاج.

لا يقتصر السياق الطويل على «إدخال عدد أكبر من الفيديوهات»

يدعم Qwen3.8-Omni-Flash تسلسلات طويلة بحجم 1M، لكن قيمة السياق الطويل لا تتمثل فقط في تحميل ملفات أكبر. ويتمثل التغيير الأكثر عملية في قدرة النموذج على تحديد «ما الذي ينبغي رؤيته أو سماعه» استنادًا إلى السؤال أولًا، ثم جمع الأدلة من المقاطع ذات الصلة على عدة جولات، بدءًا من المستوى العام وصولًا إلى التفاصيل.

في تجربة OmniVideoBench التي استشهدت بها المواد الرسمية، رفع Agentic Understanding الدقة من 63.4 إلى 67.8، بالتزامن مع انخفاض استهلاك Tokens من 145,736 إلى 79,117، أي انخفاض بنحو 45.7%. ويشير ذلك إلى أن جمع الأدلة بشكل استباقي قد يقلل المعالجة المتكررة للمقاطع غير ذات الصلة، لكن التكلفة الفعلية تظل معتمدة على مدة الملف وترميز الصوت والفيديو ودورات الأدوات وطول المخرجات وطريقة فوترة مقدم الخدمة.

عرض توضيحي لـ Agentic Understanding للصوت والفيديو الطويل باستخدام Qwen3.8-Omni-Flash

الاجتماعات الطويلة: من التسجيل إلى التنفيذ

تجمع الاجتماعات متعددة المشاركين بين الصورة والصوت وفصل المتحدثين والعلاقات الإشارية وسياق المشروع. وتذكر مواد الإطلاق أن Qwen3.8-Omni-Flash يدعم إدخالات صوت وفيديو تصل مدتها إلى ساعة واحدة، ويمكنه فهم صور الأشخاص ومحتوى الكلام معًا، وإنجاز فصل المتحدثين والنسخ وربط الهويات، ثم إنشاء محاضر الاجتماعات وعناصر المهام وتحليل المخاطر.

وبعد دمج الأدوات، يمكن لسير العمل أن يمتد إلى الخارج، مثل إرسال رسائل البريد الإلكتروني أو تنظيم المهام أو بدء البرمجة وفقًا لمتطلبات الاجتماع. ويجب هنا الفصل عند القبول بين «التوصيات التي ينتجها النموذج» و«تنفيذ الإجراءات الخارجية فعليًا»: إذ ينبغي في بيئة الإنتاج تحديد صلاحيات الأدوات بوضوح لإرسال البريد وكتابة الملفات وإنشاء المهام وتشغيل التعليمات البرمجية.

البحث المتعمق الذي يركز على الفيديو

عندما يطرح المستخدم سؤالًا محددًا حول فيديو، غالبًا ما تتطلب الإجابة الجمع بين صفحات الويب والصور والمستندات ومواد فيديو أخرى خارج الفيديو نفسه. ويمكن لـ Qwen3.8-Omni-Flash استخراج الأسئلة الرئيسية من الفيديو أولًا، ثم تنظيم مواد متعددة الوسائط لإعداد تقرير بحثي غني بالنصوص والصور. وبالنسبة إلى البرامج التعليمية والدورات وعروض المنتجات والمواد السينمائية، يقترب هذا الأسلوب من سير العمل الفعلي أكثر من مجرد إنشاء ملخص.

وصف الفيديو القابل للتحكم: المادة نفسها، ومخرجات مختلفة باختلاف مجال العمل

لا ينبغي أن يقتصر وصف الفيديو على إجابة ثابتة واحدة. فصناعة المحتوى تهتم بالسرد، بينما يهتم استرجاع المواد بالمقاطع الزمنية، وتهتم إدارة الأصول بالأشخاص واللقطات والأصوات والحقول المهيكلة.

يتمثل توجه Qwen3.8-Omni-Flash في السماح للجهة المستدعية بالتحكم في موضوع الوصف والنطاق الزمني ودرجة تفصيل المعلومات وتنسيق المخرجات. فعلى سبيل المثال، يمكن إخراج المادة نفسها بالصور التالية:

  1. ملخص حبكة من ثلاثة أجزاء موجّه إلى المحررين؛
  2. طوابع زمنية وشخصيات وإجراءات رئيسية موجّهة إلى الاسترجاع؛
  3. بيانات وصفية بصيغة JSON موجّهة إلى مكتبة الأصول؛
  4. قائمة بالمتحدثين واللغات وأحداث الصوت موجّهة إلى فريق الترجمة.

تُصمم هذه القدرات بصورة أفضل بالاقتران مع المخرجات المهيكلة وأدوات الملفات وأنظمة الاسترجاع، بدلًا من الاكتفاء بعرض وصف بلغة طبيعية في نافذة المحادثة.

رسم توضيحي لتطبيقات فهم الصوت والفيديو وإنشاء المحتوى باستخدام Qwen3.8-Omni-Flash

إنتاج الصوت والفيديو وتحريرهما: يجب ترقية النموذج والأدوات وبيئة التشغيل معًا

لا يواجه وكيل الصوت والفيديو طويل المدة مشكلة في قدرات النموذج فقط، بل يواجه أيضًا تخزين الملفات ونقل الشبكة والاستدلال متعدد الجولات وتحرير الخط الزمني وتسليم النتائج. ولهذا السبب، قدمت مواد الإطلاق مشروعين مفتوحي المصدر مصاحبين:

  • Qwen-MM-Plugins: للاستشعار عند الطلب واستدعاء الأدوات وتنفيذ سير العمل المخصص للصوت والفيديو طويلَي المدة؛
  • Qwen-Live Harness: لبيئات التفاعل الآني والمستمر متعددة الوسائط بالكامل.

يمكن فهم المشروعين باعتبارهما يركزان على جانبين مختلفين من التشغيل: الأول يميل أكثر إلى المهام طويلة المدى ومعالجة المواد، والثاني يميل أكثر إلى التفاعل الآني. وعند النشر، يجب التحقق بشكل منفصل من التبعيات وذاكرة GPU وصلاحيات الملفات والشبكة الخارجية وإصدارات الإضافات؛ ولا ينبغي تحويل عبارة «المستودع مفتوح المصدر» إلى «جاهز للإنتاج المحلي بنقرة واحدة».

كيف يمكن التكامل مع Qwen3.8-Omni-Flash API؟

إذا كان مقدم الخدمة قد أتاح المسار المقابل، فمن المستحسن البدء باختبار Smoke Test باستخدام مادة صغيرة خالية من المعلومات الحساسة: صورة واحدة، ومقطع صوتي مدته بضع عشرات من الثواني، ومقطع فيديو قصير، مع اختبار الإدخال والمخرجات واستخدام Tokens ورسائل الخطأ بشكل منفصل.

يأتي شكل طلب Chat Completions المتوافق النموذجي كما يلي. يُرجى استبدال model بالمعرّف الدقيق الذي تم التحقق منه في دليل النماذج الفوري لمقدم الخدمة؛ ولا تخمّن اسم النموذج مباشرةً:

curl "$BASE_URL/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-omni-flash",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "لخّص موضوع هذه المادة والمتحدثين وثلاث نقاط زمنية رئيسية."},
        {"type": "input_video", "video_url": {"url": "https://example.com/demo.mp4"}}
      ]
    }],
    "stream": false
  }'

يُستخدم input_video أعلاه لتوضيح أن طلبات الوسائط المتعددة تتطلب التحقق بشكل منفصل من تنسيق كتل المحتوى، ولا يعني ذلك أن جميع الواجهات المتوافقة تقبل هذا الحقل. وقبل التكامل الفعلي، ينبغي مراجعة وثائق مقدم الخدمة وتسجيل ما يلي بشكل منفصل:

  • ما إذا كانت الواجهة تدعم عنوان URL للفيديو أو Base64 أو معرّف الملف؛
  • حدود حجم الملف الواحد ومدته وتنسيقه ومهلة تنزيله؛
  • طريقة احتساب Tokens للصوت والفيديو وسعرها؛
  • ما إذا كانت تدعم استدعاء الأدوات والمخرجات المهيكلة والإرجاع المتدفق؛
  • ما إذا كانت إعادة المحاولة عند الفشل ستؤدي إلى تكرار الخصم.

إذا كنت تستدعي النموذج عبر بوابتنا، فافتح أولًا أسعار النماذج الفورية للتأكد من معرّف النموذج ومعامل التسعير والقدرات الحالية، ثم استخدم رصيدًا صغيرًا للتحقق من الفاتورة الفعلية. ولا تخلط مقالات موقعنا بين سعر الإطلاق الرسمي أو أسعار المنصات الأخرى وسعر موقعنا.

ما السيناريوهات المناسبة؟

1. تحرير الفيديو واسترجاع المواد

دع النموذج يحدد اللقطات والأشخاص والإجراءات وأحداث الصوت أولًا، ثم سلّمها إلى أدوات التحرير لإجراء القص الأولي وإضافة الترجمة وتنظيم الفصول. وعند القبول، ينبغي مقارنة دقة الطوابع الزمنية ومعدل الإغفال، لا الاكتفاء بسلاسة قراءة الملخص.

2. مقاطع الموسيقى والتعليق على الأعمال السينمائية والتلفزيونية

يمكن للنموذج فهم الصورة والحوار والموسيقى والبنية السردية في الوقت نفسه، ثم إنشاء نص أوصاف اللقطات أو مسودة تعليق. ومع ذلك، لا تزال النسخة النهائية تتطلب مراجعة بشرية لحقوق النشر والحقائق وجودة اللغة.

3. الاجتماعات والعمل المعرفي

يمكن إدخال فيديو الاجتماع في خط أنابيب للنسخ والتعرّف على المتحدثين وإنشاء المحاضر وتحليل المخاطر وإنشاء المهام. وعند التعامل مع العملاء أو الموظفين أو الأسرار التجارية، يجب أولًا التأكد من حدود تخزين البيانات ونقلها خارجيًا.

4. البحث المتعمق متعدد الوسائط

استخدم الفيديو بوصفه مدخلًا للبحث، مع الاستعانة بصفحات الويب والصور والمستندات ومقاطع الفيديو الأخرى لاستكمال السياق، وهو ما يناسب مراجعة الدورات وأبحاث المنتجات وتحليل الدروس التقنية.

قائمة التحقق للاختيار والتكامل

  1. تأكد أولًا من أن مقدم الخدمة يتيح فعلًا Qwen3.8-Omni-Flash، ولا تكتفِ بقراءة عنوان الخبر.
  2. اختبر النصوص والصور والصوت والفيديو بشكل منفصل باستخدام ملفات صغيرة غير حساسة.
  3. سجّل حجم الملف ومدته وTokens الإدخال والإخراج وزمن الاستجابة والتخزين المؤقت والخصم الفعلي.
  4. أنشئ عينات قبول مستقلة للتعرّف الضوئي على الحروف OCR والتعرّف على المتحدثين والطوابع الزمنية والإجابة عن أسئلة الفيديو وتنفيذ الأدوات.
  5. ضع فهم الفيديو وقراءة الملفات وإنشاء المهام وإرسال البريد وتنفيذ التعليمات البرمجية ضمن حدود صلاحيات مختلفة.
  6. حدد ميزانية ومهلة زمنية وسياسات لإعادة المحاولة وشروطًا لتولي الإنسان المهمة في المهام الطويلة.
  7. اكتب إصدار النموذج وتاريخ الطلب ومقدم الخدمة والبروتوكول وبنية الاستجابة في سجل قابل للتتبع.

الأسئلة الشائعة

هل Qwen3.8-Omni-Flash نموذج رؤية عادي؟

لا. يتمثل تصنيف إصداره في أنه نموذج أصلي متعدد الوسائط بالكامل، إذ يغطي الإدخال النصوص والصور والصوت والفيديو، ويجمع بين فهم الصوت والفيديو وتنفيذ أدوات الوكيل.

ما مدة الفيديو التي يدعمها؟

تذكر مواد الإطلاق إدخالات صوت وفيديو تصل مدتها إلى ساعة واحدة، إلى جانب سياق طويل بحجم 1M. وقد تظل الحدود الفعلية متأثرة بواجهة API وحجم الملف والترميز والمنطقة وتنفيذ مقدم الخدمة، لذا ينبغي الرجوع إلى وثائق الواجهة الحالية والطلبات الفعلية.

هل يعني سياق 1M أن التكلفة ستكون أقل حتمًا؟

لا. يوسّع السياق الطويل نطاق المعالجة الممكن، لكن تحميل الملفات وTokens الصوت والفيديو ودورات الأدوات والمخرجات كلها قد تتسبب في تكاليف. وقد يساهم جمع الأدلة باستخدام Agentic في تقليل المعالجة غير ذات الصلة، لكن يجب التحقق من ذلك عبر الاستخدام الفعلي.

ما الفرق بين Qwen-Live Harness وQwen-MM-Plugins؟

يركز الأول على بيئة تشغيل للتفاعل الآني والمستمر متعدد الوسائط بالكامل، بينما يركز الثاني على الاستشعار عند الطلب واستدعاء الأدوات وتنفيذ سير العمل للصوت والفيديو طويلَي المدة. وكلاهما مشروع مصاحب، ولا يساوي أي منهما نموذج API نفسه.

هل يدعم موقعنا Qwen3.8-Omni-Flash بالفعل؟

لا تحل المقالة محل الدليل الفوري. يُرجى الاطلاع على صفحة أسعار النماذج للتأكد من معرّف النموذج ومعامل التسعير وقدرات الوسائط والفاتورة الفعلية قبل استخدامه في الإنتاج.

الخلاصة

يتمثل التركيز الرئيسي للنموذج متعدد الوسائط بالكامل Qwen3.8-Omni-Flash في تحويل الصوت والفيديو من «مدخلات يفهمها النموذج» إلى مادة عمل يمكن للوكيل أن يجمع الأدلة منها باستمرار، ويخطط، ويستدعي الأدوات، ويسلّم النتائج. ويناسب ذلك التحقق باستخدام مهام حقيقية محدودة النطاق: ابدأ باختبار الإجابة عن أسئلة الفيديو الطويل ومحاضر الاجتماعات واسترجاع المواد، ثم أضف التحرير والبحث وتنفيذ المهام تدريجيًا.

مصدر الإطلاق: صفحة WeChat غير المتصلة التي قدمها المستخدم بعنوان «إطلاق النموذج متعدد الوسائط بالكامل Qwen3.8-Omni-Flash»؛ الصور هي الصور الأصلية المرفقة في تلك الصفحة، وقد نُسخت إلى دليل الموارد الثابتة في موقعنا، ولم تُعتبر نصوص الصفحة البرمجية أو تعليمات الجهات الخارجية جزءًا من محتوى المقال.