
Qwen3.8-Flash-Next: كيف خفضت علي بابا تكلفة الحوسبة ورفعت أداء البرمجة؟
في 26 أغسطس 2026، أزاح فريق كوين التابع لمجموعة علي بابا الستار عن طراز الذكاء الاصطناعي متعدد الوسائط Qwen3.8-Flash-Next، معلنًا إتاحة أوزانه البرمجية المفتوحة للمطورين عبر منصتي Hugging Face و ModelScope، بالتوازي مع إطلاق النسخة السحابية الموجهة للإنتاج التجاري تحت معرف qwen3.8-flash عبر منصة Qwen Cloud. جاء هذا الإعلان ليمثل نافذة هندسية استباقية تستعرض الأسس البنائية لعائلة Qwen4 المنتظرة، سائرًا على خطى الإصدار التجريبي السابق Qwen3-Next الذي مهد الطريق لسلسلة Qwen3.5.
ركزت الشركة في هذا الطرح على كسر معادلة التكلفة الحاسوبية المرتفعة؛ إذ استطاع النموذج خفض نفقات التدريب إلى قرابة عُشر تكلفة الطراز السابق Qwen3.7-Plus (نحو تسع النفقات تقريبًا). ورغم هذا الخفض الكبير في استهلاك الموارد، أظهرت المعمارية نتائج متقدمة في عدد من اختبارات هندسة البرمجيات وسير عمل الوكلاء الرقميين مقارنة بنماذج رائدة ذات وزن ثقيل مثل Claude Opus 4.6 (Max)، معتمدة على بنية خليط الخبراء بحجم 125 مليار معلمة إجمالية ينشط منها 6 مليارات معلمة فقط لكل رمز لغوي.
أربع تقنيات تقف وراء كفاءة Qwen3.8-Flash-Next
استند تصميم النموذج إلى إعادة هيكلة شاملة للعلاقة بين عمليات الحساب وسعة الذاكرة، مرتكزًا على أربعة مسارات هندسية متكاملة رفعت من سرعة الاستدلال وخفضت استهلاك الموارد:
1. الانتباه الهجين: كيف يوازن النموذج بين السرعة والدقة؟
في الشبكات التقليدية، تفرض آلية الانتباه الكامل أعباء حسابية متصاعدة كلما زاد طول النص. واجه النموذج هذا التحدي عبر توزيع طبقاته الـ 48 بنظام هجين يدمج بين تقنيتين:
- ثلاث طبقات متتالية من شبكات Gated DeltaNet (GDN): تعمل على ضغط السياق التاريخي المستمر والاحتفاظ بالبيانات السابقة داخل حالة ثابتة الحجم وبسرعة فائقة.
- طبقة رابعة تعتمد آلية Qwen Sparse Attention (QSA): تتولى الاسترجاع الدقيق للمعلومات عبر كامل النص دون الحاجة إلى فحص الرموز فرديًا.
تعتمد آلية QSA على مفهرس خفيف يجمع النصوص في كتل مجهرية لتقدير أهمية المقاطع مسبقًا وتوجيه الحساب نحو الأجزاء الأكثر صلة فقط. قاد هذا الدمج إلى تحقيق مكاسب تشغيلية واضحة عند التعامل مع نصوص بحجم مليون رمز:
- ارتفاع سرعة معالجة المدخلات الأولية بمعدل 7.6 أضعاف.
- زيادة سرعة توليد المخرجات بمعدل 4.9 أضعاف.
- تسجيل قفزة في إجمالي إنتاجية المعالجة بمقدار 8.6 أضعاف مقارنة بطراز Qwen3.7-Plus عند نسبة استرجاع مسبق للذاكرة المؤقتة تبلغ 90%.
2. أربعة مسارات لتحسين تدفق المعلومات
تعاني شبكات المحولات العميقة من تلاشي الإشارات الدقيقة بسبب مرور البيانات عبر مسار ارتدادي مفرد تختلط فيه المعلومات المبكرة بالنتائج اللاحقة.
تغلب النموذج على هذا العائق عبر ابتكار تقنية المسار الارتدادي المبوب (Gated Residual)، التي وسعت قناة الاتصال إلى أربعة مسارات متوازية. أضاف هذا الهيكل بوابات قراءة ديناميكية تعتمد على محتوى النص وبوابات كتابة محددة لكل فرع، الأمر الذي سمح بإنشاء خط مباشر ينقل ميزات طبقة الانتباه الأولى إلى الطبقات النهائية دون تشويش. علاوة على ذلك، دعم هذا المسار تقنية التخزين بتنسيق FP8 لخفض استهلاك الذاكرة وحفظ استقرار التدريب.
3. ذاكرة N-gram: كيف استفاد النموذج من RAM بدل VRAM؟
أضافت علي بابا 51 مليار معلمة إضافية عبر طبقة تضمين N-gram في الطبقة الثانية من الشبكة، مستفيدة من أبحاث Gemma 3n ومشروع DeepSeek Engram.
تعتمد هذه الفكرة على بناء جدول بحث ثابت للأنماط اللغوية وتراكيب الكلمات المتجاورة. ونظرًا لإمكانية تحديد مواقع البحث مسبقًا، استقرت هذه المعلمات البالغة 51 مليارًا داخل ذاكرة النظام المضيف (RAM) مع الاعتماد على الجلب المسبق غير المتزامن بالتوازي مع عمل المعالج الرسومي. وفرت هذه الخطوة سعة استيعاب هائلة للأنماط الشائعة دون أن تدخل هذه المعلمات ضمن حسابات مصفوفات المعالج الرسومي ودون استهلاك مساحة الذاكرة الرسومية VRAM.
4. 125 مليار معلمة.. لكن 6 مليارات فقط تدخل الحساب
يعتمد النموذج على بنية خليط الخبراء فائقة التشتت (Ultra-sparse MoE) بإجمالي 125 مليار معلمة موزعة على 512 خبيرًا متخصصًا. تكمن نقطة الكفاءة في أن النظام ينشط 10 خبراء موجهين مع خبير مشترك واحد فقط لكل رمز لغوي، لتقتصر الحسابات الفعلية على 6 مليارات معلمة نشطة فقط في كل خطوة، مع إضافة 4 مليارات معلمة لوحدة التنبؤ متعدد الخطوات (MTP) لتسريع التوليد عبر الاستدلال التخميني.
في هذا الإطار، اعتمد التدريب على مُحسِّن Muon للمصفوفات الخطية ثنائية الأبعاد في طبقات الانتباه وشبكات الخبراء، مع إسناد التضمين وتوجيه الخبراء إلى خوارزمية AdamW. وقادت إعادة ضبط قوانين التوسع الرياضي إلى الاستغناء عن مرحلة الإحماء التدريجي لحجم الحزم التدريبية، والبدء مباشرة بالحجم المستهدف، وهو وضع وفر 18.8% من خطوات التحسين ودعم استخدام معدلات تعلم مرتفعة بأمان واستقرار تام.
كيف كان أداء Qwen3.8-Flash-Next في الاختبارات؟
أظهرت النتائج الرسمية المنشورة تباينًا هندسيًا يعكس توجه النموذج نحو التطبيقات العملية وهندسة البرمجيات مقارنة بأبرز المنافسين:

- SWE-bench Pro: حقق Qwen3.8-Flash-Next نتيجة 62.5 نقطة مقابل 53.4 لطراز Claude Opus 4.6 (Max) و56.0 لطراز DeepSeek-V4-Flash-0731 و55.8 لطراز Qwen3.7-Plus.
- SWE-bench Multilingual: سجل 81.0 نقطة مقابل 77.5 لطراز Claude Opus 4.6 (Max) و75.8 لطراز Qwen3.7-Plus.
- DeepSWE 1.1: نال 58.7 نقطة عبر بيئة mini-SWE-agent مقابل 54.4 لطراز DeepSeek-V4-Flash-0731.
- CoWorkBench: سجل 73.9 نقطة لمهام الإنتاجية المكتبية مقابل 68.2 لطراز Claude Opus 4.6 (Max).
- JobBench: أحرز 55.7 نقطة في أداء المهام الوظيفية والمهنية مقابل 36.6 لطراز أوبوس.
- Toolathlon Verified: حقق نسبة 73.5% في استخدام الأدوات البرمجية متقدمًا على DeepSeek الذي سجل 70.3%.
- LiveCodeBench v6: سجل 91.9 نقطة في البرمجة التنافسية مقابل 88.8 لطراز أوبوس.
- GPQA Diamond: أحرز 91.7 نقطة في المنطق العلمي مقابل 91.3 لطراز أوبوس.
- Humanity’s Last Exam: تراجع مسجلًا 35.9 نقطة مقابل 40.0 نقطة لصالح Claude Opus 4.6 (Max).
في البرمجة.. Qwen3.8-Flash-Next ينافس النماذج الأكبر
أثبتت أرقام الاختبارات أن النموذج يمتلك قدرة فائقة على تفكيك الشيفرات البرمجية المعقدة وإصلاح الأخطاء على مستوى المستودعات الكاملة:
- نال النموذج 62.5 نقطة في اختبار SWE-bench Pro عبر بيئة Claude Code، متجاوزًا نماذج الفئة العليا التي تفوقه في الحجم الإجمالي بنحو الضعف أو أكثر.
- في اختبار SWE-bench Multilingual الممتد عبر لغات برمجية متعددة، أحرز 81.0 نقطة، وهو فارق يؤكد استيعاب النموذج لقواعد البناء البرمجي المتنوعة.
- في اختبار توليد المستودعات البرمجية NL2Repo-Bench، سجل 48.1 نقطة متقدمًا على Claude Opus 4.6 (Max) صاحب الـ 47.6 نقطة، في حين تصدر DeepSeek-V4-Flash-0731 هذا الاختبار بنتيجة 54.2 نقطة.
من البرمجة إلى العمل المكتبي: إمكانات النموذج في بيئات الأعمال
لم تنحصر قوة الطراز في كتابة الأكواد فقط، بل امتدت نحو إدارة وتنسيق المهام المؤسسية عبر الوكلاء الأذكياء:
- الإنتاجية المؤسسية طويلة المدى: أظهر اختبار CoWorkBench قدرة النموذج على متابعة سير العمل المكتبي المعقد في مجالات القانون والتمويل وإدارة البيانات محققًا 73.9 نقطة.
- فارق المهام الوظيفية (JobBench): سجل النموذج 55.7 نقطة، متفوقًا بنحو عشرين نقطة كاملة على Claude Opus 4.6 (Max) الذي توقف عند 36.6 نقطة، وهي نتيجة تعكس استيعابًا دقيقًا لسياقات العمل الإداري والتنفيذي.
- استدعاء الأدوات الخارجية: نال النموذج 73.5% في اختبار Toolathlon Verified، مؤكدًا مهارته في ربط واجهات البرمجة وتنفيذ التعليمات المركبة بدقة.
الفهم البصري ومعالجة الوسائط المتعددة
يمتلك النموذج المفتوح الأوزان مشفرًا بصريًا مدمجًا (Vision Encoder) يتيح له استقبال ومعالجة النصوص والصور ومقاطع الفيديو ضمن واجهة برمجية موحدة، وحقق النتائج التالية:
- التعامل مع واجهات الهواتف: سجل 84.5 نقطة في اختبار AndroidWorld مقابل 62.0 نقطة لطراز Claude Opus 4.6 (Max).
- الرياضيات البصرية والهندسية: حقق 95.7 نقطة في اختبار MathVision مع الاستدلال الموجه، متفوقًا بفارق واسع على أوبوس الذي نال 65.5 نقطة.
- قراءة المخططات والرسوم العلمية: أحرز 90.6 نقطة في اختبار CharXiv مقابل 66.0 نقطة للمنافس أوبوس.
- إدراك الواقع وفهم الفيديو: نال 88.5 نقطة في اختبار RealWorldQA و76.6 نقطة في اختبار استيعاب مقاطع الفيديو الطويلة LVBench.
رغم قوته.. أين تظهر حدود النموذج؟
رغم النتائج المتقدمة في مجالات هندسة البرمجيات وسير العمل التطبيقي، رصدت تقارير المطورين والتقييمات الفنية حدودًا تقنية واضحة:
- اختبارات المنطق الأكاديمي المعقد: تفوق طراز Claude Opus 4.6 (Max) في اختبار Humanity’s Last Exam مسجلًا 40.0 نقطة مقابل 35.9 نقطة لنموذج كوين، كما حل خلف DeepSeek في اختبار Agents’ Last Exam بنتيجة 24.3% مقابل 25.2%.
- ثبات سلاسل التفكير الطويلة: بينت تقارير المطورين ظهور تذبذب في الأداء لدى تنفيذ سلاسل قرارات معقدة تمتد لخطوات طويلة جدًا، فضلًا عن حساسية النموذج إزاء الأدوات التي تعيد مخرجات بتنسيقات JSON غير قياسية.
- سياسات الأمان والحماية: يمتلك النموذج استجابات أقل تشددًا في الرقابة مقارنة بنماذج أنثروبيك، وهو أمر يفرض على المؤسسات وضع طبقات حماية مخصصة عند إدماجه في بيئات العمل الحساسة.
كم يكلف استخدام Qwen3.8-Flash؟
وفرت علي بابا الخدمة السحابية المدارة الجاهزة للاستخدام عبر منصة Qwen Cloud بهيكل تسعير تنافسي:
- تكلفة رموز المدخلات: تتراوح بين 0.15 و 0.16 دولار لكل مليون رمز.
- تكلفة رموز المخرجات: تبلغ 0.47 دولار لكل مليون رمز.
- مقارنة مع طراز Qwen3.8-Max: يكلف الطراز الرائد 2.00 دولار للمدخلات و6.00 دولارات للمخرجات لكل مليون رمز، مما يعني أن إصدار Flash يقدم وفرًا ماليًا يتجاوز عشرة أضعاف في تكلفة المدخلات واثني عشر ضعفًا في المخرجات.
التمييز بين النسخة المفتوحة والخدمة السحابية
أظهرت الوثائق الرسمية وجود فوارق تشغيلية بين الإصدارين يجب الانتباه إليها:
- Qwen3.8-Flash-Next: يمثل حزمة الأوزان المفتوحة والمعمارية الهندسية المتاحة للتحميل والاستضافة الذاتية، ويدعم مشفرًا بصريًا مدمجًا مع نافذة سياق أصيلة تبلغ 262,144 رمزًا لغويًا، قابلة للتوسيع نحو مليون رمز بالاعتماد على تقنية YaRN.
- Qwen3.8-Flash: يمثل الخدمة السحابية المدارة عبر واجهات البرمجة في Qwen Cloud، وتتضمن أدوات بحث مدمجة وتدعم نافذة سياق بحجم مليون رمز لغوي بصورة افتراضية دون الحاجة إلى ضبط يدوي لإعدادات التشفير الموضعي.
منصات وخيارات تشغيل Qwen3.8-Flash-Next
يدعم النموذج بروتوكولات الاتصال المتوافقة مع أنظمة OpenAI و Anthropic، الأمر الذي يتيح دمجه مباشرة مع أدوات التطوير البرمجية ومحركات الاستدلال:
- بيئات البرمجة والأتمتة: يتكامل النموذج مع أدوات مثل Claude Code و Codex ومنصة QwenWork وأطر الوكلاء مثل Qoder CLI و OpenClaw.
- محركات الاستدلال عالية السرعة: يدعم النموذج التشغيل الذاتي عبر حزم vLLM و SGLang و TokenSpeed.
- المنصات التجميعية المستقلة: يتيح العمل عبر منصات مثل GlobalGPT للمستخدمين الراغبين في التبديل بين نماذج متعددة داخل مساحة عمل واحدة دون إدارة حسابات برمجية منفصلة.
مقارنة مع المنافس المباشر GLM-5.3-Flash
تزامن إطلاق النموذج مع طرح طراز GLM-5.3-Flash، وأظهرت المقارنة الفنية تباينًا في فلسفة البناء:
- توزيع المعلمات وكفاءة الاستضافة: يعتمد طراز كوين على 125 مليار معلمة مع تنشيط 6 مليارات معلمة فقط لكل رمز، في حين يعتمد نموذج GLM على 320 مليار معلمة مع تنشيط 18 مليار معلمة. يمنح هذا الفارق أفضلية كبرى لنموذج كوين في سرعة المعالجة وانخفاض تكلفة الاستضافة الذاتية على الخوادم الخاصة.
- الأداء التخصصي: يتفوق GLM في اختبار البرمجة DeepSWE 1.1 بنتيجة 63.4 نقطة مقابل 58.7 لنماذج كوين، بينما يتفوق Qwen3.8-Flash-Next في اختبارات إصلاح المستودعات SWE-bench Pro واختبارات المهام المكتبية والوظيفية بفوارق واضحة.
الأسئلة الشائعة حول Qwen3.8-Flash-Next
هل يختلف إصدار Qwen3.8-Flash عن إصدار Flash-Next؟
نعم؛ يمثل Flash-Next الأوزان المفتوحة الموجهة للاستضافة الذاتية والمعاينة الهندسية، في حين يمثل Qwen3.8-Flash الخدمة السحابية المدارة الجاهزة للاستخدام عبر واجهات البرمجة مع أدوات مدمجة ودعم افتراضي لسياق مليون رمز.
ما هي تكلفة استخدام واجهة البرمجة الرسمية؟
تبلغ التكلفة الأساسية عبر سحابة كوين الرسمية 0.15 إلى 0.16 دولار لكل مليون رمز مدخل، و0.47 دولار لكل مليون رمز مخرج، وهي تكلفة تقل بعشر مرات عن الطراز الرائد Qwen3.8-Max.
هل يدعم نموذج الأوزان المفتوحة مدخلات الفيديو والصور؟
نعم؛ يتضمن النموذج المفتوح مشفرًا بصريًا مدمجًا يدعم استقبال ومعالجة النصوص والصور ومقاطع الفيديو، وحقق نتائج رائدة في اختبارات تحليل الرسوم البيانية، واستيعاب لقطات الشاشة، وفهم الفيديو.
كيف يتعامل النموذج مع السياقات الطويلة التي تتجاوز 262 ألف رمز؟
يدعم كود المصدر سياقًا أصيلًا بحجم 262,144 رمزًا، وعند الرغبة في التوسع حتى مليون رمز لغوي يوصى بتفعيل تقنية YaRN لتعديل التشفير الموضعي عبر محركات الاستدلال مثل vLLM و SGLang.
الخلاصة: لماذا يكتسب Qwen3.8-Flash-Next أهمية كبرى؟
يعكس إعلان 26 أغسطس 2026 تحولًا ملموسًا في استراتيجيات بناء النماذج الذكية؛ حيث أثبتت علي بابا أن تحقيق نتائج متقدمة في ميادين هندسة البرمجيات وأتمتة الأعمال لم يعد حكرًا على الطرازات العملاقة باهظة التكلفة.
يمثل Qwen3.8-Flash-Next خيارًا عمليًا للشركات الساعية لبناء وكلاء رقميين فائقي السرعة وبتكلفة تشغيل منخفضة، واضعًا معايير هندسية جديدة ستشكل العمود الفقري لسلسلة Qwen4 المرتقبة.




