
نموذج Wan 3.0 من Alibaba: ثورة في توليد الفيديو بالذكاء الاصطناعي من الوثائق والمستندات
أعلنت شركة Alibaba، خلال مؤتمرها الصحفي في 6 أغسطس 2026، عن إطلاق الإصدار الجديد من نموذجها لتوليد الفيديو بالذكاء الاصطناعي، Wan 3.0. جاء هذا الإطلاق بعد سلسلة من التحديثات المتتالية للإصدارات السابقة من Wan 1.0 إلى Wan 2.7، والتي وصلت إلى أقصى مدتها 15 ثانية في التوليد الواحد. ويعد هذا الإصدار نقلة نوعية في عالم توليد الفيديو، حيث يقدم حلولاً مبتكرة تجمع بين الطول الاستثنائي للفيديو والمدخلات المتنوعة التي تتجاوز النصوص والصور التقليدية.

الإصدار الأقوى: من توليد لقطات إلى سرد قصص كاملة
يمثل Wan 3.0 تقدماً كبيراً في القدرة على توليد مقاطع فيديو أطول وأكثر اتساقاً. حيث يدعم النموذج الجديد توليد مقاطع فيديو تصل مدتها إلى 30 ثانية في تمريرة توليد واحدة، بدلاً من 15 ثانية في الإصدار السابق Wan 2.7. هذا يعني أن المبدعين يمكنهم الآن تنفيذ حركات كاميرا معقدة ومستمرة (مثل التكبير البطيء، أو الحركة الدائرية، أو التتبع) دون الحاجة إلى دمج مقاطع قصيرة متعددة يدوياً، مما يضمن سلاسة السرد واتساق العناصر البصرية عبر المقطع بالكامل.
ميزة ذكية: يتميز النموذج بوظيفة المدة الذكية التي تقترح تلقائياً المدة المثلى للفيديو بناءً على محتوى المطالبة المقدمة من المستخدم. كما يدعم خاصية تمديد الفيديو التي تسمح بإضافة مشاهد إضافية إلى المقطع الأصلي، مع الحفاظ على اتساق الشخصيات والبيئة والأسلوب البصري، مما يتيح إنتاج قصص تمتد لأطول من 30 ثانية.
ثورة المدخلات: كل شيء يمكن أن يصبح فيديو
التحديث الأبرز في Wan 3.0 هو نظام المدخلات الجديد الذي أطلقت عليه Alibaba اسم Omni-Reference أو المرجع الشامل. يتجاوز هذا النظام المدخلات التقليدية المتمثلة في النصوص والصور والمقاطع المرئية والصوتية، ليدعم قراءة وفهم مستندات المكتبة المختلفة مباشرة.
يدعم النموذج صيغ الملفات التالية:
- مستندات المكتب: doc, xls, ppt, pdf
- مستندات الويب: md وكذلك صفحات الويب عبر الروابط
- قيود الاستخدام: ملف واحد فقط لكل طلب، بحجم لا يتجاوز 100 ميجابايت، وعدد صفحات لا يزيد عن 50 صفحة.
كيف يعمل في الممارسة العملية?
يمكن لمسوقي المنتجات رفع عرض تقديمي لمنتج جديد، وإضافة مطالبة مثل: «قم بإنشاء فيديو ترويجي مدته 20 ثانية يبرز الميزات الرئيسية للمنتج مع مشاهد واقعية». سيقوم النموذج بتحليل محتوى العرض التقديمي، واستخراج النقاط الرئيسية، وإنشاء فيديو متكامل يتضمن رسوماً متحركة للمنتج، ورسوماً بيانية ديناميكية، وسرداً بصرياً متسقاً.
واقعية مذهلة واتساق استثنائي
ركزت Alibaba بشكل كبير على تحسين الجودة البصرية للفيديوهات المولدة، مع التركيز على نقطتين رئيسيتين:
- واقعية الشخصيات:يعمل النموذج على تقليل المظهر الاصطناعي أو الدهني الذي كان شائعاً في النماذج السابقة. حيث يتميز بدقة عالية في تصوير تفاصيل الوجه والبشرة، مع قدرات متقدمة في التعبير عن المشاعر والإيماءات الدقيقة. حتى في المشاهد التي تضم عدة شخصيات، يمكن لكل شخصية أن تعبر عن مشاعرها الخاصة بشكل طبيعي ومتمايز.
- اتساق العناصر عبر المشاهد:يعد هذا التحدي الأكبر في توليد الفيديو بالذكاء الاصطناعي. يتفوق Wan 3.0 في الحفاظ على الاتساق التام لكل من:
- الشخصيات: ملامح الوجه، ونوع الشعر، والملابس، والإكسسوارات.
- القطع والمجسمات: تفاصيل الهيكل، والشعار، والمادة المصنعة.
- المشاهد: العلاقة بين موقع الشخصية وزاوية الكاميرا.
- الأسلوب الفني: الدقة في محاكاة أسلوب التصوير السينمائي، حتى عند العمل بأساليب متعددة.
مقارنة الأداء: Wan 3.0 مقابل أبرز المنافسين
لتوضيح قدرات Wan 3.0 في السوق، إليك مقارنة تفصيلية مبسطة مع أهم النماذج المنافسة بعد إدراج أحدث إصدارات جوجل:
أولاً: نموذج Wan 3.0 من Alibaba
- الحد الأقصى للمدة في جولة واحدة: 30 ثانية
- دقة الإخراج الأصلية: حتى 1080P
- المدخلات المدعومة: نص، صورة، صوت، فيديو، مستندات مكتبية، وروابط ويب
- النقطة الفريدة: تحويل المستندات والملفات إلى فيديو مباشرة
- التسعير التقريبي للثانية: 0.6 يوان لدقة 720P (تتراوح التكلفة الإجمالية للثانية بين 0.3 إلى 1.2 يوان حسب الدقة المطلوبة)
- الوضع الحالي للنموذج: مرحلة البيتا العامة
ثانياً: نموذج Seedance 2.5
- الحد الأقصى للمدة في جولة واحدة: 30 ثانية
- دقة الإخراج الأصلية: حتى 4K
- المدخلات المدعومة: نص، صورة، صوت، فيديو (حتى 50 مرجعاً)
- النقطة الفريدة: إنتاجية عالية وسرعة متميزة في التوليد المعقد
- التسعير التقريبي للثانية: حوالي 1.51 يوان لدقة 720P
- الوضع الحالي للنموذج: متاح للاستخدام الفعلي
ثالثاً: نموذج Kling 3.0
- الحد الأقصى للمدة في جولة واحدة: حوالي 10 ثوانٍ قابلة للتمديد
- دقة الإخراج الأصلية: حتى 2048 في 1080
- المدخلات المدعومة: نص، صورة، صوت، فيديو
- النقطة الفريدة: دقة فيزيائية عالية جداً في محاكاة حركة الأجسام
- التسعير التقريبي للثانية: يتفاوت حسب خطط الاشتراك
- الوضع الحالي للنموذج: متاح للاستخدام الفعلي
رابعاً: نموذج Google Veo 3.1
- الحد الأقصى للمدة في جولة واحدة: 8 ثوانٍ
- دقة الإخراج الأصلية: حتى 1080P
- المدخلات المدعومة: نص، صورة، صوت، فيديو
- النقطة الفريدة: تزامن واتساق متقدم للغاية بين الصوت والصورة داخل المشهد
- التسعير التقريبي للثانية: يتفاوت حسب حجم الاستهلاك السحابي
- الوضع الحالي للنموذج: متاح للاستخدام الفعلي
خامساً: نموذج Google Gemini Omni
- الحد الأقصى للمدة في جولة واحدة: 10 ثوانٍ (مع إمكانية دمج لقطات متعددة لتكوين قصص أطول)
- دقة الإخراج الأصلية: حتى 1080P (ودقة 720P لنسخة Flash السريعة)
- المدخلات المدعومة: دمج حر فوري (نص، صورة، صوت، فيديو) مع دعم استخدام حتى 5 صور مرجعية
- النقطة الفريدة: التحرير التفاعلي للفيديو عبر المحادثة، والتوليد التلقائي للصوت المدمج الأصلي، وميزة محاكاة الآفاتار الشخصي
- التسعير التقريبي للثانية: 0.10 دولار للثانية (نحو 0.72 يوان للثانية عبر الواجهة البرمجية API لنسخة Flash)
- الوضع الحالي للنموذج: متاح بنسخة تجريبية للمطورين وللمشتركين في باقات Google AI، ومدمج مجاناً في YouTube Shorts
الخلاصة من المقارنة: يتميز Wan 3.0 بطول المقطع الأصلي البالغ 30 ثانية وقدرته الفريدة على قراءة المستندات المكتبية وفهمها بتسعير تنافسي للغاية. وفي المقابل، تتفوق النماذج المنافسة في جوانب أخرى؛ مثل دقة 4K في Seedance 2.5، والمحاكاة الفيزيائية في Kling 3.0، والتفاعل الفوري والتحرير بالمحادثة التوليدية وتوليد الصوت الأصلي المدمج في Gemini Omni الجديد من جوجل.
أدوات تحرير متقدمة وسير عمل متكامل
لا يقتصر تحديث Wan 3.0 على التوليد المبتدئ فحسب، بل يمتد إلى أدوات تحرير متقدمة تمنح المبدعين تحكماً كاملاً بالنتيجة:
- التحرير متعدد الأبعاد: يدعم تعديل المشهد، والحبكة الدرامية، والحوارات، مع الحفاظ على استمرارية السرد والاتساق البصري دون تشويه المشهد الأصلي.
- التحرير بالاعتماد على المرجع: يمكن للمستخدمين تعديل زاوية الكاميرا أو إضاءة مشهد موجود مسبقاً، مع الحفاظ على حركة الشخصيات وثبات العناصر الأساسية، مما يقلل من تكرار عمليات التوليد غير الضرورية.
- التحكمة بالخط الزمني الدقيق: يتيح توجيه النموذج لتنفيذ مؤثرات بصرية أو حركات معينة في ثانية محددة من المقطع بشكل يحاكي عمل مخرجي الأفلام.
آفاق وتطبيقات عملية: كيف يستفيد المبدعون من Wan 3.0؟
تفتح قدرات هذا النموذج الباب أمام استخدامات عملية في أربعة قطاعات رئيسية:
أولاً: قطاع المحتوى الإبداعي والترفيهي
- إنتاج مسودات مرئية أولية للأفلام القصيرة ومسلسلات الويب ومراجعتها قبل الإنتاج الفعلي.
- إنشاء مقاطع فيديو موسيقية تتزامن حركتها وبصرياتها تماماً مع الإيقاع الصوتي.
- تطوير وتصميم القصص المصورة واللقطات الأولية لألعاب الفيديو.
ثانياً: قطاع التسويق والإعلانات
- تحويل العروض التقديمية الخاصة بالمبيعات والمنتجات مباشرة إلى فيديوهات ترويجية ترفع من وعي المستهلك.
- بناء وإطلاق حملات دعائية مخصصة لأسواق ولغات مختلفة بوقت قياسي وتكلفة أقل.
- إنتاج إعلانات منتجات احترافية في بيئات وخلفيات واقعية ومتنوعة دون تكاليف تصوير خارجي.
ثالثاً: قطاع التعليم والتدريب
- تحويل المناهج الدراسية المكتوبة والكتب الإلكترونية إلى دروس مرئية تفاعلية تبسط الشرح للطلاب.
- تصميم تجارب محاكاة تاريخية وعلمية دقيقة تخدم الأبحاث والمؤسسات التعليمية.
- تطوير مواد تدريبية وتوضيحية ممتازة لأقسام الموارد البشرية والتدريب الداخلي بالشركات.
رابعاً: قطاع التصميم والهندسة
- عرض مجسمات وتصاميم المنتجات ثلاثية الأبعاد واختبار حركتها في بيئات طبيعية افتراضية.
- بناء نماذج أولية تفاعلية ومتحركة لواجهات تطبيقات الهواتف المحمولة والمواقع الإلكترونية.
- تصور وفحص تجارب المستخدم بشكل مرئي ديناميكي يحاكي الواقع قبل بدء التطوير البرمجي الفعلي.
استجابة السوق والتسعير
حظي نموذج Wan 3.0 باهتمام واسع فور إطلاقه نظراً لتكلفته الاقتصادية الكبيرة. بالرغم من أن الأسعار النهائية قد تتأثر بمدى استهلاك الموارد لاحقاً، إلا أن تسعير البيتا العامة الحالي يعد من بين الأقل تكلفة في السوق، حيث تبلغ قيمة التوليد بدقة 720P حوالي 0.6 يوان للثانية الواحدة، أي ما يعادل 18 يوان تقريباً لإنتاج فيديو متواصل مدته 30 ثانية. وتمثل هذه التكلفة حوالي 60 بالمئة فقط من كلفة التوليد في النماذج المنافسة الأخرى مثل Seedance 2.5.
تحديات وملاحظات على النموذج
رغم القفزة النوعية التي يقدمها النموذج، إلا أن هناك تحديات ينبغي الانتباه إليها:
- جودة الصوت والنصوص: أوضحت شركة Alibaba صراحة أن جودة الصوت المحيطي وتأثيراته، بالإضافة إلى مستوى دقة ومحاذاة النصوص المكتوبة التي تظهر داخل الفيديوهات، لا تزال بحاجة إلى تحسينات إضافية في التحديثات القادمة.
- قيود واستقرار البيتا العامة: نظراً لكونه في مراحله التجريبية الأولى، قد يواجه المطورون والمستخدمون بعض القيود على حجم الاستهلاك اليومي وتذبذباً في الأسعار، إلى جانب توثيق تقني محدود للواجهة البرمجية مقارنة بالإصدارات الأقدم والأكثر استقراراً.
- التوفر والمصدر المفتوح: النموذج متاح حالياً فقط عبر المنصات السحابية الرسمية التابعة لشركة Alibaba، ولم يتم توفير الأوزان البرمجية له بشكل مفتوح المصدر حتى الآن، خلافاً للإصدار السابق Wan 2.1 الذي تميز بكونه مفتوح المصدر بالكامل، وهو ما يثير ترقب المجتمعات التقنية لخطوات الشركة القادمة في هذا الجانب.
مستقبل التطوير والتطلعات
أشارت الخطوط العريضة لشركة Alibaba حول التحديثات المستقبلية للنموذج إلى التركيز على محاور أساسية:
- تطوير الفيزياء الدقيقة: العمل على زيادة دقة محاكاة القوانين الفيزيائية المعقدة كحركة السوائل وتفاعل الأجسام المباشر مع بعضها.
- التوسع في استخدامات القطاع الصناعي: إنتاج بيانات مرئية اصطناعية لتدريب الروبوتات وأنظمة القيادة الذاتية في بيئات تحاكي الواقع وتغطي السيناريوهات النادرة والخطرة.
- تسهيل واجهة الاستخدام: تيسير أدوات التحكم والتحرير لتصبح واضحة ومباشرة للمستخدم العادي والمحترف على حد سواء.
طرق التجربة والوصول للنموذج
يمكن للمهتمين البدء في تجربة نموذج Wan 3.0 عبر القنوات الرسمية التالية التي وفرتها الشركة:
أولاً: منصات الويب والموقع الإلكتروني
- Alibaba Cloud Model Studio: المنصة الرئيسية الموجهة للمطورين والشركات لبناء وتكامل التطبيقات.
- Wanxiang Official Website: الموقع الرسمي المخصص لتجربة خدمات التوليد والتحرير بصورة مباشرة.
- Qwen Creation PC: الواجهة المكتبية المتكاملة المخصصة للأعمال الإبداعية والكتابية وتوليد الوسائط.
ثانياً: التطبيقات الرسمية
- Qwen App: جاري إتاحة الميزة وتجربتها تدريجياً لعموم المستخدمين عبر الهواتف الذكية.
ثالثاً: واجهات برمجة التطبيقات
- من المقرر توسيع نطاق الوصول للواجهة البرمجية للمطورين والشركات لتمكينهم من ربط النموذج مباشرة بمشاريعهم التقنية الخاصة عبر السحابة.
الخلاصة
يمثل نموذج Wan 3.0 من Alibaba خطوة متقدمة في مسار تطوير الذكاء الاصطناعي التوليدي، إذ ينقل تكنولوجيا صناعة الفيديو من مجرد توليد مقاطع تكميلية قصيرة ومتقطعة إلى القدرة الفعالة على سرد قصص مرئية متكاملة تخدم قطاعات واسعة. إن قدرة النموذج على تحويل المستندات والملفات المكتوبة مباشرة إلى مقاطع فيديو متماسكة مدتها 30 ثانية، مع تسعير منافس جداً، تجعله أداة قوية وواعدة للشركات وصناع المحتوى والجهات التعليمية والتسويقية.
وعلى الرغم من وجود بعض جوانب القصور الطبيعية في نسخته التجريبية الأولى، إلا أن هذا النموذج يرسخ تفوق Alibaba كلاعب رئيسي في سوق توليد الفيديو العالمي بالذكاء الاصطناعي، ويفتح آفاقاً جديدة لتبسيط مسارات العمل الإبداعي اليومي.




