
ElevenLabs تطلق Eleven v4 وv4 Turbo لتوليد صوت أكثر واقعية
أعلنت شركة ElevenLabs المتخصصة في هندسة الصوت الاصطناعي إطلاق طرازها الأحدث Eleven v4، إلى جانب إصدار Eleven v4 Turbo المخصص للمحادثات المباشرة. وجاء الإعلان عبر ورقة بحثية أعدها مؤسسا الشركة ماتي ستانيسفسكي وبيوتر دابكوفسكي، حيث كشفا عن تقسيم حلول توليد الصوت بين إنتاج المحتوى فائق الجودة، والأنظمة التفاعلية سريعة الاستجابة. وحصد الطراز الجديد المركز الأول ضمن منصة Artificial Analysis لأداء النماذج الصوتية، متفوقاً في اختبارات المقارنة بنسبة تفضيل بلغت قرابة 75 في المئة بين المستمعين.
Introducing Eleven v4 and Eleven v4 Turbo, our fastest and most emotive voice models yet.
Ranked #1 by Artificial Analysis. pic.twitter.com/gm8nAUMaQL
– ElevenLabs (@ElevenLabs) September 28, 2026
Eleven v4.. نموذج يفهم سياق الحديث والمشاعر
اعتمد توليد الصوت لسنوات طويلة على نبرات رتيبة تفتقر إلى الروح الإنسانية. وتغير نبرة الجملة يمنحها معاني مختلفة كلياً بحسب سياق الحديث؛ فعبارة «عليك الهدوء» تختلف في نطقها عندما يتحدث طبيب بهدوء أمام مريض خائف عن نطقها عندما يصرخ بها قائد عسكري في المعركة. وانطلاقاً من هذا المفهوم، ركزت أبحاث ElevenLabs على استيعاب المشاعر والنبرة وسرعة السرد لتقديم أداء صوتي يعكس بدقة الأداء البشري.
في هذا الإطار، يبتعد Eleven v4 عن نطق الكلمات المعزولة، ويتجه نحو فهم المشهد الحواري بأكمله. وتسمح هذه البنية للشخصيات بالاستجابة المتبادلة ضمن المحادثات، بحيث ترد الشخصية بنبرة تتوافق مع سياق الحديث، بدلاً من تجميع جمل منفصلة تفتقر إلى التفاعل الطبيعي.
التوجيه بالنصوص الطبيعية وإلغاء وسوم SSML
أدخلت الشركة تعديلاً جوهرياً على طريقة التحكم في نبرة الصوت والمؤثرات المصاحبة. وفي السابق، اعتمد المطورون على وسوم لغة SSML لتحديد فترات الصمت والتوقف، غير أن Eleven v4 أوقف دعم وسوم الفواصل، واعتمد كلياً على التوجيه باللغة الطبيعية والوسوم المباشرة داخل النص.
ويستطيع الكاتب كتابة أوصاف داخل أقواس مربعة لتوجيه الصوت بدقة، متضمنةً الخيارات الآتية:
- التوجيهات الشعورية: كتابة [ضحك]، أو [همس]، أو [صراخ بغضب ولهجة فرنسية].
- المؤثرات البيئية: إدراج أصوات طبيعية في الخلفية كصوت [مطر خفيف]، أو [إغلاق باب بقوة]، أو [اهتزاز هاتف محمول].
وتستجيب الخوارزميات لهذه التوجيهات بدقة عالية، مانحة صناع المحتوى في الكتب الصوتية والدبلجة والألعاب قدرة واسعة على تصميم تجارب سمعية متكاملة. إلى جانب ذلك، شهد الإصدار تحسينات جوهرية في دعم رموز الأبجدية الصوتية الدولية (IPA)، فاتحاً المجال لضبط النطق الدقيق لأسماء الأعلام، والمصطلحات الطبية المعقدة، والكلمات النادرة والمحلية، دون أي تشويه صوتي.
طراز Turbo وهندسة الاستجابة الفورية
واجهت الشركات طويلاً صعوبة الاختيار بين نماذج صوتية بطيئة غنية بالمشاعر، ونماذج فائقة السرعة تفتقر إلى النبرة الإنسانية. وكسرت ElevenLabs هذه المعضلة عبر إطلاق Eleven v4 Turbo، المصمم خصيصاً للمحادثات الحية والمكالمات الهاتفية التي تتطلب سرعة فائقة مع الحفاظ على التعبير الطبيعي.
من ناحية أخرى، عملت الفرق الهندسية على ضبط طراز Turbo بالتوازي مع منصة الوكلاء ElevenAgents كنظام موحد. وحقق الدمج أداءً متزناً وسلساً، حيث انخفض متوسط وقت الاستنتاج (Inference Latency) إلى قرابة 100 ميلي ثانية، وهو زمن يقل عن فترة التوقف الطبيعية الفاصلة بين حديث شخصين.
كذلك يدعم طراز Turbo البث التدفقي الثنائي الاتجاه (Bidirectional Streaming)، سامحاً بإرسال النصوص بالتزامن مع توليدها واستقبال الصوت قبل اكتمال الجملة، الأمر الذي يقضي على الانتظار ويجعل المحادثة تسير بنسق انسيابي.
سباق السرعة واختبارات الأداء بالأرقام
أظهرت القياسات تفوقاً ملموساً لطراز Eleven v4 Turbo؛ ففي تجارب أجريت خلال شهر سبتمبر عبر بروتوكول البث التدفقي WebSocket وباستخدام نصوص موحدة، سجل طراز Turbo زمناً لبدء نطق أول صوت بلغ 150 ميلي ثانية فقط بعد استبعاد تأخير الشبكة.
بالمقابل، جاءت الفروق واسعة أمام المنافسين وفق النتائج المسجلة:
- طراز Eleven v4 Turbo: سجل 150 ميلي ثانية لبدء إخراج الصوت.
- طراز Cartesia Sonic 3.6: سجل زمناً قدره 262 ميلي ثانية للوصول إلى النطق الأول.
- طراز OpenAI GPT-4o mini TTS: استغرق نحو 814 ميلي ثانية لبدء النطق الصوتي.
وتعكس هذه النتائج قدرة الإصدار الجديد على تشغيل وكلاء خدمة العملاء في مراكز الاتصال دون أي شعور بالتأخير. وفي هذا السياق، أفاد ريان بيترسون، نائب رئيس قسم منتجات الصوت لمنصة Agentforce في شركة Salesforce، بأن طراز Eleven v4 Turbo يرفع مستوى تجربة المستخدم عبر تقديم ردود صوتية فورية تتطابق مع تطلعات المؤسسات وتستجيب لمتطلبات العمل المتسارعة.
Eleven v4 يدعم أكثر من 90 لغة ويحافظ على اللكنة
يختلف التواصل البشري باختلاف الثقافات والمواقع الجغرافية. فالطريقة التي يتحدث بها شخص مع مسن في اليابان تختلف جذرياً عن الأسلوب المتبع في محادثة مشابهة داخل إيطاليا. وظل نقل هذه الفروق عبر اللغات المتعددة تحدياً كبيراً أمام هندسة الصوت الاصطناعي.
واستجابة لذلك، وسعت الشركة نطاق الدعم ليشمل أكثر من 90 لغة، متجاوزة النطق السليم إلى ضبط الإيقاع والنبرة التعبيرية لكل لغة. وبات الصوت المسجل بلغة واحدة قادراً على التحدث بأي لغة أخرى بطلاقة تامة مع تبني لكنة المتحدث الأصلي والاحتفاظ الكامل بهوية الصوت الأساسي.
علاوة على ذلك، تغلبت البنية الجديدة على مشكلة «انزلاق اللكنة» (Accent Drift) أثناء التسجيلات الطويلة؛ حيث يضمن الثبات الصوتي الجديد للعلامات التجارية الاعتماد على صوت ممثل موحد لحملاتها في عشرات الدول دون فقدان الهوية الصوتية.
الاستنساخ الصوتي الفوري والاحترافي
حمل الإصدار الرابع تطورات بارزة في دقة استنساخ الأصوات وثباتها؛ إذ بات الاستنساخ الفوري (Instant Voice Cloning) قادراً على التقاط البصمة الصوتية بدقة عالية عبر عينة تسجيل مدتها 10 ثوانٍ فقط، متفوقاً على النسخ الاحترافية لطرازات Multilingual v2 السابقة.
من جهة أخرى، أعادت الشركة تفعيل ميزة الاستنساخ الاحترافي (Professional Voice Clones – PVC)، مانحة صناع المحتوى أعلى درجات التطابق مع النبرة الأصلية، مع الاستفادة من القدرات التعبيرية المتقدمة.
ويضمن النموذج الجديد بقاء هوية المتحدث ثابتة عند إعادة توليد الجمل أو تعديل الفقرات، الأمر الذي يمنع تغير خامة الصوت في المشروعات الطويلة كالكتب الصوتية والبودكاست. كذلك طورت الشركة تقنية دمج الطلبات المتتابعة (Request Stitching) لتسمح بتوليد نصوص تصل إلى 10 آلاف حرف لكل طلب عبر ElevenLabs Studio وتطبيق ElevenLabs Reader App.
Eleven v4 يتصدر اختبارات Artificial Analysis
خضعت النماذج لاختبارات تقييم مستقلة لتحديد موقعها التنافسي، حيث احتل Eleven v4 المركز الأول في قائمة Provider Voice Arena التابعة لمنصة Artificial Analysis لشهر سبتمبر. واعتمد التقييم على اختبارات تفضيل عمياء بين المستمعين، استمع فيها الحكام للجملة ذاتها عبر Eleven v4 ونموذج منافس دون معرفة هوية المولد الصوتي.
وتفوقت Eleven v4 بنسب فوز بين 65 في المئة و81 في المئة أمام منافسين بارزين:
- نموذج Cartesia Sonic 3.6.
- نموذج Inworld TTS-2.
- نموذج Google Gemini 3.8 Flash TTS.
- نموذج Google Gemini 3.8 Flash-Lite TTS.
وجاء هذا التفوق بفضل إدراك النموذج للسياق الدلالي وإبراز المشاعر المتناسبة مع النصوص بدقة فائقة.
تطبيقات القطاعات وشهادات الشركاء
تفتح هذه القدرات الصوتية آفاقاً واسعة عبر قطاعات متعددة:
- الرعاية الصحية: يستطيع المطورون تدريب وكلاء بنبرة دافئة لتهدئة المرضى ونطق المصطلحات الطبية بدقة.
- الترفيه والألعاب: يبرز طراز Turbo في تشغيل شخصيات تتحدث بسرعة وتستخدم اللهجات العامية وتتفاعل لحظياً.
- خدمة العملاء والقطاع المالي: وظفت شركة Valiant Finance تقنيات ElevenLabs لتحسين خدمات الدعم الفني وتخفيف أوقات الانتظار.
وصرح باتريك أوفلاهيرتي، الشريك المؤسس لمنصة BeyondWords، بأن دقة التحكم التعبيري تخدم منتجي البودكاست ودور النشر. وفي السياق ذاته، أشار أوسكار دانيلز، من شركة Spring Financial، إلى أن سرعة استجابة الوكلاء رفعت كفاءة خدمة العملاء وخففت أوقات الانتظار، في حين رحب كايل غودموندسون، من Accenture Accelerate، بالبنية الهندسية الداعمة للإنتاج الصوتي الضخم.
منظومة المطورين وخيارات التصدير والأسعار
وفرت ElevenLabs الطرازين عبر تطبيقات ElevenAgents وElevenCreative، وعبر واجهة ElevenAPI، مع إمكانية التبديل بين الطرازين عبر تغيير معرف النموذج (model_id)، ودعم حزم التطوير بلغات بايثون (Python) وتايب سكريبت (TypeScript).
وتمنح المنصة المطورين مرونة في اختيار صيغ الملفات الصوتية:
- صيغة MP3 للمشروعات العامة والتطبيقات الخفيفة.
- صيغة WAV غير المضغوطة (PCM) لأعمال الاستوديو والإنتاج الاحترافي.
- صيغة µ-law المتوافقة بالكامل مع شبكات الهواتف ومراكز الاتصال.
وفي جانب الأسعار، خصصت الشركة باقة مجانية تمنح 10 آلاف رصيد شهرياً تكفي لإنتاج زهاء 10 دقائق صوتية، وتبدأ الخطط المدفوعة من 6 دولارات شهرياً وتشمل الاستنساخ الاحترافي، إلى جانب خطط مخصصة للمؤسسات. وتعمل مكتبة الأصوات، البالغ عددها أكثر من 17500 صوت، مع الطراز الجديد، مع حاجة النسخ السابقة لإعادة تدريب.
الأمان وحماية الأصوات والبيانات في ElevenLabs
اقترنت القوة التقنية بضوابط مشددة لمنع إساءة الاستخدام؛ حيث فرضت الشركة شرط الحصول على موافقة خطية موثقة من صاحب الصوت قبل استنساخه. وتعتمد المنصة على برمجية AI Speech Classifier لاكتشاف الأصوات المصنوعة وتحديد مصدرها بدقة لمنع التزييف.
واستوفت ElevenLabs شهادات الامتثال العالمية الآتية:
- شهادة SOC 2 Type II للأمان والرقابة الداخلية.
- معيار ISO 27001 لإدارة أمن المعلومات.
- معيار PCI DSS Level 1 لحماية بيانات الدفع الإلكتروني.
- الامتثال للائحة الأوروبية العامة لحماية البيانات (GDPR).
- دعم معايير قانون التأمين الصحي الأمريكي (HIPAA) لسرية البيانات الطبية.
وطرحت المنصة وضع عدم حفظ البيانات (Zero Retention Mode) للمؤسسات، مع التعهد بعدم تدريب النماذج على نصوص العملاء دون موافقة مسبقة.
Eleven v4 وv4 Turbo.. ماذا يقدمان للمطورين؟
يرسم إطلاق Eleven v4 وEleven v4 Turbo مرحلة جديدة في صناعة المحتوى السمعي؛ حيث لم يعد التحدي مقتصراً على وضوح الكلمات، بل انتقل إلى فهم السياق والقدرة على التعبير العاطفي اللحظي. وأثبتت المقارنة بين طراز الاستوديو وطراز الاستجابة اللحظية نضج الصناعة واستجابتها للاحتياجات الفعلية لقطاع الأعمال.
وفي الوقت الذي تتسابق فيه الشركات نحو دمج الذكاء الاصطناعي، يضع هذا التحديث معايير مرتفعة أمام المنافسين، واضعاً بين أيدي المطورين أدوات متقدمة لتشغيل وكلاء أذكياء يتحدثون بنبرة طبيعية تصل إلى مستوى الحديث البشري، جامعاً بين صدق المشاعر، والسرعة الفائقة، والانتشار اللغوي الواسع.




