تخطَّ إلى المحتوى الرئيسي
Vantaige
Coqui TTS screenshot
Coqui TTS logo

Coqui TTS

مجاني

إطار عمل Coqui TTS هو نظام مفتوح المصدر لتحويل النص إلى كلام مبني على نموذج XTTS v2، وهو نموذج لاستنساخ الصوت قادر على استنساخ أي صوت من مقطع صوتي مدته 6 ثوانٍ بـ 17 لغة. مجاني للاستخدام المحلي في المشاريع غير التجارية؛ وقد أُغلقت الشركة المطورة له في يناير 2024.

حالات الاستخدام:الصوت والموسيقى
الميزات:Open Source

يُعد Coqui TTS مجموعة أدوات للتعلم العميق لتوليد الكلام من النص واستنساخ الصوت، طورها الفريق الذي يقف وراء مشروع Mozilla's TTS بعد انفصالهم كشركة مستقلة في عام 2021. على مدار ثلاث سنوات، كان بمثابة البديل مفتوح المصدر الأكثر كفاءة لمنصات توليد الصوت التجارية، وتُوج ذلك بإطلاق XTTS v2 في نوفمبر 2023: وهو نموذج يستنسخ أي صوت من مقطع صوتي مرجعي مدته 6 ثوانٍ ويولد الكلام بـ 17 لغة. ثم، في 3 يناير 2024، أعلن المؤسس Josh Meyer إغلاق الشركة. تم الآن أرشفة المستودع الأصلي على github.com/coqui-ai/TTS دون وجود مشرفين نشطين من الفريق المؤسس. وتتولى نسخة مجتمعية مدعومة يديرها Idiap Research Institute (github.com/idiap/coqui-ai-TTS) المضي قدماً بالمشروع، حيث أصدرت الإصدار v0.27.5 في يناير 2026.

تأتي المكتبة مزودة بأكثر من اثنتي عشرة بنية للنماذج، بما في ذلك VITS و GlowTTS و FastSpeech2، بالإضافة إلى أدوات تحويل الصوت. ويُعد XTTS v2 هو النموذج الرائد، وهو نموذج انحدار ذاتي على غرار GPT يجمع بين ترميز الصوت VQ-VAE مع مشفر الصوت UnivNet لإنتاج مخرجات بتردد 24kHz بزمن انتقال للبث يقل عن 200ms على وحدات معالجة الرسومات (GPU) الاستهلاكية. يدعم النموذج استنساخ الصوت عبر اللغات: استنسخ صوتاً باللغة الإنجليزية، ثم قم بتوليد ذلك الصوت وهو يتحدث الفرنسية أو اليابانية. تتضمن مجموعة الأدوات نصوصاً برمجية للتدريب من أجل الضبط الدقيق على بيانات متحدث مخصصة، وواجهات برمجة تطبيقات (APIs) لسطر الأوامر و Python، وتكاملات مع Hugging Face. اعتباراً من أبريل 2026، يتم تنزيل أوزان نموذج XTTS v2 بمعدل 7.4 مليون مرة شهرياً من Hugging Face، مما يضعه ضمن أكثر نماذج تحويل النص إلى كلام (TTS) ذاتية الاستضافة استخداماً على الإطلاق.

ما يقدمه Coqui TTS في أبريل 2026

الحزمة الحالية القابلة للتثبيت هي pip install coqui-tts، والتي يديرها Idiap Research Institute. وهي تسحب XTTS v2 كنموذج افتراضي متعدد اللغات إلى جانب مكتبة تضم أكثر من 1,100 نموذج إضافي عبر تكاملات Fairseq. يولد XTTS v2 صوتاً أحادياً بتردد 24kHz مع زمن انتقال للبث للرمز الأول يقل عن 200ms على وحدة معالجة رسومات NVIDIA من الفئة المتوسطة. تعتمد جودة استنساخ الصوت بشكل كبير على الصوت المرجعي: فالتسجيل النظيف والقريب من الميكروفون في غرفة هادئة ينتج نتائج أفضل بكثير من مقطع هاتف مضغوط. يتعامل النموذج مع نقل المشاعر والأسلوب من خلال العينة المرجعية، لذا فإن المقطع المرجعي المتحمس ينتج مخرجات متحمسة.

اللغات المدعومة في XTTS v2: الإنجليزية، الإسبانية، الفرنسية، الألمانية، الإيطالية، البرتغالية، البولندية، التركية، الروسية، الهولندية، التشيكية، العربية، الصينية (الماندرين)، اليابانية، المجرية، الكورية، والهندية. يعمل التوليد عبر اللغات بشكل جيد لأزواج اللغات الأوروبية؛ وتتراجع النتائج بالنسبة لأزواج اللغات الأكثر تباعداً مثل العربية إلى اليابانية. تتضمن المكتبة أيضاً Bark (للصوت التعبيري غير الكلامي)، ونماذج VITS متعددة لمهام اللغة الواحدة، ونماذج تحويل الصوت (FreeVC، kNN-VC، OpenVoice) لنقل المتحدثين مع مطابقة طبقة الصوت دون الحاجة إلى توليد كامل لتحويل النص إلى كلام (TTS).

بالنسبة لمهام اللغة الواحدة حيث تكون دقة النطق أكثر أهمية من التعبير، غالباً ما تتفوق نماذج VITS الأضيق نطاقاً على XTTS v2. تشير النقاشات المجتمعية إلى أن XTTS v2 يتعثر أحياناً في الأسماء الخاصة والمصطلحات التقنية؛ لذا فإن التوسيع المسبق للاختصارات والأرقام في النص المدخل يقلل من الأخطاء بشكل كبير.

موقع Coqui TTS مقارنة بـ ElevenLabs و Bark

المقارنة الأنسب لمعظم المستخدمين الذين يختارون Coqui TTS هي مع ElevenLabs (الرائد التجاري من حيث الجودة) و Bark من Suno (الخيار الرئيسي الآخر مفتوح المصدر).

يعمل ElevenLabs كواجهة برمجة تطبيقات (API) سحابية مغلقة المصدر دون خيار الاستضافة الذاتية. يدعم نموذج Multilingual v2 الخاص به أكثر من 30 لغة مقابل 17 لغة في XTTS v2. تقوم فئة Professional Voice Clone بالضبط الدقيق على صوتك وتنتج نتائج تجتاز بانتظام الاختبارات البشرية المزدوجة التعمية؛ بينما يتطلب Instant Voice Clone حوالي دقيقة من الصوت. هناك اختلاف ميكانيكي حاسم: يقوم ElevenLabs بأخذ عينات من معدل التحدث مباشرة من الصوت المرجعي. بينما يستخدم XTTS v2 متنبئ مدة منفصل تم تدريبه على مجموعة البيانات الأساسية الخاصة به بدلاً من عينتك، مما يعني أن الصوت المستنسخ يتحدث بإيقاع مستمد من متوسط بيانات التدريب بدلاً من تسجيلك. في اختبار مستقل، استغرق نفس النص المكون من 18 كلمة 76 ثانية في Coqui مقابل 20-22 ثانية من المحركات التجارية التي تأخذ عينات من الإيقاع من المقطع المرجعي. يبدأ ElevenLabs من $22/شهرياً (خطة Creator) للحقوق التجارية. بينما XTTS v2 بموجب ترخيص CPML مجاني ولكنه للاستخدام غير التجاري فقط.

يُعد Bark by Suno مفتوح المصدر أيضاً ويستخدم ترخيص MIT لكل من التعليمات البرمجية وأوزان النموذج، مما يجعله قابلاً للاستخدام التجاري بالكامل دون قيود. تستخدم بنيته ثلاثة محولات (transformers) على غرار GPT مع حوالي 80 مليون معلمة لكل منها، وتعمل على رموز الصوت EnCodec. النطاق التوليدي لـ Bark أوسع من XTTS v2: فهو يولد الكلام والموسيقى وضوضاء الخلفية والأصوات غير اللفظية (الضحك والتنفس والتنهد) كل ذلك في تمريرة واحدة من موجه نصي. التنازل الكبير هو أن Bark لا يدعم بشكل أصلي استنساخ الصوت الفوري (zero-shot) لمتحدثين عشوائيين؛ بل يستخدم إعدادات مسبقة لمتحدثين محددين. تضيف النسخ المجتمعية إمكانية استنساخ الصوت من خلال أدوات تحويل خارجية، لكن النتائج غير متسقة. للحصول على تحويل نص إلى كلام (TTS) نقي مع اتساق المتحدث واستنساخ عبر اللغات، يُعد XTTS v2 أكثر موثوقية. أما بالنسبة لتوليد الصوت الإبداعي مع دمج المشاعر والمؤثرات الصوتية، فإن Bark يمتلك لوحة خيارات أوسع.

"أود أن أقول إنها حالياً أفضل مجموعة أدوات مفتوحة المصدر لتوليد واستنساخ الصوت متاحة في الوقت الحالي." - bachittle، GitHub Issues، يناير 2024
"التكنولوجيا التي تقف وراءها مذهلة وسيكون من الرائع لمجتمع البرمجيات مفتوحة المصدر (OSS) إذا أصبح النموذج مفتوح المصدر." - fakerybakery، GitHub Issues، يناير 2024

واقع التراخيص وحقوق النشر

وضع الترخيص لـ Coqui TTS منقسم، وهذا الانقسام يهم كثيراً بناءً على ما تقوم بتطويره.

تم ترخيص التعليمات البرمجية للمكتبة بموجب ترخيص Mozilla Public License 2.0 (MPL 2.0)، والذي يسمح بالاستخدام التجاري. إذا قمت بكتابة نماذجك الخاصة أو استخدمت فقط النماذج المرخصة بموجب Apache 2.0 داخل إطار العمل، فلن تواجه أي قيود تجارية على التعليمات البرمجية نفسها.

تم ترخيص أوزان نموذج XTTS v2 بموجب ترخيص Coqui Public Model License 1.0.0 (CPML). يسمح CPML بالاستخدام غير التجاري: الأبحاث الشخصية، ومشاريع الهواة، والعمل الأكاديمي، والاستخدام الخيري. ويضع حداً عند الأنشطة المدرة للدخل. قبل الإغلاق في يناير 2024، قدمت Coqui تراخيص XTTS تجارية مقابل $365/سنوياً للشركات التي تقل إيراداتها أو تمويلها عن $1M. لم يعد برنامج الترخيص هذا موجوداً لأن الشركة لم تعد موجودة. ولا يوجد كيان يمكن شراء ترخيص تجاري منه.

يخلق هذا عائقاً حقيقياً للمطورين الذين يبنون منتجات تجارية. على Hacker News، لخص أحد المساهمين المشكلة بوضوح: "أود العمل عليها أكثر، لكنني قلق من أن تكون طريقاً مسدوداً بسبب عدم اليقين بشأن مستقبل الترخيص." وأشار مستخدم آخر: "لا يزال نموذج XTTS يخضع لترخيص CPML، والذي لا يسمح بالاستخدام التجاري،" بينما أوضح ثالث أن تراخيص التعليمات البرمجية (MPL 2.0) وتراخيص النماذج المدربة مسبقاً منفصلة وليست قابلة للتبادل.

عملياً، لم يحل المجتمع هذه المشكلة. يستخدم بعض المطورين XTTS v2 تجارياً ويعتبرون مخاطر الإنفاذ منخفضة نظراً لأن Coqui لم تعد موجودة ككيان قانوني. يفضل آخرون التبديل إلى نماذج VITS بموجب ترخيص Apache 2.0 ضمن نفس إطار العمل، مع قبول جودة استنساخ صوت أقل مقابل حقوق تجارية نظيفة. توفر أوزان Bark المرخصة بموجب MIT بديلاً تجارياً بالكامل إذا كانت جودة الاستنساخ أقل أهمية. لا تزال قابلية الإنفاذ القانوني لترخيص CPML بموجب قانون حقوق النشر الأمريكي للمخرجات المولدة بالذكاء الاصطناعي موضع نزاع.

أين يقصر Coqui TTS بشكل ملحوظ

تثبيت وحدة معالجة الرسومات (GPU) على Windows. على نظام Windows الأصلي، يفشل تسريع وحدة معالجة الرسومات حتى عندما يتم تثبيت CUDA بشكل صحيح. الحل البديل المجتمعي هو WSL (نظام Windows الفرعي لـ Linux) أو جهاز ظاهري (VM) بنظام Ubuntu. يتفاجأ المستخدمون الذين يتوقعون مثبتاً قياسياً بانتظام. انتشرت عبارة "اليوم الثالث من محاولة التثبيت على Windows 11. مستعد للاستسلام والدفع لـ ElevenLabs" في القنوات المجتمعية طوال عام 2024. بدءاً من الإصدار 0.27.4، لم يعد PyTorch مضمناً ويجب تثبيته بشكل منفصل مع إصدار CUDA أو ROCm الصحيح، مما يضيف خطوة أخرى.

سرعة الاستدلال على وحدة المعالجة المركزية (CPU). بدون وحدة معالجة رسومات (GPU)، يولد XTTS v2 جملة واحدة تقريباً كل 30-60 ثانية. على وحدة معالجة الرسومات (بحد أدنى 4GB VRAM، ويُوصى بـ 8GB)، تستغرق نفس الجملة 2-5 ثوانٍ. بالنسبة لأي شخص ليس لديه وحدة معالجة رسومات مخصصة من NVIDIA أو AMD، فإن الأداة غير قابلة للاستخدام عملياً في مسارات العمل التفاعلية.

عدم تطابق إيقاع الصوت. نظراً لأن متنبئ المدة في XTTS v2 يتم تدريبه على بيانات المجموعة الأساسية بدلاً من المقطع المرجعي الخاص بك، فإن الصوت المستنسخ يتحدث بإيقاع متوسط، وليس بالإيقاع الطبيعي للمتحدث. في المقارنات الموثقة، أنتج هذا مخرجات أطول بـ 3-4 مرات من نفس النص من المحركات التجارية التي تأخذ عينات من معدل التحدث من الصوت المرجعي.

تداخل اللهجات في التوليد عبر اللغات. وجدت اختبارات مستقلة أن خصائص اللهجة من اللغة المرجعية تتداخل مع اللغات المستهدفة. فقد أنتج مقطع مصدر بلهجة ألمانية مخرجات فرنسية بلكنة ألمانية.

وتيرة صيانة أبطأ. يتم صيانة نسخة Idiap بنشاط وأصدرت v0.27.5 في يناير 2026، لكن وتيرة تطوير الميزات وحل المشكلات أبطأ مما كانت عليه عندما كانت شركة Coqui تدفع بإصدارات أسبوعية. لا تتلقى المشكلات المفتوحة في المستودع الأصلي المؤرشف أي ردود. وتتفاوت جودة الدعم المجتمعي.

لمن تم تصميم Coqui TTS

تم تصميم Coqui TTS للمطورين والباحثين الذين يحتاجون إلى استنساخ صوتي متعدد اللغات ومستضاف ذاتياً ولديهم البنية التحتية لوحدة معالجة الرسومات (GPU) وخبرة Python لنشره. إنه أقوى خيار مفتوح المصدر لاستنساخ الصوت غير التجاري تحديداً عبر لغات متعددة. التطبيقات الحساسة للخصوصية، والأبحاث الأكاديمية، والمشاريع الشخصية التي تحتاج إلى توليد كلام قابل للتكرار ومتحكم فيه محلياً هي الأنسب له.

يمكن للفرق التي تبني مسارات عمل لسرد الكتب الصوتية، أو خطوط حوار شخصيات الألعاب غير القابلة للعب (NPC)، أو أدوات إمكانية الوصول للنشر المحلي استخدام XTTS v2 بفعالية بمجرد تجاوز خطوة التثبيت. يعني دعم الضبط الدقيق أنه يمكنك التدريب على كلام خاص بمجال معين (المصطلحات الطبية، نطق العلامات التجارية) دون إرسال البيانات إلى واجهة برمجة تطبيقات (API) تابعة لجهة خارجية.

تجاوز Coqui TTS عندما: تقوم ببناء منتج تجاري يستخدم XTTS v2، حيث يمنع CPML الاستخدام التجاري والترخيص غير متاح. تحتاج إلى أكثر من 17 لغة أو تريد عناصر تحكم في المشاعر جاهزة للاستخدام مع واجهة شريط تمرير (ElevenLabs هو الحل هنا). أنت مستخدم غير تقني وليس لديك وصول إلى وحدة معالجة الرسومات (GPU)؛ منحنى الإعداد حاد واستدلال وحدة المعالجة المركزية (CPU) بطيء جداً ليكون مفيداً. تحتاج إلى توليد موسيقى ومؤثرات صوتية بأسلوب Bark من Suno إلى جانب الكلام. إذا كان وضوح الترخيص التجاري إلزامياً والمصدر المفتوح مطلوباً، فإن Bark بموجب ترخيص MIT هو البديل الأكثر أماناً على الرغم من افتقاره إلى استنساخ الصوت الأصلي.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن Coqui TTS.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Coqui TTS.