

OpenVoice هو نموذج استنساخ صوتي فوري مرخص من MIT ومطور من قبل MIT و MyShell AI. يقوم باستنساخ الصوت من مقطع مرجعي قصير، ويدعم اللغات الإنجليزية والإسبانية والفرنسية والصينية واليابانية والكورية، وهو مجاني للاستخدام التجاري بدون رسوم API.
يُعد OpenVoice نموذجاً مفتوح المصدر لاستنساخ الصوت الفوري، تم تطويره بالتعاون بين باحثين في MIT و MyShell AI. نُشر النموذج في ديسمبر 2023 (arXiv 2312.01479) وتم تحسينه بإصدار V2 في أبريل 2024، وهو يحل مشكلة محددة: تكرار النبرة الصوتية للمتحدث من مقطع مرجعي قصير وتوليد كلام جديد بذلك الصوت، بما في ذلك لغات لم يتحدث بها المتحدث الأصلي مطلقاً. يحظى المشروع بدعم MyShell AI، وهي منصة تضم أكثر من 5M+ مستخدم وتعتمد على OpenVoice كتقنية صوتية أساسية، ويحمل ترخيص MIT كاملاً، مما يعني أن أوزان النموذج مجانية للاستخدام التجاري دون أي متطلبات للإسناد أو دفع رسوم ملكية.
يدعم نموذج V2 بشكل أصلي اللغة الإنجليزية (باللهجات البريطانية والأمريكية والهندية والأسترالية) والإسبانية والفرنسية والصينية واليابانية والكورية، مع إمكانية الاستنساخ عبر اللغات بتقنية zero-shot للغات إضافية. وإلى جانب نسخ النبرة، يوفر OpenVoice تحكماً دقيقاً في أسلوب الصوت: حيث يمكن تعديل العاطفة واللهجة والإيقاع والسرعة والتنغيم بشكل مستقل عن الصوت الأساسي. يعمل النموذج محلياً على وحدة معالجة رسومات (GPU) تدعم CUDA، ويتكامل مع مسارات عمل Python عبر pip، ويتوفر كعرض توضيحي مستضاف على HuggingFace Spaces للاختبار دون الحاجة للتثبيت. واعتباراً من أبريل 2026، يمتلك مستودع GitHub أكثر من 36,400+ نجمة.
ما يقدمه OpenVoice في مايو 2026
يُعد OpenVoice V2، الذي تم إصداره في أبريل 2024، الإصدار المستقر الحالي. يقوم بإخراج كلام مُركب بالصوت المستنسخ باستخدام بنية ثنائية المراحل: حيث يتولى مولد صوت قائم على VITS معالجة مخرجات TTS الأساسية، بينما يقوم محول لون نبرة منفصل بتعيين الخصائص الصوتية للمتحدث المرجعي على تلك المخرجات. هذا الفصل هو ما يتيح الاستنساخ عبر اللغات، حيث تعمل عملية تعيين النبرة بشكل مستقل عن النموذج اللغوي، لذلك يمكن لصوت فرنسي أن يتحدث اليابانية دون أن يكون المتحدث المرجعي قد قام بذلك على الإطلاق.
تشمل اللغات المدعومة الإنجليزية (بأربعة متغيرات إقليمية للهجة) والإسبانية والفرنسية والصينية (الماندرين) واليابانية والكورية. تم الإشارة في الورقة البحثية إلى إمكانية الاستنساخ بتقنية zero-shot للغات خارج هذه المجموعة، وتعمل بموثوقية متغيرة اعتماداً على المسافة الصوتية من بيانات التدريب. تغطي عناصر التحكم في الأسلوب: العاطفة (مبتهج، حزين، غاضب، محايد، إلخ)، ومعدل التحدث، وطبقة الصوت، وكثافة التنغيم. تتوفر عناصر التحكم هذه عبر واجهة برمجة تطبيقات Python وفي العرض التوضيحي المحلي القائم على Gradio. توفر مساحة HuggingFace على huggingface.co/spaces/myshell-ai/OpenVoiceV2 واجهة لا تتطلب التثبيت للاختبار السريع عبر جميع أزواج اللغات الستة المدعومة.
يتميز النموذج بكفاءة حسابية من حيث التصميم. يزعم فريق MyShell أن التكاليف "أقل بعشرات المرات" من واجهات برمجة التطبيقات (APIs) التجارية. على وحدة معالجة رسومات NVIDIA من الفئة المتوسطة (مثل RTX 3070)، تستغرق المعالجة حوالي 1-2 ثانية لكل جملة. وعلى الأجهزة المبتدئة، توقع 8-12 ثانية لكل جملة. يُعد الاستدلال عبر وحدة المعالجة المركزية (CPU) ممكناً من الناحية الفنية ولكنه بطيء جداً للاستخدام العملي بسبب الإعداد الافتراضي الثابت لـ CUDA في وحدة استخراج النبرة.
موقع OpenVoice مقارنة بـ F5-TTS و Coqui XTTS-v2
يستخدم F5-TTS آلية توليد مختلفة جوهرياً: مطابقة التدفق (flow matching)، وهو نهج قائم على الانتشار يقوم بتحسين الضوضاء العشوائية بشكل متكرر إلى كلام متماسك. ينتج عن هذا عروض صوتية أكثر تعبيراً وطبيعية من البنية الأساسية لـ VITS الخاصة بـ OpenVoice في معظم المقارنات المباشرة، ويعالج F5-TTS النص في أقل من 7 ثوانٍ بينما يتطلب فقط 2,994 MB من ذاكرة وحدة معالجة الرسومات. الاختلاف العملي الحاسم هو الترخيص. كود F5-TTS مرخص بـ MIT، لكن أوزان النموذج المدربة مسبقاً مرخصة بـ CC-BY-NC-4.0 لأن التدريب استخدم مجموعة بيانات Emilia، والتي تحمل قيوداً غير تجارية. يتطلب بناء نشر F5-TTS قابل للاستخدام التجاري تدريب أوزان جديدة من الصفر على مجموعة بيانات مسموح بها، وهو استثمار هندسي كبير لا تستطيع معظم الفرق القيام به. في المقابل، تعني أوزان MIT الخاصة بـ OpenVoice V2 إمكانية النشر التجاري منذ اليوم الأول.
يتمتع Coqui XTTS-v2 بأوسع دعم للغات من بين الثلاثة: 16+ لغة بما في ذلك الألمانية والعربية والبولندية والتركية والروسية التي لا يغطيها OpenVoice بشكل أصلي. إن دعمه للبث المباشر ومعيار RTF القوي (0.482، بزمن انتقال 3.36 ثانية) يجعله منافساً للتطبيقات القريبة من الوقت الفعلي. ومع ذلك، أغلقت شركة Coqui AI أبوابها في أواخر عام 2023 بعد فشلها في العثور على نموذج عمل مستدام على الرغم من جمع تمويل بقيمة $3.3M. تتم صيانة قاعدة الكود الآن بواسطة Idiap Research Institute كتفرع مجتمعي. بالنسبة للفرق التي تبني على أفق طويل الأجل، فإن دعم OpenVoice من منصة نشطة وممولة (جمعت MyShell $11M في عام 2024) يوفر استمرارية مؤسسية أكبر من مشروع لشركة متوقفة تتم صيانته بواسطة متطوعين أكاديميين.
من الناحية العملية: اختر F5-TTS للحصول على أفضل جودة صوتية في بيئة بحثية غير تجارية. اختر Coqui XTTS-v2 إذا كنت بحاجة إلى لغات مثل العربية أو الألمانية وتقبل مخاطر الشركة المتوقفة. اختر OpenVoice عندما يكون الجمع بين أوزان MIT التجارية + تعدد اللغات + الجودة المعقولة + التكلفة الصفرية هو المعيار الحاسم. للحصول على جودة احترافية دون تعقيدات الإعداد، يُعد ElevenLabs و Resemble AI المعايير التجارية التي يُقاس بها OpenVoice، ولا يزالان في المقدمة بوضوح من حيث الطبيعية ودقة اللهجة.
"نقطة الضعف الرئيسية هي توقيت المقاطع اللفظية والتصريف -- يحاكي النظام إنساناً يحاول التحدث بطريقة آلية بدلاً من العروض الصوتية الطبيعية." -- amluto، Hacker News، يناير 2024
"تم اختباره باستخدام عينات صوتية متعددة. الإصدار مفتوح المصدر: فظيع. فظيع للغاية." -- RossDCurrie، Hacker News، يناير 2024
واقع الترخيص وحقوق النشر
تم إطلاق OpenVoice في أواخر عام 2023 بموجب ترخيص CC-BY-NC-4.0، وهو ترخيص يمنع الاستخدام التجاري صراحةً. على Hacker News، أشار المعلقون على الفور إلى هذا: "ينتهك الترخيص تعريفات مبادرة المصدر المفتوح التي تتطلب السماح بالاستخدام التجاري." لم تكن هذه شكوى بسيطة؛ بل كانت تعني أن أي شركة ترغب في إنتاج استنساخ صوتي باستخدام OpenVoice كانت ممنوعة قانوناً من القيام بذلك.
في أبريل 2024، أصدرت MyShell الإصدار V2 وأعادت ترخيص كل من V1 و V2 إلى MIT في نفس الوقت. أدى هذا إلى حل مسألة الاستخدام التجاري بالكامل. لا يفرض ترخيص MIT أي قيود على الاستخدام التجاري أو التعديل أو التوزيع. أدت إعادة الترخيص إلى نشاط تكامل فوري في مجتمع المصادر المفتوحة، بما في ذلك مشكلة تتبع في مشروع LocalAI بعنوان "openvoice v1 و v2 مرخصان الآن بـ MIT، دع local ai يدعمهما." بالنسبة لأي فريق يقيّم OpenVoice للنشر التجاري، فإن الإجابة اعتباراً من أبريل 2024 لا لبس فيها: الأوزان والكود والمخرجات ملك لك لاستخدامها تجارياً.
فارق بسيط واحد: تثير قدرة استنساخ الصوت نفسها أسئلة قانونية منفصلة حول الموافقة والتزييف العميق (deepfakes) والتي لا يعالجها ترخيص MIT. يمكن نظرياً استخدام OpenVoice، مثل Whisper وأدوات الذكاء الاصطناعي الصوتية الأخرى، لاستنساخ الأصوات دون موافقة المتحدث. هذا مصدر قلق يتعلق بالسياسة والأخلاقيات، وليس مصدر قلق يتعلق بالترخيص، ولكن يجب على الفرق التي تبني منتجات موجهة للمستهلكين تنفيذ التحقق من الموافقة على جانب إدخال الصوت المرجعي. تتطلب منصة MyShell الخاصة من المستخدمين تأكيد امتلاكهم لحقوق الصوت المرجعي.
أين يقصر OpenVoice بشكل ملحوظ
الشكوى الأكثر اتساقاً عبر مشكلات GitHub، وموضوع الإطلاق على Hacker News، ومراجعات الجهات الخارجية هي تسطيح اللهجة. يجد المتحدثون باللغة الإنجليزية من غير الأمريكيين أن OpenVoice يحول لهجتهم نحو الإنجليزية الأمريكية بدلاً من الحفاظ عليها. تقرأ إحدى مشكلات GitHub: "لقد سجلت صوتي، لكن الاستدلال أعطاني مخرجات تبدو أمريكية -- أنا بريطاني." هذا نتيجة مباشرة لتوزيع بيانات التدريب؛ فقد رأى النموذج نسبة أكبر من الإنجليزية الأمريكية مقارنة باللهجات الإنجليزية الأخرى. المخرجات الإسبانية والفرنسية والصينية والكورية أفضل بشكل عام، لكن المتحدثين الأصليين بهذه اللغات يبلغون أيضاً عن عيوب عرضية في العروض الصوتية.
جودة التثبيت المحلي دائماً ما تكون أقل من العرض التوضيحي المستضاف. تنتج مساحة HuggingFace وتطبيق MyShell app.myshell.ai نتائج أفضل من التثبيت المستضاف ذاتياً الذي يعمل بأوزان نقاط فحص متطابقة. يُشتبه في أن الفجوة تأتي من مسارات معالجة لاحقة مختلفة في الإصدار المستضاف، لكن MyShell لم توثق ذلك. بالنسبة للفرق التي تتطلب خصوصيتها الاستضافة الذاتية، فإن الجودة التي يختبرونها في العرض التوضيحي ليست بالضرورة ما سيحصلون عليه في الإنتاج.
تُعد تعقيدات الإعداد كبيرة للفرق غير المتمرسة في Python. يتطلب OpenVoice إصدار Python 3.9 تحديداً (وليس 3.10 أو 3.11 أو 3.12)، ووحدة معالجة رسومات NVIDIA متوافقة مع CUDA، وإدارة بيئة conda، وتثبيتاً منفصلاً لتبعيات MeloTTS. توثق مشكلات GitHub حالات الفشل عبر تثبيتات conda و miniconda و Docker و Windows. واعتباراً من أواخر عام 2025، أبلغ المستخدمون عن أخطاء ناتجة عن تعارضات في إصدارات `pkg_resources` المهملة و `ctranslate2`، مما يشير إلى أن إدارة التبعيات تتخلف عن نظام Python البيئي. تُعد مساحة HuggingFace نقطة الدخول العملية للتقييم؛ فالتثبيت المحلي هو مهمة هندسية غير بسيطة تُقدر بـ 2-4 ساعات حتى للمطورين ذوي الخبرة.
استنساخ الصوت في الوقت الفعلي غير قابل للتطبيق. يتراوح زمن الانتقال بين 1-12 ثانية لكل جملة اعتماداً على الأجهزة، مما يلغي حالات استخدام المحادثة المباشرة أو البث. تمتلك أدوات مثل PlayHT و ElevenLabs واجهات برمجة تطبيقات للبث بزمن انتقال للرمز الأول (first-token latency) يقل عن ثانية واحدة، وهو ما لا يمكن لـ OpenVoice مجاراته كنموذج دفعات مستضاف ذاتياً.
دعم Windows محدود. معظم مشكلات GitHub التي توثق عمليات التثبيت الناجحة تكون على نظام Linux. يبلغ مستخدمو Windows عن إخفاقات إضافية في التبعيات تتعلق بعدم تطابق إصدارات PyTorch CUDA وعدم توافق torchvision. لا توجد صورة Docker رسمية للإصدار V2، وتتفاوت حلول Docker التي يديرها المجتمع في موثوقيتها. بالنسبة للفرق التي تستخدم Windows فقط، تُعد المساحة المستضافة على HuggingFace هي المسار الأكثر واقعية للتقييم.
لمن تم تصميم OpenVoice
أقوى مستخدمي OpenVoice هم المطورون وفرق المحتوى الذين يحتاجون إلى أساس لاستنساخ الصوت قابل للاستخدام التجاري ومستضاف ذاتياً بتكلفة صفرية. تحصل استوديوهات الألعاب التي تستخدمه لتوليد اختلافات في حوارات الشخصيات غير القابلة للعب (NPC) من جلسة ممثل صوتي واحد على أكبر قيمة: حيث يزيل ترخيص MIT المخاطر القانونية، ويتيح الدعم متعدد اللغات لتسجيل واحد أن يغطي أسواقاً متعددة، ويجعل التوليد بكميات كبيرة رسوم واجهة برمجة التطبيقات (API) لكل حرف غير قابلة للتطبيق على أي حال. تُعد مسارات التعلم الإلكتروني والسرد الآلي التي يمكنها تحمل بعض العيوب في العروض الصوتية مقابل خفض التكلفة بنسبة 60-95% مقارنة بواجهات برمجة تطبيقات ElevenLabs أو Resemble AI خياراً قوياً آخر. سيجد الباحثون الذين يدرسون بنية استنساخ الصوت أن قاعدة الكود موثقة جيداً وأن ترخيص MIT يتيح العمل المشتق. يستفيد المطورون الذين يبنون مسارات محتوى متعددة اللغات لأسواق مثل الصين أو اليابان أو كوريا من التغطية الأصلية لـ V2 لتلك اللغات إلى جانب الإنجليزية والإسبانية والفرنسية في نموذج واحد موحد.
تجاوز OpenVoice عندما يكون اتساق الجودة أمراً غير قابل للتفاوض. السرد الاحترافي للكتب الصوتية، وإنتاج البودكاست القائم على الشخصيات، وأي منتج يسمع فيه المستخدمون النهائيون المخرجات مباشرة ويقارنونها بالكلام البشري سيكشف عن نقاط ضعف OpenVoice في العروض الصوتية واللهجة. يجب على المستخدمين غير التقنيين استخدام العرض التوضيحي لـ HuggingFace أو منصة MyShell بدلاً من محاولة التثبيت المحلي. يجب على الفرق التي تحتاج إلى أكثر من ست لغات أصلية ولا يمكنها قبول مخاطر الصيانة لحالة Coqui المتوقفة تقييم البدائل التجارية. بالنسبة لحالات استخدام تحويل الصوت في الوقت الفعلي أو المحادثة المباشرة، فإن OpenVoice غير مناسب معمارياً؛ حيث أن الحد الأدنى لزمن الانتقال مرتفع جداً.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن OpenVoice.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ OpenVoice.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
