

F5-TTS هو نموذج مفتوح المصدر لتحويل النص إلى كلام، يقوم باستنساخ أي صوت من عينة صوتية مدتها 10-15 ثانية باستخدام مطابقة التدفق (flow matching). تم تطويره بواسطة باحثين في جامعة Shanghai Jiao Tong وجامعة Cambridge، ويعمل بالكامل على الأجهزة المحلية دون أي تكاليف لواجهة برمجة التطبيقات (API).
نظام F5-TTS هو نظام لتحويل النص إلى كلام غير انحداري بالكامل (non-autoregressive) مبني على مطابقة التدفق (flow matching) مع بنية Diffusion Transformer، تم تطويره بواسطة باحثين في جامعة Shanghai Jiao Tong، وجامعة Cambridge، ومعهد Gile Auto Research Institute. تم إصداره للجمهور في أكتوبر 2024 إلى جانب ورقته البحثية على arXiv (arXiv:2410.06885) وتم قبوله في الإجراءات الرئيسية لمؤتمر ACL 2025، وهو أحد أبرز المحافل في مجال معالجة اللغات الطبيعية. حصد المشروع 14.4k نجمة على GitHub، وأكثر من 600,000 تنزيل شهري على Hugging Face، و89 متغيراً محسّناً (fine-tuned) بمساهمة من المجتمع، مما يجعله أحد أكثر أنظمة تحويل النص إلى كلام (TTS) مفتوحة المصدر اعتماداً منذ إطلاقه. الكود البرمجي مرخص بموجب ترخيص MIT؛ بينما تحمل أوزان النموذج المدرب مسبقاً ترخيص CC-BY-NC-4.0 بسبب استخدام مجموعة بيانات Emilia في التدريب.
يمكن للنموذج استنساخ الصوت من 3-15 ثانية من الصوت المرجعي دون أي تحسين إضافي (fine-tuning)، مما ينتج كلاماً يبدو طبيعياً مع الحفاظ على نبرة وإيقاع المتحدث المرجعي. يأتي النموذج بإصدارين أساسيين: F5TTS_Base (الإصدار الأصلي في أكتوبر 2024) و F5TTS_v1_Base (مارس 2025، بجودة محسنة واستدلال أسرع). يعمل كلا الإصدارين على أجهزة NVIDIA و AMD و Intel و Apple Silicon. ينتج منفذ MLX المخصص بواسطة Lucas Newman عينات في حوالي 4 ثوانٍ على معالج M3 Max. بالنسبة للمطورين الذين يرغبون في الوصول البرمجي دون الحاجة إلى واجهة برمجة تطبيقات (API) مستضافة، يندمج F5-TTS مباشرة في مسارات عمل Python عبر حزمة pip الخاصة به، أو واجهة مستخدم الويب Gradio، أو واجهة سطر الأوامر (CLI). ويتكامل بشكل طبيعي مع Whisper لمسارات عمل تحويل النسخ الصوتي إلى كلام.
ما يقدمه F5-TTS في أبريل 2026
مخرجات النموذج عبارة عن صوت ستيريو أو أحادي (mono) يتم إنشاؤه من مشفر صوتي (vocoder) مثل Vocos أو BigVGAN، مع عامل وقت فعلي (RTF) يبلغ 0.15، مما يعني أنه يولد الصوت أسرع بحوالي 6.7 مرة من الوقت الفعلي على الأجهزة المدعومة. يستغرق الاستدلال لمعظم المدخلات التي بحجم الجملة أقل من 7 ثوانٍ. تقلل استراتيجية الاستدلال Sway Sampling، التي تم تقديمها في الورقة البحثية الأصلية، بشكل كبير من خطوات إزالة الضوضاء (denoising) المطلوبة دون التضحية بالجودة، مما يمنحه ميزة عملية على أنظمة تحويل النص إلى كلام (TTS) السابقة القائمة على الانتشار (diffusion) والتي كانت تتطلب 50-100 خطوة DDPM.
يغطي دعم اللغات الأساسي اللغتين الإنجليزية والصينية (الماندرين) مع التبديل السلس بينهما في منتصف الكلام، وهي قدرة تقيسها الورقة البحثية بشكل خاص. جذبت بساطة البنية تحسينات (fine-tunes) من المجتمع للغات البولندية والعربية والتركية والإندونيسية ولغات أخرى، على الرغم من أن هذه اللغات تتطلب 10-100 ساعة من بيانات التدريب باللغة المستهدفة للوصول إلى قدرة الاستنساخ الفوري (zero-shot). أدى نموذج F5TTS_v1_Base، الذي تم إصداره في 12 مارس 2025، إلى تحسين العروض ووضوح الكلام في النموذج الأساسي، وهو نقطة البداية الموصى بها لعمليات النشر الجديدة اعتباراً من أبريل 2026.
متطلبات الأجهزة في المتناول وفقاً لمعايير المصادر المفتوحة. يتم تحميل النموذج بسلاسة في حوالي 3GB من ذاكرة الوصول العشوائي للفيديو (VRAM) الخاصة بوحدة معالجة الرسومات (GPU). يمكن لمستخدمي Apple Silicon تشغيل منفذ MLX الأصلي دون الحاجة إلى حزمة CUDA. الاستدلال باستخدام وحدة المعالجة المركزية (CPU) فقط ممكن ولكنه بطيء. يوفر المشروع صور Docker وواجهة Gradio لكل من الاستدلال والتحسين (fine-tuning)، مما يجعله قابلاً للنشر على محطة عمل منزلية أو مثيل GPU سحابي. بالنسبة للفرق التي تبني مسارات عمل صوتية، يمكن ربط مخرجات F5-TTS مع AudioRead لمعالجة الصوت في المراحل اللاحقة.
موقع F5-TTS مقارنة بـ OpenVoice V2 و Coqui XTTS-v2
الاختلافات الجوهرية بين هذه النماذج الثلاثة هي اختلافات معمارية وليست سطحية.
OpenVoice V2 (MyShell AI، أبريل 2024): يستخدم OpenVoice مسار عمل ثنائي المراحل. أولاً، يقوم نموذج TTS أساسي (MeloTTS) بتوليد كلام طبيعي باللغة المستهدفة. ثم تقوم وحدة منفصلة وخفيفة الوزن لتحويل لون النبرة، مبنية على تشفير وفك تشفير المتحدث بأسلوب VITS، باستنساخ طابع الصوت المرجعي فوقه. هذا الفصل يعني أن التوليد والاستنساخ هما خطوتان مستقلتان. الفائدة هي التحكم الصريح والدقيق في العاطفة واللكنة والإيقاع والتوقفات المؤقتة والتنغيم كأدوات تحكم منفصلة. القيد هو أن جودة المخرجات مقيدة بنموذج TTS الأساسي، ويؤدي النهج ثنائي المراحل إلى ظهور تشوهات (artifacts) عند تطبيق تحويل الطابع الصوتي بشكل مكثف. يحمل OpenVoice V2 أيضاً ترخيص MIT متساهل بالكامل، مما يعني أنه يمكن استخدامه في المنتجات التجارية دون متطلبات التدريب من الصفر التي يفرضها F5-TTS. يدعم OpenVoice V2 بشكل أصلي اللغات الإنجليزية والإسبانية والفرنسية والصينية واليابانية والكورية مباشرة.
Coqui TTS / XTTS-v2 (شركة متوقفة، النموذج لا يزال نشطاً): يستخدم XTTS-v2 نموذجاً انحدارياً (autoregressive) بأسلوب GPT-2 للتنبؤ بالرموز (tokens) مقترناً بمشفر صوتي HiFi-GAN. نظراً لأنه يولد الرموز الصوتية بشكل تسلسلي، فإنه يدعم البث (streaming) بوقت يقارب 200ms لأول مقطع، مما يجعله مناسباً للتطبيقات الصوتية في الوقت الفعلي. نهج مطابقة التدفق غير الانحداري في F5-TTS يولد جميع الإطارات بالتوازي عبر إزالة الضوضاء، مما ينتج عنه توليد مجمع أسرع ولكنه يجعل البث الأصلي صعباً من الناحية المعمارية. الميزة الأقوى لـ XTTS-v2 هي تغطية اللغات: 17 لغة بما في ذلك الألمانية والإيطالية والبرتغالية والروسية والبولندية والتركية والهولندية والتشيكية والعربية واليابانية والمجرية والكورية والهندية، مقابل الإنجليزية والصينية الأساسيتين في F5-TTS. أغلقت شركة Coqui AI أبوابها في أوائل عام 2024؛ ويتم صيانة النموذج بواسطة تفرع مجتمعي "coqui-tts" على PyPI ولكنه يواجه مشكلات توافق متزايدة مع إصدارات PyTorch الحديثة. بالنسبة للفرق التي تحتاج إلى استنساخ الصوت بأي من تلك اللغات الـ 17 اليوم، يظل XTTS-v2 هو الخيار الافتراضي مفتوح المصدر على الرغم من مخاطر الصيانة.
"الاستنساخ الذي قام به باستخدام المرجع ذي الـ 10 ثوانٍ جيد بشكل مدهش. لم أتوقع أن يعطي مثل هذه النتيجة الناجحة بهذه الطريقة البسيطة." - srkngl، نقاشات HuggingFace (SWivid/F5-TTS #12)، 28 نوفمبر 2024
في مواجهة البدائل التجارية مثل ElevenLabs أو PlayHT، يقايض F5-TTS الراحة والتعدد اللغوي الواسع مقابل انعدام تكاليف واجهة برمجة التطبيقات (API) المستمرة والخصوصية الكاملة للبيانات. كل عملية توليد تبقى على أجهزتك الخاصة. بالنسبة للمطورين الذين يبنون ميزات صوتية في تطبيقات ذات حجم كبير أو بيانات صوتية حساسة، فإن هذه المقايضة غالباً ما تستحق عناء الإعداد.
واقع الترخيص وحقوق النشر
يتمتع F5-TTS بهيكل ترخيص منقسم يفاجئ العديد من المطورين. مستودع الكود البرمجي مرخص بموجب ترخيص MIT، وهو متساهل بالكامل: يمكنك عمل تفرع (fork) له، وتعديله، واستخدامه في البرامج التجارية دون قيود. ومع ذلك، فإن أوزان النموذج المدرب مسبقاً تحمل ترخيص CC-BY-NC-4.0 بسبب تدريبها على مجموعة بيانات Emilia، والتي تعمل بموجب شروط CC-BY-NC الخاصة بها.
الآثار العملية: لا يمكنك استخدام أوزان نماذج F5TTS_Base أو F5TTS_v1_Base الرسمية في منتج تجاري، وهذا القيد يظل سارياً حتى بعد التحسين (fine-tuning). أكد المشرف على المشروع هذا الأمر مباشرة في نقاش GitHub رقم 997: "لا يمكن استخدام النموذج الأساسي المدرب على بيانات Emilia بترخيص CC-BY-NC تجارياً حتى بعد التحسين." لبناء منتج صوتي تجاري على بنية F5-TTS، يجب عليك تدريب نموذج أساسي جديد من الصفر باستخدام بيانات مسموح بها تجارياً، دون تحميل أي أوزان مشتقة من Emilia كنقطة انطلاق. يتطلب هذا كحد أدنى 10-100 ساعة من الصوت باللغة المستهدفة وميزانية كبيرة لوحدات معالجة الرسومات (GPU)، وهو أمر ليس بالسهل للمطورين المستقلين.
بالنسبة للمشاريع غير التجارية (البحث، التعليم، الأدوات الشخصية، مشاريع الهواة)، لا يشكل هيكل الترخيص هذا أي عقبة. النموذج مجاني حقاً للاستخدام في هذه الأغراض، ويعني ترخيص الكود المتساهل أنه يمكنك نشره كما تشاء. ولكن إذا كنت تبني منتج SaaS، أو واجهة برمجة تطبيقات (API) صوتية تجارية، أو أي تطبيق يحقق أرباحاً، فراجع هذا القيد بعناية قبل دمج أوزان F5-TTS. هذه هي الميزة الرئيسية التي يتمتع بها OpenVoice V2 بأوزانه المرخصة بموجب MIT، ولهذا السبب يشهد هذا النموذج اعتماداً تجارياً أكبر على الرغم من أن جودة مخرجاته الخام قد تكون أقل. أدوات مثل ComfyUI تعاملت بالمثل مع ضغوط المجتمع حول أوزان النماذج المقيدة من خلال الحفاظ على فصل واضح بين كود إطار العمل المرخص بموجب MIT والشروط الخاصة بالنموذج.
أين يقصر F5-TTS بشكل ملحوظ
تظهر العديد من المشكلات المتكررة عبر مشكلات GitHub، ونقاشات HuggingFace، وقنوات المجتمع:
تسارع سرعة النصوص الطويلة: الخطأ الأكثر إبلاغاً عنه باستمرار. عند حوالي 200 كلمة، تكون سرعة الكلام طبيعية. عند 300 كلمة، تتسارع بشكل ملحوظ. عند 500+ كلمة، تصبح المخرجات سريعة جداً لدرجة يصعب فهمها. السبب الجذري هو صيغة حساب المدة في utils_infer.py التي تقلل من تقدير الوقت المطلوب مع زيادة طول النص. وثق المستخدم hotdogarea الضغط التدريجي في مشكلة GitHub رقم 811 (فبراير 2025): 42 حرفاً بمعدل 0.051 ثانية/حرف، 146 حرفاً بمعدل 0.014 ثانية/حرف، 374 حرفاً بمعدل 0.006 ثانية/حرف. تم إغلاق المشكلة ولكن السلوك الأساسي لا يزال مستمراً في مسارات عمل المستندات الطويلة.
انحراف التبعيات الذي يسبب مخرجات غير مفهومة: بين يناير ومارس 2025، واجه العديد من المستخدمين في العرض التوضيحي العام على HuggingFace (mrfakename/E2-F5-TTS) صوتاً تدهور إلى مخرجات مشوهة وغير مفهومة بعد أن كان يعمل بشكل صحيح في البداية. وصفه المستخدم bigbrotherr بأنه "كلام غير مفهوم وهراء" بعد 13 محاولة. كان السبب الجذري هو انحراف التبعيات (dependency drift) بين مساحة العمل (Space) والمستودع الرئيسي؛ وتطلب الإصلاح إعادة الاستنساخ (re-cloning) في بيئة افتراضية جديدة. هذا واقع متوقع للنماذج المستضافة ذاتياً ولكنه يستحق التخطيط له في عمليات النشر الإنتاجية.
"أنا أستخدم نفس الصوت والنص اللذين كانا يعملان من قبل، ولكن بعد عدم استخدامه منذ 1/10/25، أصبحت المخرجات الآن مجرد كلام غير مفهوم." - gmirsky2، مساحات HuggingFace (نقاش mrfakename/E2-F5-TTS رقم 48)، 11 مارس 2025
تعقيد التثبيت على macOS: يتطلب تشغيل F5-TTS على Apple Silicon إعداداً دقيقاً، وتحديداً تجنب حزم CUDA المدارة بواسطة conda (والتي لا توجد لمعالجات M2/M3) وتمكين التراجع إلى MPS عبر متغير البيئة PYTORCH_ENABLE_MPS_FALLBACK=1. عادةً ما يواجه المستخدمون الذين يقومون بالتثبيت دون فهم هذه القيود جودة صوت رديئة أو أعطالاً قبل حل مشكلة التكوين.
مخرجات غير قابلة للبث: بنية مطابقة التدفق هي بطبيعتها غير انحدارية (non-autoregressive): فهي تولد جميع الإطارات الصوتية عبر عملية إزالة ضوضاء متوازية. هذا يعني أنه لا يمكنك بث الصوت إلى مكبر الصوت بمجرد وصول الرموز (tokens)، كما يفعل XTTS-v2. يجب إنشاء المقطع بالكامل قبل بدء التشغيل. بالنسبة للتطبيقات الصوتية الحوارية أو الاستخدام في الوقت الفعلي بزمن انتقال منخفض، يعد هذا حداً معمارياً صارماً.
تغطية لغوية محدودة مباشرة: على الرغم من أن الورقة البحثية تصفه بأنه "متعدد اللغات"، إلا أن النموذج الافتراضي في الممارسة العملية يتعامل مع الإنجليزية والصينية بشكل جيد. تتطلب اللغات الأخرى تحسيناً (fine-tuning) باستخدام بيانات كبيرة باللغة المستهدفة. يُظهر منتدى نقاشات GitHub جهوداً مجتمعية نشطة للغات العربية والبولندية والإندونيسية والتركية، ولكن هذه مساهمات من المجتمع وليست مدعومة رسمياً.
لمن تم تصميم F5-TTS
استخدمه عندما: تحتاج إلى استنساخ صوتي عالي الجودة لمحتوى غير تجاري باللغة الإنجليزية أو الصينية وتريد التخلص من تكاليف واجهة برمجة التطبيقات (API) المستمرة. يتفوق في سرد الكتب الصوتية (توليد فصول من مقطع مرجعي مدته 15 ثانية بصوتك الخاص)، وحوارات الألعاب المستقلة (توليد جميع خطوط شخصيات NPC محلياً دون رسوم لكل حرف)، وإنتاج البودكاست (الحفاظ على صوت متسق عبر المحتوى دون إعادة التسجيل). سيجد الباحثون العاملون في مجال تحويل النص إلى كلام (TTS)، أو تحويل الصوت، أو توليد الكلام أن ترخيص كود MIT وبنية DiT النظيفة سهلة التوسيع. إذا كنت تبني على Apple Silicon وتريد مسار عمل MLX أصلياً بدون CUDA، فإن منفذ المجتمع جاهز للإنتاج. يتكامل F5-TTS أيضاً بشكل طبيعي مع Whisper لمسارات عمل مغلقة الحلقة من النسخ الصوتي إلى الكلام المستنسخ، ومع أنماط التحسين الخاصة بـ Coqui TTS للفرق المعتادة بالفعل على مسارات العمل الصوتية مفتوحة المصدر.
تخطاه عندما: يكون مشروعك تجارياً ولا يمكنك التدريب من الصفر على بيانات متوافقة مع CC-BY. تخطاه إذا كنت بحاجة إلى تغطية قوية لأكثر من لغتين دون استثمار كبير في التحسين (fine-tuning). تخطاه إذا كان تطبيقك يتطلب بثاً صوتياً في الوقت الفعلي (مساعدين حواريين بزمن انتقال منخفض، توليد صوتي مباشر). تخطاه إذا كان فريقك يفتقر إلى خبرة إدارة بيئة Python، حيث أن مشكلات التبعية هي وضع الفشل الأكثر شيوعاً. للحصول على نظام TTS متعدد اللغات من الدرجة التجارية، تقدم ElevenLabs أو PlayHT واجهات برمجة تطبيقات (APIs) مُدارة بتغطية لغوية أوسع، وموثوقية استضافة، وشروط تجارية واضحة، بتكاليف لكل حرف تستحق التقييم مقابل العبء التشغيلي للاستضافة الذاتية.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن F5-TTS.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ F5-TTS.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

What People Are Building With Claude Fable 5 (And Which Viral Demos Are Fake)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
