تخطَّ إلى المحتوى الرئيسي
Vantaige
Stable Audio screenshot
Stable Audio logo

Stable Audio

مجاني جزئيًا

يُنشئ Stable Audio موسيقى آلية ومؤثرات صوتية خالية من حقوق الملكية من خلال المطالبات النصية بجودة ستيريو 44.1kHz. تم تطويره بواسطة Stability AI بالاعتماد على مجموعة بيانات مرخصة بالكامل، ويتفوق في المقاطع الصوتية الخلفية، والموسيقى المحيطية، والتصميم الصوتي -- وليس الأغاني الصوتية.

حالات الاستخدام:الصوت والموسيقى
الميزات:APIOpen Source

تُعد Stable Audio منصة Stability AI لتوليد الصوت والموسيقى، وقد بُنيت خصيصاً على مجموعة بيانات مرخصة بدلاً من التسجيلات المحمية بحقوق الطبع والنشر التي يتم جمعها من الإنترنت. تقبل الأداة المطالبات النصية، وفي باقاتها المدفوعة، تقبل الملفات الصوتية المرفوعة، وتُنتج مقاطع ستيريو بجودة 44.1kHz. إنها ليست أداة لتوليد الأغاني على غرار Suno: فلا توجد أصوات غنائية، ولا كلمات، ولا هياكل تتكون من مقاطع ولازمة. أما ما تُنتجه -- من موسيقى آلية، ومقاطع صوتية محيطية، ومؤثرات صوتية منفصلة -- فهي تفعله بسرعة، وبشكل قانوني، وبمستوى جودة يصمد في مشاريع الفيديو والألعاب التجارية.

يتوفر المنتج في شكلين متوازيين. يقدم تطبيق الويب للمستهلكين على stableaudio.com واجهة توليد مباشرة مع أربع باقات اشتراك (من Free إلى Max) وحد أقصى للمخرجات يبلغ ثلاث دقائق لكل عملية توليد. أما المسار المؤسسي، Stable Audio 2.5 الذي تم إصداره في سبتمبر 2025، فيضيف ميزة الرسم الداخلي للصوت (audio inpainting)، والتوليد الهيكلي متعدد الأجزاء، وسرعات توليد تقل عن ثانيتين على وحدات معالجة الرسومات H100 -- ويمكن الوصول إليه عبر Stability AI API، و Replicate، و ComfyUI، و Fal. يوفر إصدار منفصل مفتوح المصدر، Stable Audio Open 1.0، أوزان نموذج قابلة للتنزيل مجاناً تم تدريبها على تسجيلات مرخصة برخص المشاع الإبداعي (CC) من Freesound و Free Music Archive، على الرغم من أن مخرجاته تقتصر على 47 ثانية وتميل نحو المؤثرات الصوتية بدلاً من الموسيقى.

ما الذي يُنتجه Stable Audio في أبريل 2026

يُولد تطبيق الويب التجاري ما يصل إلى ثلاث دقائق من الصوت الستيريو بجودة 44.1kHz لكل عملية توليد. يُدخل المستخدمون مطالبات نصية تصف النوع الموسيقي، والمزاج، والإيقاع، والآلات الموسيقية، وهيكل المقطع المقصود (المقدمة، التصاعد، الذروة، الخاتمة). تكتمل عمليات التوليد في أقل من 60 ثانية لمعظم المطالبات. يتيح وضع الصوت إلى الصوت (Audio-to-audio)، المتوفر في جميع الباقات المدفوعة، للمستخدمين رفع ملف مرجعي لتوجيه إيقاع المخرجات وطابعها الصوتي، مع قيام نظام اكتشاف حقوق الطبع والنشر بفحص الملفات المرفوعة تلقائياً والإبلاغ عن المواد المملوكة لجهات خارجية.

يضيف Stable Audio 2.5 ميزة الرسم الداخلي للصوت (audio inpainting): ارفع مقطعاً، وحدد منطقة أو نقطة بداية، وسيقوم النموذج بتوليد تكملة متماسكة موسيقياً. يُعد هذا مهماً لأعمال الصوت الخاصة بالعلامات التجارية ومرحلة ما بعد الإنتاج، حيث يكون الهدف هو تمديد أو تكييف مقطوعة موجودة بدلاً من التوليد من الصفر. تتيح طريقة التدريب ARC (Adversarial Relativistic-Contrastive) التي يعتمد عليها الإصدار 2.5 تحقيق سرعات التوليد المزعومة وتُنتج تطوراً موسيقياً أكثر تعقيداً عبر أقسام المقدمة، والانتقال، والخاتمة مقارنةً بالإصدار 2.0.

يستخدم نموذج Stable Audio Open 1.0 على Hugging Face بنية انتشار DiT قائمة على المحولات (transformer-based) مع تكييف نصي قائم على T5 ومشفر تلقائي ضاغط. تم تدريبه على 486,492 تسجيلاً صوتياً: 472,618 من Freesound و 13,874 من Free Music Archive، جميعها مرخصة بموجب CC0، أو CC BY، أو CC Sampling+. يستهدف نموذج مرافق أصغر، Stable Audio Open Small (مايو 2025)، الاستدلال على الأجهزة والنشر على الهواتف المحمولة. يقتصر كلا المتغيرين المفتوحين على مخرجات مدتها 47 ثانية ويقدمان أداءً أفضل في المؤثرات الصوتية والتسجيلات الميدانية مقارنةً بالموسيقى المهيكلة.

موقع Stable Audio مقارنةً بـ Suno و Udio

غالباً ما يتم تأطير المقارنة الثلاثية كسباق خيول، ولكن من الأدق التعامل معها كأدوات مختلفة لمخرجات مختلفة. يُعد Suno v5.5 في المقام الأول أداة لتوليد الأغاني الصوتية. تدمج بنيته القائمة على النماذج اللغوية الكبيرة (LLM-first) الكلمات والتركيب الصوتي في تمريرة واحدة، مما يُنتج أغاني كاملة المهيكلة مع صياغة طبيعية، واهتزاز صوتي (vibrato)، وديناميكيات عاطفية. يُولد مقاطع أصلية مدتها أربع دقائق في حوالي 30 ثانية ويمتد إلى 10 دقائق عبر ميزة Extend الخاصة به. لا يدعم تكييف الإدخال من الصوت إلى الصوت. ويخضع وضع بيانات التدريب الخاصة به لدعاوى قضائية نشطة تتعلق بحقوق الطبع والنشر.

"بالنسبة لتوليد الأغاني الفوري، لا يزال Suno يبدو في الصدارة." -- مراجعة Audiocipher، أبريل 2024، مُحدثة في أبريل 2025

كان Udio 1.5 (ما قبل أكتوبر 2025) المنافس الذي يضع الجودة أولاً للموسيقى الغنائية، باستخدام نموذج قائم على الانتشار مع كلمات موجهة بواسطة النماذج اللغوية الكبيرة (LLM) ومقاطع أصلية مدتها 32 ثانية تُدمج لتصل إلى 15 دقيقة. كانت دقة الصوت الخاصة به في المقاطع الغنائية الممتدة تُعتبر على نطاق واسع متفوقة قليلاً على Suno من حيث الجودة الخام، على الرغم من أنها أبطأ بحوالي 90 ثانية لكل عملية توليد. في أكتوبر 2025، قام Udio بتسوية دعواه القضائية مع شركات التسجيل الكبرى عن طريق تعطيل تنزيلات المستخدمين والتحول إلى نموذج مقيد "مرخص فقط" (Licensed-Only). كان رد فعل المجتمع حاداً -- اكتشف المبدعون الذين أمضوا أشهراً في تحسين الأصوات أنهم لم يعودوا قادرين على تصدير إبداعاتهم الخاصة.

"أكد العديد من مستخدمي Reddit كيف أصبح Udio نظاماً مغلقاً نظراً لأن المبدعين لم يعودوا قادرين على تنزيل أغانيهم، وهي ميزة تم التخلص منها تدريجياً بصمت." -- AI Tool Discovery، مراجعة Suno AI على Reddit لعام 2026

يحتل Stable Audio مساراً منفصلاً. إنه أداة الموسيقى الآلية والتصميم الصوتي. فبينما يتنافس Suno و Udio على من يمكنه توليد أغنية البوب الأفضل، يُولد Stable Audio الخلفية المحيطية تحت تلك الأغنية، ونقرة واجهة المستخدم في اللعبة، والطنين الجوي خلف مشهد الفيلم. يُعد الحد الأقصى البالغ ثلاث دقائق قيداً لمنتجي الموسيقى ولكنه غير ذي صلة إلى حد كبير بحالات استخدام التصميم الصوتي حيث تكون الحلقات التي تتراوح من 30 إلى 60 ثانية هي المعيار. إن وظيفة تصدير المسارات المنفصلة (stem export)، التي أشارت إليها مجتمعات منتجين متعددة كميزة تنافسية صديقة لبرامج DAW، غائبة عن مخرجات المستهلكين في كل من Suno و Udio.

واقع الترخيص وحقوق الطبع والنشر

إن الادعاء الأكثر قابلية للدفاع عنه لـ Stable Audio هو مصدر بيانات التدريب الخاصة به. تم تدريب النموذج التجاري حصرياً على موسيقى مرخصة من مكتبة AudioSparx بموجب ترتيب لتقاسم الإيرادات: إذا كان أداء النموذج جيداً تجارياً، فإن AudioSparx -- ومن خلالها، الفنانين المساهمين -- تشارك في هذا النجاح. كان هذا هو قرار التصميم الأساسي الذي اتخذه إد نيوتن-ريكس (Ed Newton-Rex)، نائب رئيس قسم الصوت آنذاك في Stability AI، عند بناء المنتج.

في نوفمبر 2023، استقال نيوتن-ريكس من Stability AI علناً، مشيراً إلى خلاف مع موقف الشركة الأم بأن تدريب نماذج الذكاء الاصطناعي على الأعمال المحمية بحقوق الطبع والنشر يشكل "استخداماً عادلاً". حظيت الاستقالة بتغطية إعلامية واسعة وأبرزت مفارقة محددة: لقد بنى Stable Audio لتجنب المشكلة التي كان يحتج عليها بالضبط. اتخذت شركة Stability AI الأوسع، من خلال نماذج الصور الخاصة بها، موقف الاستخدام العادل؛ بينما كان التدريب الصوتي لـ Stable Audio نظيفاً بشكل منفصل. أسس نيوتن-ريكس منذ ذلك الحين Fairly Trained، وهي منظمة لإصدار الشهادات، وظهر في قائمة TIME لأكثر 100 شخصية مؤثرة في مجال الذكاء الاصطناعي لعام 2025.

بالنسبة للمستخدمين التجاريين، النتيجة عملية. تأتي المقاطع التي تم إنشاؤها على باقات Stable Audio المدفوعة مع ترخيص المبدع (Creator license) الذي يمنح حقوقاً تجارية للاستخدام الفردي، ويغطي وسائل التواصل الاجتماعي، والإصدارات التجارية، والمواضع في الأفلام والتلفزيون دون حدود معينة للإيرادات، والتطبيقات والألعاب التي تصل إلى 100,000 مستخدم نشط شهرياً. تنتقل المؤسسات التي تتجاوز هذه الحدود، أو تلك التي تحتاج إلى الاستضافة الذاتية، إلى باقة Enterprise. قد يتم استخدام المخرجات التي تم إنشاؤها لتحسين النموذج المستقبلي بواسطة Stability AI، ولكن لا يتم دمج الملفات التي يرفعها المستخدمون في مجموعات بيانات التدريب.

يتم إصدار Stable Audio Open بموجب ترخيص مجتمع Stability AI (Stability AI Community License)، والذي يسمح بالبحث والاستخدام غير التجاري؛ يتطلب الاستخدام التجاري اتفاقية منفصلة من خلال stability.ai/license.

أين يقصر Stable Audio بشكل ملحوظ

التوليد الصوتي غائب هيكلياً. لا يمكن للنموذج إنتاج غناء بشري متماسك، أو إلقاء كلمات، أو كلام مفهوم في أي باقة. هذا ليس خطأ برمجياً؛ بل هو قرار متعمد لنطاق العمل. ولكنه يعني أن أي شخص يصل على أمل توليد أغنية كاملة مع مغنٍ سيصطدم بحائط مسدود على الفور.

لا يفي وضع الصوت إلى الصوت (Audio-to-audio) بوعده الضمني. تُطبق الميزة الجرس والطابع الصوتي على المستوى السطحي من الملف المرجعي على المخرجات التي تم إنشاؤها؛ فهي لا تعيد ترتيب الإدخال، أو تعيد بناءه، أو تستخدمه بذكاء كقالب موسيقي. وجدت الاختبارات التي أجراها مراجعو Audiocipher أن المطالبة بآلات موسيقية معينة (الطبول، الباس) في وضع الصوت إلى الصوت غالباً ما تُنتج مخرجات تفتقر إلى تلك الآلات تماماً -- يُطبق النموذج نكهة صوتية بدلاً من بناء الترتيب المطلوب. أدى أحد الاختبارات لتحويل تسجيل أكورديون إلى موسيقى الجاز الغجري إلى إنتاج إكسيليفون بدلاً من الباس والطبول المطلوبة.

"نقل النمط لم يعمل بشكل جيد جداً.. تفتقر النتيجة إلى الآلات الموسيقية الكاملة على الرغم من أن المطالبة تطلب الطبول والباس." -- Audiocipher، اختبار وضع الصوت إلى الصوت في Stable Audio 2.0، أبريل 2024

يُعد الحد الأقصى الصارم البالغ 3 دقائق لكل عملية توليد نقطة احتكاك مستمرة لمنتجي الموسيقى الذين يريدون مقاطع كاملة. يتطلب الدمج عبر الرسم الداخلي (المتوفر في الإصدار 2.5) عبئاً إضافياً في سير العمل. من السهل استنفاد حدود الرفع في باقة Pro -- 30 دقيقة شهرياً -- في جلسات التصميم الصوتي النشطة، ولا يتم ترحيل عمليات التوليد غير المستخدمة. يزيد الحد الأقصى البالغ 47 ثانية للمتغير مفتوح المصدر من تعقيد هذا الأمر بالنسبة للمطورين الذين افترضوا أن النموذج المفتوح سيطابق إمكانيات التطبيق التجاري.

تتطلب هندسة المطالبات للتحكم في الهيكل تكراراً حقيقياً. يجب على المستخدمين تشفير هيكل المقطع ("تصاعد لمدة دقيقتين، ذروة عند 1:40، تلاشي في الخاتمة") مباشرة في النص، وتُنتج المطالبات المعقدة أحياناً تشوهات صوتية مهلوسة أو انتقالات مفاجئة تتطلب إعادة التوليد. لا يدعم النموذج إدخال اللغة الطبيعية بالمرونة التي تستخدمها الأدوات المدعومة بالنماذج اللغوية الكبيرة (LLM) مثل Suno.

لمن يُعد Stable Audio مناسباً

يُعد منتجو الفيديو وصناع المحتوى الذين يحتاجون إلى موسيقى خلفية آلية خالية من حقوق الملكية هم الفئة الأكثر توافقاً. إن الجمع بين بيانات التدريب المرخصة بالكامل، وجودة المخرجات 44.1kHz، ووقت التوليد الذي يقل عن 60 ثانية يجعله عملياً لإنتاج الفيديو بكميات كبيرة حيث يحتاج كل مقطع إلى اجتياز فحص Content ID.

يحصل مطورو الألعاب الذين يبنون مقاطع صوتية محيطية، وصوتيات واجهة المستخدم، وتصميم الصوت البيئي على قيمة حقيقية، لا سيما في باقة Pro حيث يتيح وضع الصوت إلى الصوت التكرار من المواد المرجعية. تفتح باقة Enterprise إمكانية الضبط الدقيق على مكتبات الصوت الخاصة، وهو أمر مهم للاستوديوهات التي تبني هويات صوتية متسقة عبر عناوين الألعاب.

يجب على مصممي الصوت ومهندسي الصوت الذين يريدون استدلالاً محلياً ومفتوحاً على الأصول القصيرة استكشاف Stable Audio Open 1.0 أو Open Small عبر Hugging Face و ComfyUI. لا يُعد الحد الأقصى البالغ 47 ثانية قيداً لخطوات الأقدام، أو نقرات واجهة المستخدم، أو عناصر المؤثرات الصوتية (Foley)، أو الحلقات الجوية القصيرة.

العلامات التجارية والوكالات التي تحتاج إلى أعمال الهوية الصوتية -- الشعارات الصوتية، والعلامات التجارية الصوتية المتسقة عبر نقاط الاتصال -- هي الجمهور المستهدف لواجهة برمجة تطبيقات (API) الإصدار 2.5 للمؤسسات. تشير شراكة العلامة التجارية الصوتية WPP Amp التي تم الإعلان عنها مع إطلاق الإصدار 2.5 إلى أن هذا هو اتجاه النمو الأساسي للمنتج.

تجاوز Stable Audio إذا كنت بحاجة إلى أصوات غنائية من أي نوع، أو إذا كنت ترغب في توليد أغاني كاملة بهيكل مقطع-لازمة، أو إذا كان سير عملك يعتمد على مقاطع أطول من ثلاث دقائق دون دمج يدوي، أو إذا كنت بحاجة إلى نقل نمط هيكلي عميق من مرجع صوتي بدلاً من تبديل الجرس السطحي.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن Stable Audio.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Stable Audio.