

AudioCraft هو إطار عمل الذكاء الاصطناعي الصوتي مفتوح المصدر من Meta، والذي يضم MusicGen لتحويل النص إلى موسيقى آلية، و AudioGen للمؤثرات الصوتية، و EnCodec لضغط الصوت العصبي. مجاني للاستضافة الذاتية، برمز مرخص من MIT، ومثالي للباحثين والمطورين الذين يبنون نماذج صوتية مخصصة.
إن AudioCraft عبارة عن مكتبة بحثية مبنية على PyTorch أصدرتها Meta AI في 2 أغسطس 2023. وهو ليس منتجاً مستضافاً أو تطبيقاً استهلاكياً، بل إطار عمل ذاتي الاستضافة يجمع بين ثلاثة نماذج صوتية توليدية متميزة: MusicGen، الذي يولد موسيقى آلية من مطالبات نصية أو مراجع لحنية؛ و AudioGen، الذي يولد أصواتاً بيئية ومؤثرات صوتية من النص؛ و EnCodec، وهو برنامج ترميز صوتي عصبي يدعم كلا النموذجين كضاغط ومرمز عالي الدقة. الكود مرخص بموجب MIT وأوزان النموذج المدربة مسبقاً مُصدرة بموجب CC-BY-NC 4.0، مما يعني الاستخدام غير التجاري فقط ما لم يتم التوصل إلى اتفاقية تجارية منفصلة مع Meta.
يتوفر MusicGen بإصدارات صغيرة (حوالي 300M معلمة)، ومتوسطة (حوالي 1.5B)، وكبيرة (حوالي 3.3B). تقبل ميزة التكييف اللحني الخاصة به ملفاً صوتياً مرجعياً، وتستخرج تمثيلاً كروموغرامياً باستخدام فصل المصدر HT-Demucs من Meta، وتستخدم تلك البصمة التوافقية لتوجيه التوزيع، مما يتيح للمنتجين تحويل لحن مدندن أو مسودة بيانو إلى مقطوعة موسيقية آلية كاملة. يتعامل AudioGen مع الخلفيات المحيطية وتصميم الصوت بأسلوب foley بتردد 16kHz. وتوسع إضافتان أحدث إطار العمل: MAGNeT، وهو نموذج غير انحداري ذاتي أُضيف في مايو 2024 يوفر استدلالاً أسرع، و JASCO، الذي أُضيف في يناير 2025، والذي يقدم عناصر تحكم دقيقة في الأوتار والإيقاع عبر Flow Matching. تعمل جميع النماذج الأربعة محلياً على أجهزة GPU.
ما ينتجه AudioCraft في أبريل 2026
تولد نماذج MusicGen الأساسية ما يصل إلى 30 ثانية من الصوت الآلي لكل تمريرة بتردد 32kHz أحادي، أو ستيريو مع متغيرات الستيريو التي تم إصدارها في يناير 2024. تنتج النماذج المتوسطة والكبيرة بنية موسيقية أكثر تماسكاً بشكل ملحوظ من النموذج الصغير، ولكن كلاهما يتطلب ما لا يقل عن 16GB من VRAM لوحدة معالجة الرسومات (GPU) لاستدلال مريح. يعمل النموذج الصغير على بطاقات 8GB مع بعض التنازلات في الجودة. يولد AudioGen مؤثرات صوتية أحادية بتردد 16kHz، ومخرجاته أكثر موثوقية للمقاطع المحيطية القصيرة مقارنة بالتوقيت الدقيق لأصوات foley.
يعمل JASCO، وهو أحدث نموذج، بمتغيرات 400M و 1B معلمة مع وضعين للتكييف: النص بالإضافة إلى الأوتار والطبول، أو النص بالإضافة إلى الأوتار والطبول واللحن. يعد متغير 1B مع التكييف الكامل هو نموذج توليد الموسيقى الأكثر قابلية للتحكم في إطار العمل. وهو أيضاً الأقل توثيقاً، ومثل جميع أوزان AudioCraft، فهو مخصص للاستخدام غير التجاري فقط. توفر صفحات العرض التوضيحي metademolab.com واجهات Gradio لاختبار MusicGen و AudioGen دون الحاجة إلى تثبيت محلي، على الرغم من أن العروض التوضيحية العامة تحد من التوليد إلى 12 ثانية.
يعد EnCodec، المستقل عن نماذج التوليد، برنامج ترميز عصبي يعمل في الوقت الفعلي بالكامل ويدعم الصوت الأحادي والستيريو بمعدلات بت متعددة. وقد شهد اعتماداً خارج AudioCraft، بما في ذلك في التطبيقات الصوتية وأبحاث الكلام، ويمكن القول إنه المكون الأكثر فائدة عملياً في المكتبة لمهندسي الإنتاج الذين يحتاجون إلى ضغط صوتي عالي الجودة.
موقع AudioCraft مقارنة بـ Stable Audio Open و Suno
أهم مقارنتين هما Stable Audio Open (أوزان مفتوحة، تطوير نشط) و Suno (مغلق، تجاري، قادر على توليد الغناء).
يستخدم Stable Audio Open (من Stability AI، يوليو 2024) بنية انتشار كامنة بدلاً من محول انحداري ذاتي. نموذجه الأساسي هو محول انتشار (DiT) بـ 1.057B معلمة مكيف بواسطة مشفر نصي T5 بـ 109M معلمة، بالإضافة إلى مشفر تلقائي بـ 156M معلمة يضغط أشكال الموجات الستيريو بتردد 44.1kHz في مساحة كامنة. تصل المخرجات إلى 47 ثانية من الصوت الستيريو بتردد 44.1kHz، مقارنة بالحد الأقصى لـ AudioCraft البالغ 32kHz أحادي. تم تدريب Stable Audio Open على 7,300 ساعة من صوتيات المشاع الإبداعي، مما يمنحه تغطية أفضل للأصوات البيئية والإيقاعية. تم تدريب MusicGen من AudioCraft على 20,000 ساعة من الموسيقى المرخصة والمملوكة لشركة Meta، مما يمنحه ميزة في البنية الموسيقية اللحنية والتوافقية. عملياً: يؤدي Stable Audio Open بشكل أفضل في تصميم الصوت والمقاطع المحيطية القصيرة؛ بينما يؤدي MusicGen بشكل أفضل في المقطوعات الآلية الأطول ذات التماسك الموسيقي. كما تلقى Stable Audio Open صيانة أكثر نشاطاً في 2024-2025، بما في ذلك متغير للأجهزة المحمولة بـ 341M معلمة تم إصداره بالشراكة مع Arm.
يتخذ Suno (تجاري، مغلق) نهجاً مختلفاً تماماً. تجمع بنيته الهجينة بين Bark، الذي يتعامل مع التوليف الصوتي الواقعي وتوليد الكلمات، و Chirp، الذي يتعامل مع الآلات الموسيقية. المخرجات عبارة عن أغنية منتجة بالكامل مع غناء رئيسي، وتناغمات، وخلفية موسيقية، تصل إلى 4 دقائق لكل مقطع. لا يمكن لـ AudioCraft توليد الغناء على الإطلاق. قامت Meta بتجريد الغناء عمداً من بيانات تدريب MusicGen باستخدام فصل المصدر HT-Demucs لتجنب مشكلات حقوق الطبع والنشر المتعلقة بالغناء. يسجل Suno v5 (2025) درجة ELO تبلغ 1,293 في تقييمات جودة الصوت المستقلة، مما يضعه في صدارة كل منافس تم اختباره علناً. ومع ذلك، في يوليو 2024، رفعت RIAA دعاوى قضائية ضد Suno و Udio بدعوى استخدام موسيقى محمية بحقوق الطبع والنشر غير مرخصة في التدريب، وهو ظل قانوني لا يشاركه AudioCraft نظراً لاستخدام Meta لبيانات مرخصة. يفرض Suno رسوماً عبر مستويات اشتراك تبدأ من حوالي $8/month؛ بينما AudioCraft مجاني.
"لا يمكن بيع هذه المخرجات للعبة نقر مجانية على الهاتف المحمول"، معلق مجهول، Hacker News، أغسطس 2023، يناقش الصوت التجريبي لإطلاق AudioCraft
رد الفعل هذا، على الرغم من قسوته، يوضح ما هو AudioCraft وما هو ليس كذلك. عند الإطلاق، كانت المخرجات على مستوى البحث، وليس على مستوى الإنتاج. اتسعت الفجوة بين AudioCraft ومولدات الموسيقى التجارية منذ عام 2023 حيث تطور Suno و Udio بقوة بينما ظلت نماذج MusicGen الأساسية من Meta ثابتة إلى حد كبير.
واقع الترخيص وحقوق الطبع والنشر
كود AudioCraft مرخص بموجب MIT، وهو ما يبدو مفتوحاً إلى أقصى حد. ومع ذلك، فإن أوزان النموذج تخضع لترخيص المشاع الإبداعي نَسب المُصنَّف - غير تجاري 4.0 دولي (CC-BY-NC 4.0). هذا التمييز مهم للغاية. يمكنك قراءة وتعديل وإعادة توزيع كود التدريب والاستدلال بحرية. ولكن لا يمكنك، بموجب ترخيص الأوزان، استخدام الصوت المولد أو النماذج في أي منتج تجاري أو خدمة أو سير عمل يحقق الدخل دون اتفاقية تجارية منفصلة مع Meta، وهي غير معروضة للجمهور.
أشار العديد من المطورين في مناقشة الإطلاق في أغسطس 2023 على Hacker News إلى هذا التأطير: أشار أحدهم بصراحة إلى أنه "لا يمكنك بناء عمل تجاري عليه" بسبب القيود غير التجارية. الفجوة بين "مفتوح المصدر" (الكود) و "الأوزان المفتوحة" (غير تجاري) هي نمط يظهر أيضاً في إصدارات Llama من Meta، ويخلق احتكاكاً حقيقياً لأي شخص يأمل في بناء منتج تجاري بالاعتماد على مخرجات AudioCraft.
على جانب بيانات التدريب، صرحت Meta أن MusicGen تم تدريبه على ما يقرب من 400,000 تسجيل بإجمالي 20,000 ساعة، باستخدام موسيقى داخلية مملوكة لشركة Meta ومواد مرخصة خصيصاً من Shutterstock و Pond5. هذا يضع AudioCraft في موقف دفاعي أفضل من Suno أو Udio، وكلاهما واجه دعاوى قضائية من RIAA في يوليو 2024. لم يتم الطعن قانونياً في ادعاءات بيانات تدريب AudioCraft اعتباراً من أبريل 2026.
تحمل أوزان JASCO نفس قيود CC-BY-NC 4.0 مثل MusicGen و AudioGen. أوزان وكود EnCodec كلاهما مرخصان بموجب MIT، مما يجعله المكون الوحيد المفتوح بالكامل في المكتبة.
أين يقصر AudioCraft بشكل ملحوظ
القيود الأكثر وضوحاً هي الغناء. لا يمكن لـ MusicGen إنتاج غناء أو كلام أو أي صوت بشري مفهوم في مخرجاته. هذا خيار تصميم متعمد، وليس فجوة مؤقتة. قام مسار التدريب بتمرير جميع الأصوات عبر HT-Demucs لفصل وإزالة الجذع الصوتي قبل الترميز. يتم توجيه الباحثين الذين يحتاجون إلى التوليف الصوتي من عائلة AudioCraft نحو EnCodec كطبقة ترميز لأنظمة التشفير الصوتي الأخرى، وليس MusicGen نفسه.
تخلق متطلبات الأجهزة حاجزاً ثانياً. يتطلب النموذج المتوسط، وهو الحد الأدنى للتكوين للحصول على مخرجات متماسكة موسيقياً، 16GB من VRAM. يقتصر المستخدمون الذين لديهم بطاقات 8GB على النموذج الصغير، والذي ينتج بنية موسيقية أبسط بشكل ملحوظ. أبلغ أحد المستخدمين في مشكلة GitHub رقم #435 في مارس 2024 أن حاسوبه المحمول المزود ببطاقة NVIDIA بذاكرة 16GB VRAM كان يظهر استخداماً بنسبة 5-10% فقط لوحدة معالجة الرسومات (GPU) أثناء استدلال MusicGen بينما كانت نوى وحدة المعالجة المركزية (CPU) تعمل بكامل طاقتها، مما يشير إلى أن مسار الاستدلال لا يستفيد باستمرار من تسريع GPU على جميع تكوينات الأجهزة.
الضبط الدقيق على مجموعات البيانات المخصصة مدعوم تقنياً ولكنه صعب عملياً. أبلغ مستخدم حاول ضبط نموذج مخصص بـ 33M معلمة على 133 ساعة من الموسيقى على بطاقة GTX 1060 بعد 20 ساعة من التدريب أن العينات المولدة "تبدو وكأنها لا تفعل شيئاً تقريباً"، مقارنة بشكل غير مواتٍ مع بنيات المحولات الأخرى التي تظهر تقدماً متماسكاً في غضون 20 دقيقة على أجهزة مكافئة. يتطلب التدريب موارد GPU كبيرة تجعل الضبط الدقيق الجاد بعيد المنال لمعظم الباحثين الأفراد دون الوصول إلى الحوسبة السحابية.
كما تباطأت سرعة التطوير بشكل واضح. كان آخر إصدار جوهري هو JASCO في يناير 2025. وقبل ذلك، MAGNeT في مايو 2024. تم تجميد نماذج MusicGen و AudioGen الأساسية فعلياً عند عدد معلمات 2023-2024 بينما يستمر المنافسون مثل Suno و Stable Audio في إصدار تحديثات إصدارات رئيسية مع تحسينات في الجودة. مع وجود 362 مشكلة مفتوحة على GitHub وتحول اهتمام أبحاث Meta بوضوح نحو مشاريع أخرى، فإن AudioCraft في حالة صيانة بدلاً من التطوير النشط.
"يتقدم النموذج ببطء شديد، لقد كنت أتدرب طوال العشرين ساعة الماضية، والعينات المولدة تبدو وكأنها لا تفعل شيئاً تقريباً". CDandRW، مشكلة GitHub رقم #388، 15 يناير 2024
لمن صُمم AudioCraft
يعد AudioCraft الأداة المناسبة لباحثي التعلم الآلي ومهندسي الصوت الذين يرغبون في دراسة أو البناء على بنية الصوت التوليدي من Meta. إذا كنت تكتب ورقة بحثية حول توليد الموسيقى المكيفة بالنص، أو تحتاج إلى نموذج أساسي للمقارنة، أو ترغب في تدريب نموذج مخصص على مجموعة بيانات متخصصة (الآلات الشعبية، تصميم الصوت الصناعي، حزم الصوت للألعاب)، فإن كود تدريب AudioCraft والعمود الفقري لـ EnCodec موثقة جيداً ومفيدة حقاً. إنها أيضاً الأداة المناسبة للمطورين الذين يحتاجون إلى استدلال صوتي توليدي غير تجاري محلياً بدون حد أقصى للاستخدام، وبدون تكاليف API، مع تحكم كامل في النموذج.
يعد AudioCraft الخيار الخاطئ إذا كنت ترغب في توليد أغانٍ كاملة بكلمات وغناء، وهو ما يتطلب Suno أو Udio. وهو أيضاً الخيار الخاطئ إذا كنت بحاجة إلى توليد صوتي مفتوح المصدر سريع ومُصان جيداً لتصميم الصوت غير الموسيقي، حيث يوفر Stable Audio Open تطويراً أكثر نشاطاً وجودة ستيريو أفضل بتردد 44.1kHz. تخطَّ AudioCraft إذا كنت بحاجة إلى ترخيص تجاري، حيث تمنع قيود أوزان CC-BY-NC أي نشر يحقق الدخل. وتخطه أيضاً إذا كنت تفتقر إلى وحدة معالجة رسومات (GPU) بذاكرة VRAM لا تقل عن 8GB أو مستوى الراحة لتثبيت تبعيات Python وإدارة بيئة PyTorch يدوياً.
بالنسبة لمطوري الألعاب المستقلين، وصناع الأفلام من الطلاب، والباحثين الأكاديميين في مجال الصوت الذين يشعرون بالراحة في تشغيل كود Python المحلي ولديهم وحدة معالجة رسومات NVIDIA من الفئة المتوسطة، يظل AudioCraft خياراً قادراً ومجانياً لتوليد موسيقى آلية ومؤثرات صوتية غير تجارية. إن مكانته كإطار عمل أساسي للذكاء الاصطناعي الصوتي مفتوح المصدر والذي سبق كل شيء آخر يمنحه قيمة استشهاد مستمرة في الأدبيات البحثية حتى مع تفوق الأدوات الأحدث عليه في جودة المخرجات الخام.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن AudioCraft.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ AudioCraft.

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
