

تُعد Resemble AI منصة صوتية للمؤسسات مخصصة لاستنساخ الأصوات، وتوليد الكلام، واكتشاف التزييف العميق (deepfakes) المُولد بالذكاء الاصطناعي. تُستخدم من قِبل Netflix و Paramount و Deutsche Telekom. حقق نموذج Chatterbox مفتوح المصدر مليون تنزيل على Hugging Face خلال أسابيع من إطلاقه.
تُعد Resemble AI شركة متخصصة في الذكاء الاصطناعي الصوتي، تأسست عام 2019 وتتوزع مقراتها الرئيسية بين تورونتو وسان فرانسيسكو. تعمل كمنصة ترتكز على ثلاثة أعمدة رئيسية تشمل توليد الصوت، والعلامات المائية الصوتية، واكتشاف التزييف العميق، ويتم تقديمها جميعاً من خلال واجهة برمجة تطبيقات (API) للمطورين ولوحة تحكم عبر الويب. يستخدم عملاء المؤسسات، بما في ذلك Netflix و Paramount و Deutsche Telekom و World Bank و Axel Springer، المنصة لاستنساخ الصوت، وإنتاج المحتوى، وأمن الوسائط الاصطناعية. في ديسمبر 2025، أغلقت الشركة جولة تمويل بقيمة 13 مليون دولار بدعم من Google's AI Future Fund و Okta Ventures و Sony Innovation Fund، ليصل إجمالي التمويل إلى 25 مليون دولار.
المنتج الأساسي للتوليد في المنصة هو عائلة نماذج Chatterbox، والتي تم إصدارها كمصدر مفتوح بموجب ترخيص MIT في عام 2025. تتضمن المجموعة Chatterbox (بجودة كاملة)، و Chatterbox Turbo (بـ 350 مليون معلمة، وسرعة إنتاجية مع دعم العلامات شبه اللغوية)، و Chatterbox Multilingual (يدعم أكثر من 23 لغة). على جانب الاكتشاف، يُعد Resemble Detect-3B Omni نموذجاً متعدد الوسائط بـ 3 مليارات معلمة يحقق دقة تصل إلى 98% عبر أكثر من 40 لغة ويتصدر لوحات الصدارة لاكتشاف التزييف العميق على Hugging Face. تتضمن المنصة أيضاً Perth، وهي طبقة علامة مائية عصبية غير محسوسة تصمد أمام ضغط MP3 وتحرير الصوت.
ما تقدمه Resemble AI في أبريل 2026
يغطي جانب التوليد في المنصة خمسة أنواع مختلفة من المخرجات. يقوم تحويل النص إلى كلام بتحويل المحتوى المكتوب إلى صوت باستخدام Chatterbox Turbo كمحرك افتراضي. يأتي استنساخ الصوت في مستويين: Rapid (بضع دقائق من الصوت المرجعي) و Pro (من 10 دقائق إلى ساعة واحدة، بدقة أعلى). يتعامل مغير الصوت بالذكاء الاصطناعي مع تحويل الكلام إلى كلام في الوقت الفعلي، وتوجيه الصوت المباشر من خلال ملف تعريف صوتي مستهدف. تتعامل المنصة أيضاً مع النسخ الصوتي (تحويل الكلام إلى نص) وتحسين الصوت كجزء من نفس واجهة برمجة التطبيقات (API).
تستحق بنية Chatterbox Turbo الإشارة إليها بشكل خاص. تم تقليل وحدة فك ترميز mel من 10 خطوات توليد إلى خطوة واحدة مع الاحتفاظ بصوت عالي الدقة، وهو ما يفسر كيف يحقق النموذج سرعة على مستوى الإنتاج دون التضحية بجودة المخرجات. يدعم نموذج Turbo بشكل أصلي العلامات شبه اللغوية بما في ذلك [cough] و [laugh] و [chuckle]، مما يضيف تنوعاً طبيعياً لا يمكن للأنظمة التي تعتمد على النص فقط تكراره. يحمل كل ملف صوتي يتم إنشاؤه من خلال Resemble علامة مائية عصبية مضمنة من نظام Perth، وهي غير مرئية للمستمعين ولكن يمكن اكتشافها بواسطة أدوات التحقق الخاصة بـ Resemble حتى بعد إعادة ترميز MP3 أو تحريره.
فيما يتعلق بالاكتشاف، يعمل Detect-3B Omni عبر الصوت والفيديو والصور الثابتة والنصوص في وقت واحد. ويستخدم ما تسميه Resemble نهج "النموذج التوليدي العكسي"، حيث يحلل الآثار الرياضية لتنبؤات نماذج الذكاء الاصطناعي على مستوى الإطار والبكسل بدلاً من مطابقة الأنماط للآثار الاصطناعية المعروفة. هذا الأمر مهم لأن مناهج مطابقة الأنماط تفشل عند إعادة تسجيل الصوت أو تصفيته. لا يتطلب Detect-3B تسجيلاً صوتياً مسبقاً من المشاركين قبل أن يتمكن من وضع علامة على المكالمة.
"معظم نماذج اكتشاف التزييف العميق في الوقت الحالي هشة للغاية. إذا قمت بتطبيق مرشح أو ضغط الصوت، فإن ذلك يربك النموذج تماماً." - زوهيب أحمد، الرئيس التنفيذي لشركة Resemble AI، عبر SiliconANGLE، 8 ديسمبر 2025
موقع Resemble AI مقارنة بـ ElevenLabs و Cartesia
تمثل الشركات الثلاث رهانات مختلفة تماماً حول ما يحتاجه سوق الذكاء الاصطناعي الصوتي بشكل أكبر. إن فهم أين تختلف آلياتها يساعد في توضيح أي منها ينتمي إلى حزمة تقنية معينة.
انطلقت ElevenLabs من الجانب الاستهلاكي للسوق. يقدم نموذج Flash الخاص بها صوتاً بزمن انتقال (TTFA) يبلغ 75ms على الاتصالات الجيدة، ويسجل نموذجها متعدد اللغات الكامل 89.60% كـ "شبيه جداً بالبشر" في التقييمات المستقلة للطبيعية. يبلغ معدل خطأ الكلمات لتحويل النص إلى كلام المرتبط بالنسخ 2.83%. مسار الاستقطاب المجاني للمستهلكين قوي للغاية: 10,000 حرف شهرياً مجاناً، مع مستويات مدفوعة تصل إلى 2 مليون حرف مقابل $330/month. تدير ElevenLabs واحدة من أكبر مكتبات الصوت المبنية مسبقاً في السوق، وهو عامل تمييز رئيسي لفرق المحتوى التي لا ترغب في إدارة تدريب صوتي مخصص. المقابل لذلك هو أن ElevenLabs لا توفر نشراً محلياً (on-premise)، ويصل الحد الأقصى للاتصالات الهاتفية إلى 8kHz، ولا تحمل المنصة أي قدرة على اكتشاف التزييف العميق على الإطلاق. بالنسبة لفرق المؤسسات التي تحتاج إلى استنساخ صوت العلامة التجارية بتحكم صارم مع امتثال SOC 2 وقابلية التفسير على جانب الاكتشاف، لا يمكن لـ ElevenLabs أن تحل محل Resemble.
تعمل Cartesia على الطرف النقيض من مؤشر زمن الانتقال. تم بناء نموذج Sonic الخاص بها (و Sonic Turbo عند 40ms) على بنية نموذج حالة الفضاء (state space model) بدلاً من المحولات (transformers)، مما يسمح لها ببث الصوت رمزاً برمز (token-by-token) بزمن انتقال للبايت الأول أقل بكثير من أي من المنافسين. تتطلب Cartesia 3 ثوانٍ فقط من الصوت المرجعي لاستنساخ صوتي فوري، مقارنة بمستوى Rapid في Resemble الذي يتطلب عدة دقائق. يتوفر امتثال SOC 2 والنشر المحلي. ينصب تركيز Cartesia بالكامل تقريباً على حالة استخدام الوكيل الصوتي، مما يعني المحادثات التفاعلية حيث تكون الاستجابة التي تقل عن 100ms أكثر أهمية من النطاق التعبيري. لا تقدم الشركة اكتشاف التزييف العميق، أو العلامات المائية، أو سير عمل لتأليف محتوى الإنتاج. تعمل Resemble بزمن انتقال (TTFA) يتراوح من 170ms إلى 3000ms اعتماداً على النموذج وحجم العمل، وهي فجوة ذات مغزى لتطبيقات الوكيل في الوقت الفعلي ولكنها غير ذات صلة إلى حد كبير بالسرد والدبلجة وإنتاج المحتوى.
الميزة التنافسية الخاصة بـ Resemble في هذه المقارنة هي قصة المنصة المتكاملة: مورد واحد للتوليد، والعلامات المائية، واكتشاف التزييف العميق، بالإضافة إلى نموذج Chatterbox مفتوح المصدر الذي يمكن للفرق استضافته ذاتياً دون أي حقوق ملكية. لا تقدم ElevenLabs ولا Cartesia هذا المزيج. في اختبارات A/B العمياء، تم تفضيل Chatterbox Turbo على ElevenLabs من قبل 65.3% من المستمعين، وهو معيار موثوق للجانب المتعلق بالجودة في هذا النقاش.
"توفر تقنيتها نوعاً من التحقق من الإشارات المدعوم بالذكاء الاصطناعي والذي سيكون حاسماً لتعزيز نسيج أمن الهوية." - ستيفن لي، نائب رئيس الاستراتيجية التقنية، Okta Ventures، ديسمبر 2025
واقع الترخيص وحقوق النشر
تم إصدار عائلة نماذج Chatterbox مفتوحة المصدر من Resemble AI بموجب ترخيص MIT. هذا يعني أن الاستخدام التجاري، والاستضافة الذاتية، وتعديل الأوزان، ونشر الإنتاج مسموح بها جميعاً دون حقوق ملكية أو مشاركة في الإيرادات أو حدود للاستخدام. تغطي شروط MIT النماذج الثلاثة في العائلة: Chatterbox و Chatterbox Turbo و Chatterbox Multilingual. يمكن للفرق التي تحتاج إلى معالجة الصوت محلياً لأسباب تنظيمية أو تتعلق بالخصوصية القيام بذلك دون الاعتماد المستمر على المورد.
يضيف نظام العلامات المائية (Perth) طبقة تهم الدفاع القانوني في سياقات المؤسسات. يحمل كل ملف صوتي يتم إنشاؤه بواسطة واجهة برمجة التطبيقات (API) المستضافة علامة مائية عصبية غير محسوسة تصمد أمام التلاعبات الشائعة بما في ذلك إعادة ترميز MP3، وتحرير الصوت، والضغط. يمكن لأدوات الاكتشاف الخاصة بـ Resemble تحديد العلامة المائية حتى بعد تلك التحويلات. بالنسبة لشركات الإعلام، ينشئ هذا مسار تدقيق يمكن أن يثبت مصدر السرد المُولد بالذكاء الاصطناعي، والذي أصبح ذا مغزى في سياق اتفاقيات SAG-AFTRA ومتطلبات الإفصاح الناشئة عن الذكاء الاصطناعي.
على جانب الموافقة على الاستنساخ، تطلب Resemble من مالكي الصوت التحقق من الموافقة قبل أن يتم استخدام الصوت المستنسخ على المنصة. تحظر شروط خدمة الشركة استنساخ الأصوات دون إذن صاحبها، وتتضمن عقود المؤسسات أحكاماً حول كيفية نشر الأصوات المستنسخة وما لا يمكن نشره. هذا منظم بشكل رسمي أكثر من بعض المنافسين الذين تكون سياسات الموافقة لديهم محددة بشكل فضفاض في الممارسة العملية.
أين تقصر Resemble AI بشكل ملحوظ
يُعد زمن الانتقال هو القيد الأكثر توثيقاً. يضع نطاق TTFA الخاص بـ Resemble والذي يتراوح من 170ms إلى 3000ms الشركة خلف كل من Cartesia (90ms) و ElevenLabs Flash (75ms) لتطبيقات المحادثة في الوقت الفعلي. تبرز أهمية هذه الفجوة بشكل أكبر في حالات استخدام الوكيل الصوتي حيث يمكن للمستخدمين إدراك التأخيرات التي تزيد عن 150ms تقريباً. بالنسبة لإنتاج المحتوى (الدبلجة، السرد، التعليق الصوتي)، لا يُعد زمن الانتقال عاملاً حاسماً، ولكن بالنسبة لأتمتة مراكز الاتصال أو مساعدي الذكاء الاصطناعي المباشرين، تتطلب Resemble بنية دقيقة للبقاء ضمن نوافذ الاستجابة المقبولة.
متطلبات بيانات استنساخ الصوت أعلى من بعض البدائل. يستغرق مستوى Rapid عدة دقائق من الصوت المرجعي لإنتاج استنساخ قابل للاستخدام؛ ويتطلب مستوى Pro من 10 دقائق إلى ساعة. تضع قدرة الاستنساخ في 3 ثوانٍ من Cartesia معياراً جديداً لم تضاهيه Resemble. بالنسبة للعملاء الذين يحتاجون إلى إعداد ملفات تعريف صوتية بسرعة أو على نطاق واسع، فهذه نقطة احتكاك حقيقية في سير عمل الإنتاج.
دعم العملاء للحسابات الصغيرة هو شكوى مستمرة. يبلغ متوسط مراجعات Trustpilot حوالي 1.9، مدفوعاً إلى حد كبير بتقارير عن ضعف الاستجابة وصعوبة إلغاء الاشتراكات. تبدو تجربة الدعم على مستوى المؤسسات مختلفة تماماً (مع جهات اتصال مخصصة)، ولكن يبدو أن شريحة السوق المتوسطة والمستهلكين المحترفين (prosumer) لا تحظى بالخدمة الكافية. تُعد مفاجآت الفوترة على نموذج الدفع بالثانية مشكلة متكررة للفرق التي لا تضع حدوداً للاستخدام.
هيكل تسعير الدفع حسب الاستخدام، على الرغم من مرونته، يخلق تعقيداً في الميزانية للفرق المعتادة على الاشتراكات ذات السعر الثابت. يُعد اكتشاف التزييف العميق للفيديو بسعر $0.07/second أحد أغلى الأسعار على المنصة ويمكن أن يولد تكاليف غير متوقعة في سير عمل الأمان الذي يتضمن فحص فيديو بكميات كبيرة.
الفئة المستهدفة لـ Resemble AI
التوافق الأقوى هو مع فرق تطوير المؤسسات التي تبني البنية التحتية للوكيل الصوتي، أو خطوط إنتاج الوسائط، أو أدوات الأمان والامتثال. إذا كان فريقك يحتاج إلى واجهة برمجة تطبيقات (API) واحدة تغطي توليد الصوت، ومصادقة المحتوى، واكتشاف الوسائط الاصطناعية - مدعومة بامتثال SOC 2، و SSO، وخيارات النشر المحلي، وعملاء مؤسسات يمكن التحقق منهم - فإن Resemble AI هي واحدة من المنصات القليلة التي تغطي الثلاثة. يُعد تمويل ديسمبر 2025 من المستثمرين المؤسسيين بما في ذلك Google's AI Future Fund إشارة معقولة إلى أن الشركة مستقرة على المدى القريب.
تُعد عائلة Chatterbox مفتوحة المصدر خياراً مشروعاً لفرق المطورين الذين يرغبون في استضافة نموذج TTS عالي الجودة ذاتياً بشروط MIT وبدون حدود للاستخدام. يشير المليون تنزيل على Hugging Face وأكثر من 11,000 نجمة على GitHub في غضون أسابيع من الإصدار إلى تبني مجتمعي حقيقي، وليس مجرد تسويق. يجب على الفرق التي تقيم الذكاء الاصطناعي الصوتي المستضاف ذاتياً كبديل للاعتماد على واجهة برمجة التطبيقات (API) اختبار Chatterbox Turbo على وجه التحديد.
تجاوز Resemble AI إذا كنت منشئ محتوى مستقلاً أو فريقاً صغيراً بدون قدرة على دمج واجهة برمجة التطبيقات (API). تم تصميم نموذج التسعير وتصميم المنتج وتجربة الدعم خصيصاً للمشترين التقنيين في المؤسسات. تتمتع ElevenLabs بتجربة إعداد مستهلك أفضل بكثير، ومكتبة صوتية مبنية مسبقاً أكبر، ومستوى مجاني أكثر قابلية للتنبؤ. إذا كانت حالة الاستخدام الأساسية لديك هي الذكاء الاصطناعي للمحادثة في الوقت الفعلي حيث يكون زمن الانتقال هو القيد الأول، فإن Sonic Turbo من Cartesia بزمن انتقال (TTFA) يبلغ 40ms هو الخيار الأفضل.
يظل مشروع The Andy Warhol Diaries على Netflix هو دراسة الحالة الأكثر وضوحاً: 3 دقائق و 12 ثانية من التسجيلات الصوتية الأصلية أنتجت سرداً اصطناعياً بدرجة وثائقية حصل على أربعة ترشيحات لجوائز إيمي في عام 2022. بالنسبة لأي مؤسسة تفكر في استنساخ صوتي عالي المخاطر حيث يحتوي الصوت المصدر على صوت متاح محدود، فإن هذا السجل الحافل يحمل وزناً كبيراً.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن Resemble AI.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Resemble AI.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Undetectable AI Review (2026): What It Does, What It Costs, and 7 Alternatives

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google vs OpenAI vs Anthropic Agents: The May 2026 Platform Showdown
