

تبني Cartesia AI واجهة برمجة تطبيقات تحويل النص إلى كلام Sonic استنادًا إلى بنية نموذج مساحة الحالة (State Space Model) المبتكرة، محققة زمن استجابة يبلغ 90ms للوصول إلى أول مقطع صوتي (TTFA) لوكلاء الصوت في الوقت الفعلي. تأسست الشركة على يد الباحثين الذين طوروا Mamba، وتحظى بدعم NVIDIA و Kleiner Perkins بتمويل يبلغ $122M.
تُعد Cartesia شركة متخصصة في الذكاء الاصطناعي الصوتي، تأسست عام 2023 على يد باحثي مختبر الذكاء الاصطناعي في جامعة ستانفورد: Albert Gu و Karan Goel و Chris Re و Arjun Desai، وهم نفس الفريق الذي ابتكر بنية نموذج مساحة الحالة (SSM) المعروفة باسم Mamba والمُستخدمة على نطاق واسع في التعلم الآلي. منتجهم الرائد هو Sonic، وهو واجهة برمجة تطبيقات (API) لتحويل النص إلى كلام لا تعتمد على المحولات (transformers)، بل على نماذج SSM التي تعالج التسلسلات من خلال تحديث متجه حالة مضغوط بدلاً من معالجة كل رمز سابق. النتيجة العملية لذلك هي نموذج يحقق زمن استجابة يبلغ 90ms للوصول إلى أول مقطع صوتي (TTFA) في الإصدار القياسي Sonic-3، و 40ms في إصدار Sonic Turbo، مما يجعله أسرع واجهة برمجة تطبيقات لتحويل النص إلى كلام بجودة بشرية متاحة لتطبيقات المحادثة في الوقت الفعلي. جمعت Cartesia تمويلاً إجمالياً يقارب $122M، بما في ذلك جولة تمويلية بقيمة $100M في نوفمبر 2025 بمشاركة Kleiner Perkins و Index Ventures و Lightspeed و NVIDIA.
يدعم Sonic-3، وهو نموذج الإنتاج الحالي، 42 لغة، وما يقرب من 130 صوتاً معداً مسبقاً، وعناصر تحكم دقيقة في العروض الصوتية (prosody) بما في ذلك السرعة، وطبقة الصوت، وعلامات المشاعر الصريحة. يمكن للمطورين إدراج ضحكات طبيعية باستخدام علامة [laughter] مباشرة في النص المدخل. تعمل ميزة استنساخ الصوت باستخدام مقطع صوتي مصدري لا تتجاوز مدته 3 ثوانٍ، لتوليد صوت مطابق للمتحدث يحافظ على اللهجة، والإيقاع، والطابع الصوتي. وإلى جانب تحويل النص إلى كلام (TTS)، تتضمن منصة Cartesia الآن Ink-Whisper (لتحويل الكلام إلى نص)، ونقطة نهاية Voice Changer لتحويل الصوت، ونقطة نهاية Infill لتحرير الصوت، بالإضافة إلى Line، وهو منتج وكيل صوتي مُدار مبني على Sonic. تدعم عمليات النشر للمؤسسات الاستدلال المحلي (on-premise) وعلى الأجهزة (on-device)، مع الامتثال لمعايير SOC-2 و HIPAA للصناعات الخاضعة للوائح التنظيمية.
ما تقدمه Cartesia في أبريل 2026
يُعد Sonic-3 النموذج الافتراضي الحالي. فهو يولد مخرجات صوتية متدفقة تبدأ من 90ms كزمن استجابة (TTFA) من لحظة استدعاء واجهة برمجة التطبيقات (API) حتى أول بايت صوتي، وذلك في ظل ظروف الشبكة القياسية. ينخفض هذا الزمن في إصدار Turbo إلى 40ms على حساب وضع حد أقصى للإدخال يبلغ 500 حرف لكل طلب، مع سقف جودة أضيق. يستخدم كلا النموذجين استدلال SSM، مما يعني تدفق الصوت رمزاً برمز (token-by-token) بسرعة التشغيل بدلاً من إنشاء مقطع كامل ثم إرجاعه. هذه البنية المصممة خصيصاً للتدفق هي السبب وراء استجابة الوكلاء الصوتيين المبنيين على Cartesia بشكل طبيعي في المحادثات: حيث يسمع المستخدم الذكاء الاصطناعي يبدأ في التحدث في نفس الوقت تقريباً الذي سيبدأ فيه الإنسان.
يغطي دعم اللغات في إصدار Sonic-3 نحو 42 لغة بأصوات ذات لهجات أصلية، ارتفاعاً من 15 لغة في إصدار Sonic الأصلي و 15 لغة في Sonic-2 عند الإطلاق. يتيح تخصيص الصوت التحكم في السرعة (معدل التشغيل)، وتعديل طبقة الصوت، ومؤشرات المشاعر (هادئ، غاضب، متحمس، حزين، وغيرها)، وعلامة إدراج الضحك. تقوم ميزة Pro Voice Cloning، المتوفرة في خطة Startup وما فوقها، بتدريب نموذج متحدث من عينة صوتية قصيرة وتُحسب تكلفتها بـ 1.5 رصيد لكل حرف بدلاً من الرصيد القياسي البالغ 1 رصيد لكل حرف. تنشر المنصة اتفاقيات مستوى خدمة (SLAs) تضمن وقت تشغيل بنسبة 99.9% وتدعي تقديم أسرع أوقات استجابة P90 عالمياً عبر شبكة توصيل المحتوى (CDN) الخاصة بها.
قامت شركة Goodcall، وهي شركة متخصصة في وكلاء الهاتف المدعومين بالذكاء الاصطناعي للأعمال، بنشر 2,217 وكيلاً صوتياً فريداً على Sonic في غضون ثلاثة أشهر من الانتقال إليه. وقد وصف رئيسهم التنفيذي النتيجة بشكل مباشر:
"يُعد Sonic المنتج الوحيد الموجود حالياً الذي يتميز بزمن انتقال للنموذج يقل عن 100 ms، متفوقاً على أقرب بديل له بأربعة أضعاف." - Bob Summers، الرئيس التنفيذي لشركة Goodcall، دراسة حالة عملاء Cartesia، 2025
موقع Cartesia مقارنة بـ ElevenLabs و Resemble AI
ينقسم سوق تحويل النص إلى كلام (TTS) في عام 2026 تقريباً بين أدوات إنشاء المحتوى للأغراض العامة والبنية التحتية للوكلاء في الوقت الفعلي. وتنافس Cartesia في المحور الأخير. وتُعد الاختلافات الآلية بين المنافسين الثلاثة الرئيسيين أمراً بالغ الأهمية لاتخاذ الاختيار الصحيح.
تُشغل ElevenLabs نظام تحويل النص إلى كلام (TTS) القائم على المحولات (transformers). يعالج استدلال المحولات كل رمز سابق في التسلسل، مما يتناسب جيداً مع جودة السرد الطويل ولكنه يضيف عبئاً إضافياً لكل رمز. يحقق نموذج Flash v2.5 الخاص بهم زمن استجابة (TTFA) يبلغ حوالي 75ms، وهو منافس لـ Cartesia Turbo. ومع ذلك، تعمل نماذج فئة الجودة العالية من ElevenLabs بزمن استجابة يبلغ 300ms أو أكثر، ومكتبة الأصوات الخاصة بهم أوسع بكثير: أكثر من 4,000 صوت معد مسبقاً عبر أكثر من 70 لغة مقارنة بـ 130 صوتاً و 42 لغة في Cartesia. في اختبار تفضيل أعمى على 100 صوت مستبعد، فضل المستخدمون Sonic-2 على ElevenLabs Flash V2 بنسبة 61.4% مقابل 38.6% للمقاطع الحوارية. يتطلب استنساخ الصوت في ElevenLabs ما لا يقل عن 10 ثوانٍ من الصوت؛ بينما يعمل الاستنساخ الفوري في Cartesia من 3 ثوانٍ فقط. التقسيم العملي هو: ElevenLabs لمكتبات الصوت الغنية، والدبلجة، والسرد الطويل، والمحتوى متعدد اللغات حيث يكون تنوع اللغات مهماً. بينما تُعد Cartesia الخيار الأمثل للبنية التحتية للوكلاء في الوقت الفعلي حيث يُعتبر كل مللي ثانية من زمن الانتقال مقياساً لجودة المنتج.
تتخذ Resemble AI مساراً معمارياً مختلفاً. يستخدم نموذج Chatterbox Turbo الخاص بهم محولاً بـ 350M معلمة مع وحدة فك ترميز انتشار (diffusion decoder) مقطرة بخطوة واحدة، مما يقلل التوليد من 10 خطوات انتشار إلى خطوة واحدة. يكمن تميز Resemble في الأمان والموثوقية: فهم يدمجون أدوات اكتشاف التزييف العميق (deepfake)، والعلامات المائية الصوتية، والطب الشرعي الصوتي في المنصة، مما يجعلها الخيار الطبيعي للصناعات الخاضعة للوائح التنظيمية التي تحتاج إلى إثبات مصدر الصوت. تم إصدار Chatterbox كمصدر مفتوح، وهو ما لا ينطبق على Sonic من Cartesia. لا تتطابق معايير زمن الانتقال الخاصة بـ Resemble مع أرقام TTFA المنشورة لـ Cartesia، ولا يعتمدون على السرعة كادعاء تسويقي أساسي. المقارنة هنا تكمن بين الموقف الأمني للمؤسسات وقابلية النشر مفتوحة المصدر (Resemble) مقابل أداء زمن الانتقال الخام للأنظمة في الوقت الفعلي (Cartesia).
"باستخدام واجهة برمجة تطبيقات الصوت التوليدي من Cartesia، Sonic، قمنا بتعزيز Cresta AI Agent لتجاوز النصوص الجامدة والتوجه نحو تقديم محادثات متعاطفة وشبيهة بالبشر." - Tim Shi، المؤسس المشارك والمدير التقني في Cresta، دراسة حالة عملاء Cartesia، 2025
واقع الترخيص وحقوق النشر
تمنح شروط Cartesia حقوقاً تجارية للمخرجات الصوتية بدءاً من خطة Pro ($4/شهرياً تُدفع سنوياً). بينما تقيد الخطة المجانية (Free) المخرجات للاستخدام الشخصي وغير التجاري. تتطلب ميزة Pro Voice Cloning، التي تدرب نموذج متحدث من الصوت المُرسل، أن يمتلك المستخدمون الصوت الذي يرسلونه أو أن يكون لديهم حقوق استخدامه. لا تنشر المنصة مصادر بيانات التدريب للأصوات المعدة مسبقاً في Sonic، ولم تُرفع أي دعاوى قضائية علنية بشأن بيانات التدريب ضد Cartesia اعتباراً من أبريل 2026.
تعني خيارات النشر على الأجهزة (on-device) والمحلية (on-premise) أنه يمكن للمؤسسات تشغيل استدلال Sonic محلياً، مما يجنبها مخاوف الاحتفاظ بالبيانات في الصناعات الخاضعة للوائح التنظيمية. تُسوق Cartesia لامتثالها لمعايير HIPAA لنشر الوكلاء الصوتيين في مجال الرعاية الصحية، ويؤكد نشر مركز اتصال Cresta في Brinks Home على الاستخدام الإنتاجي على مستوى المؤسسات. أشارت Veronica Moturi، نائب الرئيس الأول لتجربة العملاء في Brinks Home، إلى أن "وكيلنا الصوتي المدعوم بالذكاء الاصطناعي يوجه العملاء عبر سيناريوهات معقدة ومتعدد الخطوات لاستكشاف الأخطاء وإصلاحها، وكانت التعليقات الإيجابية من هؤلاء العملاء مذهلة"، واصفةً نتائج نشر Cresta باستخدام Sonic.
هيكل الحقوق التجارية واضح ومباشر: اشترك في خطة Pro أو أعلى، وسيكون الصوت المُولد ملكاً لك للاستخدام التجاري. الأصوات المستنسخة المدربة من تسجيلاتك الخاصة تنتمي إلى حسابك. لا تدعي Cartesia ملكيتها أو حقوقها في المخرجات الصوتية المُولدة من خلال واجهة برمجة التطبيقات (API) الخاصة بها.
أين تقصر Cartesia بشكل ملحوظ
يُعد الحد الأقصى البالغ 500 حرف في Sonic Turbo هو أكثر ما يثير إحباط المطورين. يتطلب بناء سرد طويل أو محادثة متعددة الأدوار حيث تتجاوز استجابة الوكيل الواحد 500 حرف تقسيم النص، وإدارة حدود الأجزاء لتجنب الانقسامات في منتصف الكلمة، وتجميع المقاطع الصوتية. يقبل ElevenLabs Flash v2.5 ما يصل إلى 40,000 حرف لكل طلب. بالنسبة لإنتاج الكتب الصوتية، أو سرد البودكاست، أو أي تطبيق تكون فيه المقاطع الفردية طويلة، فإن هذا الحد يفرض عملاً هندسياً يتجنبه المنافسون.
تغطية اللغات التي تبلغ 42 لغة هي تغطية حقيقية ولكنها لا تزال أضيق من تغطية ElevenLabs التي تتجاوز 70 لغة. ستجد الفرق التي تبني تطبيقات لأسواق جنوب شرق آسيا، أو اللغات الأفريقية الأقل شيوعاً، أو اللهجات الإقليمية ذات بيانات التدريب المحدودة فجوات واضحة. كما أن مكتبة الأصوات المعدة مسبقاً والتي تضم حوالي 130 صوتاً تُعد أقل تنوعاً من كتالوج ElevenLabs الذي يضم أكثر من 4,000 صوت. تواجه الفرق التي ترغب في تنوع اللهجات الإقليمية، أو أصوات متنوعة الأعمار، أو تغطية واسعة للشخصيات في الألعاب والإنتاج الإعلامي قيوداً صوتية تتطلب الاستثمار في الاستنساخ المخصص.
تُعد Cartesia واجهة برمجة تطبيقات (API) للمطورين، وليست أداة أعمال. لا يوجد موصل Salesforce أصلي، ولا تكامل مع سير عمل مكتب المساعدة (helpdesk)، ولا توجيه مكالمات جاهز للاستخدام. تلاحظ الفرق التي تصف Cartesia كطبقة صوتية خاصة بها باستمرار أنها تتعامل مع الصوت بشكل جيد ولكنها لا تساهم بشيء في بنية التطبيق المحيطة. أحد التشبيهات الشائعة: توفر Cartesia المحرك، وليس الهيكل، أو التوجيه، أو الملاحة. يجب على المطورين الذين يبنون وكيلاً صوتياً كاملاً تجميع الباقي بشكل مستقل.
يضيف الضبط اليدوي للمشاعر عبئاً إضافياً في سياقات المحادثة الديناميكية. على عكس المنصات التي تتميز باكتشاف العروض الصوتية (prosody) التلقائي، تتطلب Cartesia علامات مشاعر صريحة أو تعديلات يدوية لمؤشرات السرعة/طبقة الصوت. في نظام يعتمد على نصوص مكتوبة مسبقاً، يمكن إدارة ذلك؛ أما في الذكاء الاصطناعي الحواري التوليدي الذي يستجيب لمدخلات مستخدم غير متوقعة، فإن الحفاظ على دقة عناصر التحكم في المشاعر يتطلب إما هندسة أوامر (prompt engineering) دقيقة للنماذج اللغوية الكبيرة (LLM) أو طبقة تصنيف تقرر علامة المشاعر التي يجب تطبيقها.
الفئة المستهدفة لـ Cartesia
تستهدف Cartesia المطورين الذين يبنون ذكاءً اصطناعياً حوارياً في الوقت الفعلي حيث يؤثر زمن الانتقال بشكل مباشر على جودة المنتج. إذا كان تطبيقك عبارة عن وكيل صوتي، أو روبوت هاتفي، أو صورة رمزية (avatar) مدعومة بالذكاء الاصطناعي في لعبة، أو أي نظام تفاعلي حيث ينتظر المستخدم استجابة صوتية، فإن الفرق بين 90ms و 300ms كزمن استجابة (TTFA) يكون مسموعاً بوضوح. يمثل معدل تفاعل المكالمات البالغ 97% في Goodcall و 2,217 وكيلاً تم نشرهم نوع النتيجة التي يتيحها تحويل النص إلى كلام (TTS) بزمن انتقال منخفض: يبقى المستخدمون على الخط لأن الذكاء الاصطناعي يبدو وكأنه شريك محادثة طبيعي.
تستفيد فرق الرعاية الصحية والخدمات المالية التي تدير أعباء عمل حساسة للامتثال من خيارات النشر على الأجهزة (on-device) والمحلية (on-premise). يُعد الامتثال لمعايير HIPAA مع عدم نقل البيانات السحابية ميزة تنافسية مهمة لهذا القطاع. ستجد المؤسسات الكبيرة التي تحتاج إلى دعم ذي أولوية، وتزامن عالٍ، واتفاقيات مستوى خدمة (SLAs) مخصصة أن باقتي Scale و Enterprise مناسبتان تماماً.
تجاوز Cartesia إذا كانت احتياجاتك الأساسية هي تنوع الأصوات واتساع اللغات لإنشاء المحتوى. إذا كنت تنتج بودكاست متعدد اللغات، أو تدبلج محتوى فيديو إلى أكثر من 50 لغة، أو تحتاج إلى مكتبة تضم أكثر من 1,000 صوت لمنصة إبداعية، فإن كتالوج ElevenLabs سيخدمك بشكل أفضل. تجاوز Cartesia إذا كنت بحاجة إلى حل صوتي بدون تعليمات برمجية (no-code) أو بتعليمات برمجية منخفضة (low-code): لا توجد واجهة تعتمد على النقر للمستخدمين غير التقنيين، ولا منشئ حملات، ولا مشغل مدمج. واجهة برمجة التطبيقات (API) هي المنتج بحد ذاته. وتجاوز Sonic Turbo تحديداً إذا كانت حالة الاستخدام الخاصة بك تولد مقاطع نصية أطول من بضع جمل في المرة الواحدة، ما لم تكن مستعداً لبناء وصيانة مسار لتقسيم النصوص (chunking pipeline).
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Cartesia AI.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing
