تخطَّ إلى المحتوى الرئيسي
Vantaige
Speechmatics screenshot
Speechmatics logo

Speechmatics

مجاني جزئيًا

Speechmatics هي واجهة برمجة تطبيقات (API) لتحويل الكلام إلى نص موجهة للمؤسسات، تأسست في كامبريدج وتعمل بنموذج Ursa 2. تدعم أكثر من 55 لغة في الوقت الفعلي مع خيارات النشر المحلي (on-premises)، وتوافق كامل مع معايير HIPAA وSOC 2، ودقة عالية بغض النظر عن اللهجة، وهي مصممة خصيصاً لجهات البث، ومراكز الاتصال، والصناعات الخاضعة للوائح التنظيمية.

حالات الاستخدام:الأعمال
الميزات:API

Speechmatics هي واجهة برمجة تطبيقات (API) لتحويل الكلام إلى نص موجهة للمؤسسات، طورتها شركة مقرها كامبريدج بالمملكة المتحدة، تأسست عام 2006 على يد الدكتور توني روبنسون، وهو باحث في مجال التعرف على الكلام باستخدام الشبكات العصبية والذي أجرى أبحاثه التأسيسية في جامعة كامبريدج. تأسست الشركة في الأصل باسم Cantab Research Ltd.، وأمضت ما يقرب من عقدين من الزمن في بناء قدرة أساسية واحدة: التفريغ الصوتي الدقيق عبر كل لهجة ولغة دون التضحية بالسرعة. تُشغّل واجهة برمجة التطبيقات هذه خدمات التعليق الصوتي المباشر للبث، وتحليلات مراكز الاتصال، والتوثيق الطبي، وتطبيقات الاستخبارات الدفاعية حيث لا يمكن اعتبار الدقة وسيادة البيانات مجرد إضافات اختيارية.

يغطي النموذج الحالي للمنصة، Ursa 2 (المتاح للعموم منذ أكتوبر 2024)، أكثر من 55 لغة في وضعي البث في الوقت الفعلي والمعالجة المجمعة (batch)، ويوفر زمن انتقال للبث يقل عن ثانية واحدة عند الإعداد الصحيح، ويتضمن ميزة تحديد المتحدثين (speaker diarization) كميزة أساسية بدلاً من كونها إضافة مدفوعة. تقدم Speechmatics ثلاثة أوضاع للنشر: واجهة برمجة تطبيقات سحابية، والنشر المحلي عبر حاويات Docker أو الأجهزة الافتراضية المكونة مسبقاً، والاستدلال الطرفي على الجهاز (on-device edge inference). تحمل الشركة شهادات ISO/IEC 27001:2022 وSOC 2 Type II وGDPR وHIPAA عبر حزمة النشر الخاصة بها. حقق النموذج الطبي المتخصص (Medical Model) الذي تم إطلاقه في سبتمبر 2025 دقة عامة في العالم الحقيقي بنسبة 93% على الصوتيات السريرية و96% في استدعاء الكلمات الرئيسية الطبية، وذلك عند مقارنته بأنظمة مماثلة من موردين منافسين. بالنسبة للفرق التي تحتاج إلى تجربة المطورين التي تقدمها Deepgram أو AssemblyAI دون متطلبات الامتثال، يمكنها الاطلاع على تلك البدائل؛ أما بالنسبة للمؤسسات الخاضعة للوائح التنظيمية وجهات البث العالمية التي لا تكتفي بمستوى "جيد بما فيه الكفاية"، فإن Speechmatics تُعد خياراً أولياً موثوقاً.

ما تقدمه Speechmatics في أبريل 2026

تستقبل واجهة برمجة تطبيقات Speechmatics المدخلات الصوتية (البث عبر WebSocket أو الملفات المجمعة المرفوعة) وتُرجع نصوصاً مفرغة ومختومة زمنياً، وتسميات للمتحدثين، وعلامات الترقيم، ودرجات ثقة اختيارية. يغطي نموذج Ursa 2، الذي أصبح النموذج الافتراضي لجميع خدمات Speechmatics في أكتوبر 2024، 55 لغة في وضع البث في الوقت الفعلي، مع إضافة اللغتين الأيرلندية والمالطية عند الإطلاق لإكمال تغطية جميع اللغات الأوروبية الرئيسية الـ 24. وفي اختبارات الدقة المعيارية على مجموعة بيانات FLEURS، احتل Ursa 2 المرتبة الأولى في 62% من اللغات التي تم اختبارها وضمن المراكز الثلاثة الأولى في 92% منها.

تتوفر معدلات التفريغ الصوتي المجمع في فئتين: Standard وEnhanced (تستخدم فئة Enhanced تمريرة نموذج أكبر للحصول على دقة أفضل في الصوتيات الصعبة). يستخدم البث في الوقت الفعلي معلمة max_delay تتراوح من 0.7 إلى 4 ثوانٍ؛ حيث يعمل الإعداد الافتراضي البالغ 4 ثوانٍ على زيادة الدقة إلى أقصى حد، بينما يُعد 1.5 ثانية نقطة البداية الموصى بها لتطبيقات الوكلاء الصوتيين. كما تدمج المنصة تقنيات تحويل الكلام إلى نص (STT)، وتبادل الأدوار عبر النماذج اللغوية الكبيرة (LLM)، وتحويل النص إلى كلام (TTS) في منتج واحد يُسمى Flow، وهو واجهة برمجة تطبيقات لوكيل صوتي حواري متاح في كل من التكوينات السحابية والمحلية.

يستحق النموذج الطبي (Medical Model) الصادر في سبتمبر 2025 إشارة خاصة. فقد وضع معايير صناعية للصوتيات السريرية باللغة الإنجليزية بدقة عامة في العالم الحقيقي بلغت 93% (معدل خطأ في الكلمات WER يبلغ 7%)، و96% في استدعاء الكلمات الرئيسية الطبية، ومعدل خطأ في الكلمات الرئيسية يبلغ 4% في أسماء الأدوية والتشخيصات ورموز الإجراءات، وهو ما يمثل أخطاء في المصطلحات الطبية أقل بنسبة 50% من أقرب منافس في الاختبارات المعيارية الخاصة بـ Speechmatics. يتم نشر النموذج على خادم NVIDIA Triton Inference Server مع تسريع CUDA وهو متاح باللغات الإنجليزية والإسبانية والفرنسية والهولندية والفنلندية، مع طرح اللغات المتبقية عبر محفظة اللغات الـ 55.

في مارس 2026، أصدرت Speechmatics ما وصفته بأنه أول نموذج إنتاجي ثنائي اللغة (عربي-إنجليزي) لتحويل الكلام إلى نص في العالم، وهو نموذج واحد يتعامل مع لهجات عربية متعددة واللغة الإنجليزية في وقت واحد. وقد عالج هذا فجوة طويلة الأمد تمت الإشارة إليها في مراجعات المؤسسات من منطقة الشرق الأوسط.

"يسعدنا العمل مع Speechmatics لدفع عجلة التعليق الصوتي المباشر والمجمع لدينا. إنهم يواصلون تفوقهم على الجميع في جميع مقاييس الجودة الرئيسية." - توم ووتون، قائد المنتج، Red Bee Media، 2024

موقع Speechmatics مقارنة بـ Deepgram وAssemblyAI

يضم سوق واجهات برمجة تطبيقات تحويل الكلام إلى نص (STT API) في عام 2026 ثلاثة منافسين رئيسيين على مستوى المؤسسات: Speechmatics، وDeepgram، وAssemblyAI. الاختلافات الآلية كبيرة بما يكفي لدرجة أن اختيار الأداة الخاطئة لحالة الاستخدام الخاصة بك له عواقب حقيقية.

Speechmatics مقابل Deepgram Nova-3: Deepgram هي شركة ناشئة مقرها الولايات المتحدة تتميز ببنية تركز على تقليل زمن الانتقال أولاً. ينشر نموذج Nova-3 معياراً لمعدل خطأ الكلمات (WER) يبلغ 5.26% عبر 2,703 ملفات في 9 مجالات، وفي التصنيفات المدمجة للسرعة والدقة، غالباً ما تفوز Deepgram. يستهدف نموذج البث Flux الخاص بها زمن انتقال يقل عن 100 مللي ثانية لتطبيقات الوكلاء الصوتيين مع عبء إعداد أقل من ضبط `max_delay` في Speechmatics. تتيح ميزة Keyterm Prompting في Deepgram إدخال ما يصل إلى 100 مصطلح من المفردات المخصصة في وقت الاستدلال، بينما يستخدم القاموس المخصص (Custom Dictionary) في Speechmatics نهجاً قائماً على JSON يقتصر على 6 كلمات لكل إدخال مع بدائل صوتية "sounds_like". الاختلاف الحاسم: لا تمتلك Deepgram خيار النشر المحلي. بالنسبة لشركة ناشئة أمريكية في مجال البرمجيات كخدمة (SaaS) تبني وكيلاً صوتياً، فإن تسعير Deepgram (أسعار بالدقيقة بالإضافة إلى واجهة برمجة تطبيقات مجمعة للوكيل الصوتي بسعر $4.50/ساعة) يكون أكثر وضوحاً في الأحجام الصغيرة. أما بالنسبة لجهة بث أوروبية أو مستشفى لا يمكنه توجيه صوتيات المرضى عبر مزود سحابي أمريكي، فإن Speechmatics هي الخيار الوحيد في هذه الفئة.

Speechmatics مقابل AssemblyAI Universal-3 Pro: تركز AssemblyAI على المطورين أولاً وهي غنية بالميزات. يضع منتجها LeMUR نموذجاً لغوياً كبيراً (LLM) مباشرة فوق الصوت، مما يتيح التلخيص، وتحليل المشاعر، واستخراج الأسئلة والأجوبة، واكتشاف الكيانات في استدعاء واحد لواجهة برمجة التطبيقات دون الحاجة إلى مسار LLM منفصل. يدعي نموذج Universal-3 Pro Streaming من AssemblyAI احتلاله المرتبة الأولى في تصنيفات الدقة متعددة اللغات (وفقاً لاختباراتهم المعيارية) ويدعم التوجيه باللغة الطبيعية والإدخال الديناميكي للمصطلحات الرئيسية في منتصف البث. الحد الأقصى الآلي: يدعم البث في AssemblyAI 6 لغات (الإنجليزية، الإسبانية، الفرنسية، الألمانية، الإيطالية، البرتغالية). بينما تدعم Speechmatics أكثر من 55 لغة في وضع البث. إذا كان تطبيقك يتعامل مع مكالمات من مستخدمين في 20 دولة، فإن الحد الأقصى للغات البث في AssemblyAI يمثل عائقاً. كما لا تمتلك AssemblyAI خيار النشر المحلي، وتتراكم الإضافات الخاصة بتحديد المتحدثين، والوضع الطبي، وLeMUR بشكل ملموس على التكلفة الأساسية. وجدت دراسة أكاديمية أن Deepgram تخلفت عن كل من Speechmatics وAssemblyAI في دقة قراءة الكلام بهوامش ذات دلالة إحصائية، ولكن الصورة العامة تظل كما هي: اختبر على الصوتيات الخاصة بك، لأن الاختبارات المعيارية للموردين لا تتكرر باستمرار عبر مجموعات الاختبار.

"العمل مع Speechmatics يمكننا من تزويد عملائنا بسلاسة بتحليلات كلام آلية وعالية الجودة كجزء من حلولنا." - ماريانو تان، الرئيس والمدير التنفيذي، Prosodica، 2024

الخلاصة: تتفوق Deepgram في زمن انتقال الوكيل الصوتي وسهولة الاستخدام للمطورين في الولايات المتحدة. وتتفوق AssemblyAI في ميزات LLM المدمجة وتأهيل المطورين. بينما تتفوق Speechmatics في تغطية اللغات، والنشر المحلي، وعمق شهادات الامتثال. كما أنها تقترن بشكل طبيعي مع معايير OpenAI Whisper كنقطة مرجعية: Whisper مفتوح المصدر وقوي في الدقة، ولكنه لا يقدم اتفاقية مستوى خدمة (SLA) للمؤسسات، ولا ميزة تحديد المتحدثين، ولا البث، مما يجعل Speechmatics البديل المنظم للفرق التي تجاوزت قدرات Whisper المستضاف ذاتياً.

واقع الامتثال والنشر

أوضح ما يميز Speechmatics عن كل من Deepgram وAssemblyAI هو مرونة النشر، وحزمة شهادات الامتثال التي تدعمها. خيار النشر المحلي ليس مجرد ميزة تسويقية. يقوم Flow On-Premise، الذي تم إصداره في عام 2024، بنشر حزمة ذكاء اصطناعي حواري كاملة (STT، وتبادل الأدوار عبر LLM، وTTS) داخل البنية التحتية الخاصة بالعميل عبر حاويات Docker أو الأجهزة الافتراضية المكونة مسبقاً. هذا يعني أن الصوت لا يغادر جدار الحماية الخاص بالعميل أبداً، وهو أمر بالغ الأهمية في الرعاية الصحية (HIPAA)، والحكومات الأوروبية (GDPR مع قواعد إقامة بيانات وطنية أكثر صرامة)، والدفاع (الصوتيات المصنفة)، والخدمات المالية (متطلبات تسجيل المكالمات وفقاً لـ MiFID II).

الشهادات الحاصلة عليها اعتباراً من أبريل 2026: ISO/IEC 27001:2022، وSOC 2 Type II، والامتثال لـ GDPR، والامتثال لـ HIPAA. يتم تشفير البيانات في حالة السكون باستخدام AES-256 وأثناء النقل باستخدام TLS 1.2 كحد أدنى. تعمل البنية التحتية على حاويات يتم التحكم فيها بواسطة Kubernetes مع مراقبة SIEM. يمكن لعملاء المؤسسات أيضاً تحديد تكوينات سحابية متعددة المناطق لتلبية متطلبات إقامة البيانات الوطنية دون الانتقال بالكامل إلى النشر المحلي.

بالنسبة للفرق التي تقيم Speechmatics مقابل ElevenLabs لسير عمل يجمع بين STT وTTS: تُعد ElevenLabs في الأساس منتجاً لتحويل النص إلى كلام (TTS) مع إضافات حديثة لتحويل الكلام إلى نص (STT)، بينما تمتلك Speechmatics خبرة 20 عاماً من التخصص في STT مع إضافة TTS مؤخراً (تتضمن الفئة المجانية مليون حرف/شهر من TTS باللغة الإنجليزية). مواقف المنتجات معكوسة. بالنسبة للوكلاء الصوتيين الذين يحتاجون إلى أفضل STT في فئته مع خيار التبديل إلى طبقة TTS متخصصة، تقترن Speechmatics بسلاسة مع ElevenLabs أو Coqui TTS عبر بنية واجهة برمجة تطبيقات Flow بدلاً من التنافس المباشر. قد تجد الفرق التي تبني مسارات صوتية مستضافة بالكامل دون قيود الامتثال أن Coqui TTS أو ElevenLabs أكثر اكتمالاً من حيث الميزات على جانب التوليف الصوتي.

أين تقصر Speechmatics بشكل ملحوظ

تتركز خيوط الإحباط المتكررة عبر G2 وCapterra وGartner Peer Insights في أربعة مجالات:

غموض التسعير عند التوسع. تحتوي فئة Pro على أسعار منشورة وحد أقصى يبلغ 6,000 ساعة/شهر، ولكن أي شيء يتجاوز ذلك يتطلب محادثة حول فئة Enterprise دون تسعير عام. يشير المستخدمون في مراجعاتهم تحديداً إلى أن هيكل التسعير يصبح معقداً عند التوسع. يساعد خصم الحجم (20% فوق 500 ساعة/شهر، وخصومات إضافية بدءاً من 24,000 ساعة/سنة)، ولكن لا يمكنك بناء نموذج تكلفة موثوق للإنتاج واسع النطاق دون التحدث إلى المبيعات.

قيود القاموس المخصص. يُعد القاموس المخصص (Custom Dictionary) القائم على JSON مفيداً للمصطلحات الخاصة بمجال معين ولكنه يحد الإدخالات بـ 6 كلمات. يجد مستخدمو الرعاية الصحية والقانونيون الذين يحتاجون إلى تحديد مصطلحات سريرية مركبة طويلة أو عبارات قانونية متعددة الكلمات أن هذا الأمر مقيد. تتعامل AssemblyAI مع هذا عبر التوجيه باللغة الطبيعية دون حد أقصى للكلمات.

عبء إعداد زمن انتقال البث. الإعداد الافتراضي لمعلمة `max_delay` هو 4 ثوانٍ، وهو أمر جيد لحالات استخدام المعالجة اللاحقة ولكنه يخلق احتكاكاً للمطورين الذين يبنون وكلاء صوتيين في الوقت الفعلي. يمكن تحقيق الحد الأدنى البالغ 0.7 ثانية، ولكنه يتطلب قراءة الوثائق والاختبار وهو ما تتجنبه منتجات الوكيل الصوتي من Deepgram حسب التصميم.

محدودية المعالجة اللاحقة المدمجة. تُرجع Speechmatics نصوصاً دقيقة. لكنها لا تُرجع ملخصات، أو تسميات للمشاعر، أو استخراجات للكيانات، أو تحليلات مكالمات منظمة بشكل جاهز. تتطلب كل ميزة تتجاوز التفريغ الصوتي الخام مساراً وتكاملاً منفصلاً. ستحتاج الفرق التي تتوقع نوع التحليلات الجاهزة التي يوفرها LeMUR من AssemblyAI إلى بناء تلك الطبقة بنفسها.

لمن تصلح Speechmatics

اختر البناء باستخدام Speechmatics عندما: تحتاج إلى نشر محلي أو سحابة خاصة ولا يمكنك قبول مغادرة الصوت لبيتك التحتية؛ يمتد الصوت الخاص بك لأكثر من 6 لغات في وضع البث؛ تخدم صناعة خاضعة للوائح التنظيمية (الرعاية الصحية، التمويل، الدفاع، الحكومة) حيث تكون شهادات HIPAA/SOC 2/ISO 27001 متطلباً للمشتريات؛ تحتاج إلى ميزة قوية لتحديد المتحدثين مضمنة دون تسعير إضافي؛ تحتاج حالة استخدام التعليق الصوتي المباشر أو البث إلى زمن انتقال يقل عن ثانية عبر عشرات اللغات في وقت واحد.

تجاوز Speechmatics عندما: تكون مطوراً مستقلاً أو شركة ناشئة صغيرة تستكشف STT لأول مرة (تجربة المطورين والتسعير في Deepgram أكثر سهولة في الأحجام المنخفضة)؛ تحتاج إلى تلخيص LLM مدمج، أو تحليل المشاعر، أو استخراج الكيانات في استدعاء واحد لواجهة برمجة التطبيقات (يتعامل LeMUR من AssemblyAI مع هذا دون مسار منفصل)؛ تبني وكيلاً صوتياً مقره الولايات المتحدة حيث يكون زمن الانتقال هو المتغير الأساسي والامتثال ليس عاملاً مقيداً (تم تصميم Deepgram Flux خصيصاً لهذا الغرض)؛ أو تتطلب ميزانيتك فئة مجانية غير محدودة حقاً قبل الالتزام بالتسعير القائم على الاستخدام (الفئة المجانية البالغة 8 ساعات/شهر هي نقطة انطلاق، وليست بيئة إنتاج).

قصة الاختبار المعياري لـ Limecraft توضيحية. قامت منصة التعاون الإعلامي بتقييم العديد من موردي ASR وجهاً لوجه قبل توحيد المعايير على Speechmatics لعملائها من جهات البث. أفاد مارتن فيرواست، الرئيس التنفيذي للإيرادات في Limecraft: "إنهم يتفوقون باستمرار على الموردين الآخرين في معدل خطأ الكلمات وعلامات الترقيم، ويلعبون دوراً محورياً في تطوير مساحة العمل لدينا." هذا هو نوع المشترين الذي صُممت Speechmatics من أجله: فرق المؤسسات التي أجرت الاختبارات المعيارية، وقارنت مستندات الامتثال، ووجدت أن الدقة بالإضافة إلى مرونة النشر تفوق التكلفة الإضافية.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Speechmatics.