
Deepgram عبارة عن واجهة برمجة تطبيقات (API) للمطورين لتحويل الكلام إلى نص، وتحويل النص إلى كلام، وتنسيق الوكلاء الصوتيين. يقدم نموذج Nova-3 تفريغاً صوتياً للبث المباشر بزمن انتقال أقل من 300 مللي ثانية بتكلفة $0.46 لكل ساعة صوتية، مع إمكانية النشر المحلي (on-premises) وواجهة برمجة تطبيقات للوكيل الصوتي (Voice Agent API) تجمع بين STT و TTS وتوجيه LLM في مسار WebSocket واحد.
Deepgram هي منصة صوتية تعمل بالذكاء الاصطناعي طورتها شركة Deepgram, Inc.، وهي شركة مقرها سان فرانسيسكو تأسست عام 2015. تقدم المنصة ثلاث واجهات برمجة تطبيقات (APIs) للإنتاج: تحويل الكلام إلى نص باستخدام نموذج Nova-3، وتحويل النص إلى كلام باستخدام Aura-2، وواجهة برمجة تطبيقات للوكيل الصوتي (Voice Agent API) التي تربط بين STT و TTS وتنسيق LLM في مسار WebSocket واحد مُدار. لا تحتوي المنصة على واجهة للمستهلكين. حيث تقوم بإرسال الصوت أو النص عبر واجهة برمجة التطبيقات (API) وتحصل في المقابل على نصوص مفرغة مهيكلة، أو كلام مُركّب، أو جلسات وكيل صوتي كاملة. يستخدم أكثر من 450 عميلاً من الشركات منصة Deepgram في بيئات الإنتاج، بما في ذلك Twilio و Aircall و Jack in the Box.
يُعد Nova-3، الذي تم إطلاقه في 12 فبراير 2025، النموذج الرائد الحالي لـ STT. ويحقق متوسط معدل خطأ في الكلمات يبلغ 6.84% في البث الصوتي المباشر، وهو تحسن بنسبة 54.3% مقارنة بأقرب منافس لواجهات برمجة التطبيقات المُدارة. يدعم النموذج التبديل اللغوي (code-switching) في الوقت الفعلي عبر 10 لغات في وقت واحد، ويوفر ميزة التلقين بالمصطلحات الرئيسية (keyterm prompting) للتكيف الفوري مع المفردات دون الحاجة إلى إعادة تدريب النموذج، ويعمل بزمن انتقال يقل عن 300 مللي ثانية لجلسات البث. أصبحت واجهة برمجة تطبيقات الوكيل الصوتي (Voice Agent API) متاحة للعموم في 16 يونيو 2025، وسجلت 71.5 على مؤشر جودة الوكيل الصوتي (Voice Agent Quality Index)، متفوقة على OpenAI بنسبة 6.4% وعلى ElevenLabs بنسبة 29.3% في مقياس مركب يضم زمن الانتقال، ومعدل المقاطعة، وتغطية الاستجابة. يقدم Aura-2 TTS زمناً يقل عن 200 مللي ثانية للوصول إلى البايت الأول (time-to-first-byte) مع أكثر من 40 صوتاً باللغة الإنجليزية عبر 7 لغات.
ما الذي تقدمه Deepgram فعلياً في أبريل 2026
المنتج الأساسي لـ Deepgram هو البنية التحتية المُدارة للصوت. يمكنك الاتصال بواجهة برمجة التطبيقات الخاصة بها عبر WebSocket للبث في الوقت الفعلي أو عبر HTTP للمعالجة المجمعة للملفات المسجلة مسبقاً. يتولى Nova-3 المهام الشاقة في جانب STT: فهو يقبل التدفقات الصوتية ويعيد نصوصاً مفرغة على مستوى الكلمة مع طوابع زمنية، وميزة اختيارية لتحديد المتحدثين (speaker diarization)، وعلامات الترقيم، والتنقيح في الوقت الفعلي لما يصل إلى 50 نوعاً من الكيانات (أرقام الهواتف، أرقام بطاقات الائتمان، أرقام الضمان الاجتماعي).
تستحق ميزة التلقين بالمصطلحات الرئيسية اهتماماً خاصاً. فبدلاً من طلب ضبط دقيق للنموذج أو تحميل مفردات مخصصة، يقبل Nova-3 ما يصل إلى 100 مصطلح خاص بمجال معين لكل طلب API ويعزز احتمالية التعرف عليها دون أي دورة إعادة تدريب. هذا يجعل تكييف Deepgram مع الصوتيات الطبية أو القانونية أو التقنية أسرع مما تسمح به مسارات الضبط الدقيق التقليدية. يُعد الحد الأقصى البالغ 100 مصطلح قيداً حقيقياً للمفردات الكبيرة، ولكنه يغطي المصطلحات ذات الأولوية القصوى لمعظم حالات الاستخدام في بيئات الإنتاج.
تقوم واجهة برمجة تطبيقات الوكيل الصوتي (Voice Agent API) بتجريد مسار الوكيل الصوتي بالكامل. في السابق، كان على المطورين تجميع خدمة STT منفصلة، وطبقة VAD لاكتشاف المقاطعة (barge-in)، وواجهة برمجة تطبيقات LLM، ونقطة نهاية TTS. تتعامل واجهة برمجة تطبيقات الوكيل الصوتي من Deepgram مع كل هذا من خلال جلسة WebSocket واحدة: فهي تدير تبادل الأدوار، واكتشاف المقاطعة، وحالة الجلسة، وتحديثات التلقين في الوقت الفعلي. يمكنك إحضار نموذج LLM الخاص بك أثناء استخدام STT و TTS من Deepgram، أو استخدام حزمة Deepgram الكاملة بتكلفة $4.50 في الساعة.
تشمل خيارات النشر السحابة العامة، و VPC الخاص داخل حسابات AWS أو Azure، والنشر المحلي (on-premises) عبر حاويات Docker أو Kubernetes. يُعد مسار النشر المحلي مهماً لفرق الرعاية الصحية والخدمات المالية: حيث توفر بنية Deepgram المعتمدة على الحاويات نفس زمن الانتقال والدقة التي توفرها السحابة مع الحفاظ على البيانات الصوتية خلف جدران الحماية الخاصة بالشركة. هذا الخيار متاح فقط في عقود Enterprise.
"أدق نظام STT في الوقت الفعلي قمنا باختباره.. أول نموذج لتحويل الكلام إلى نص يجمع بين التفريغ الصوتي متعدد اللغات في الوقت الفعلي، وحقن المفردات المباشر، وزمن انتقال يقل عن 300 مللي ثانية." - Stephen FIYINFOLUWA Oladele، Neurl Creators، مراجعة على Substack، 2025
موقع Deepgram مقارنة بـ AssemblyAI و Whisper
المقارنة الأكثر أهمية لقرارات الإنتاج هي بين Deepgram Nova-3 و AssemblyAI Universal-2/Slam-1 و OpenAI Whisper. تغطي هذه النماذج الثلاثة معظم سوق STT للمطورين، لكنها تقدم مقايضات هندسية مختلفة جذرياً.
Deepgram مقابل AssemblyAI: يجمع نموذج Slam-1 من AssemblyAI بين وحدة فك ترميز LLM ووحدة ترميز ASR تقليدية، مما يمنحه تخصيصاً أكثر مرونة قائماً على التلقين ويتعامل مع ما يصل إلى 1,000 مصطلح خاص بالمجال لكل طلب، مقابل حد 100 مصطلح في Nova-3. يدعم AssemblyAI Universal-2 أكثر من 100 لغة مقارنة بمجموعة اللغات المتعددة الأضيق ولكن الأكثر دقة في Nova-3. تتمتع AssemblyAI أيضاً بذكاء صوتي أعمق جاهز للاستخدام: اكتشاف المواضيع، واكتشاف الكيانات، وإنشاء الفصول، ونموذج LeMUR الصوتي (LLM) للاستعلامات الحوارية حول النصوص المفرغة. يُعد الذكاء الصوتي في Deepgram (التلخيص، وتحليل المشاعر) أبسط ولديه مشكلات هلوسة معروفة في الكلام التقني الكثيف. تتفوق Deepgram في زمن انتقال البث المباشر (أقل من 300 مللي ثانية مقابل نطاق 300-600 مللي ثانية في AssemblyAI)، والنشر المحلي (AssemblyAI هي خدمة سحابية SaaS فقط)، والتسعير عند الأحجام الكبيرة. يبلغ سعر AssemblyAI Universal-2 حوالي $0.37/ساعة؛ بينما يبلغ سعر Nova-3 حوالي $0.46/ساعة في خطة الدفع حسب الاستخدام (Pay-As-You-Go) ولكنه ينخفض إلى $0.39/ساعة في خطة Growth.
Deepgram مقابل Whisper: نموذج Whisper هو محول (Transformer) مفتوح المصدر للتشفير وفك التشفير من OpenAI، تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات، مع توفر الأوزان للاستضافة الذاتية. يغطي 57 لغة وهو مجاني على مستوى النموذج. لكن Whisper لا يدعم البث في الوقت الفعلي بشكل أصلي: فجعله يعمل مع الصوت المباشر يتطلب حلولاً بديلة مثل whisper.cpp، مما يضيف عبئاً هندسياً كبيراً. يستغرق Whisper large-v3 من 10 إلى 30 دقيقة لتفريغ ساعة من الصوت اعتماداً على الأجهزة؛ بينما تقوم Deepgram بتفريغ نفس الساعة في حوالي 20 ثانية. الاستضافة الذاتية لـ Whisper على مثيل GPU (عادةً $0.50-$1.50/ساعة لما يعادل A10G) تجعل تكلفة الحوسبة قريبة من تكلفة Deepgram البالغة $0.46/ساعة، مما يجعل المفاضلة بين الخدمة المُدارة والاستضافة الذاتية أقل وضوحاً مما يوحي به إطار "Whisper مجاني".
"اخترت Deepgram تحديداً لأنها روجت لنفسها على أنها الأسرع في تقليل تأخيرات الاستجابة." - Alyx1337، Hacker News، ديسمبر 2023
كيف يبدو واقع مسار الوكيل الصوتي
تُعد واجهة برمجة تطبيقات الوكيل الصوتي (Voice Agent API) هي المنتج الذي تضعه Deepgram بنشاط كخندق تنافسي مميز. كان بناء وكيل صوتي قبل وجود واجهة برمجة التطبيقات هذه يعني تشغيل أربع خدمات منفصلة: نقطة نهاية STT للتفريغ الصوتي، وطبقة VAD لاكتشاف المقاطعة، وواجهة برمجة تطبيقات LLM لإنشاء الاستجابة، ونقطة نهاية TTS لنطق الاستجابة. تضيف كل قفزة زمناً للانتقال، ويعني ربط حالات الخطأ عبر أربع خدمات وجود المزيد من أنماط الفشل التي يجب التعامل معها في بيئة الإنتاج.
تدمج واجهة برمجة تطبيقات الوكيل الصوتي من Deepgram كل هذا في جلسة WebSocket واحدة. أنت ترسل الصوت؛ وتتولى واجهة برمجة التطبيقات مهام VAD، و STT، وتوجيه LLM (الافتراضي من Deepgram أو الخاص بك)، وتركيب TTS، وبث الصوت المستجاب مرة أخرى. يتيح لك حقن التلقين في الوقت الفعلي تحديث تلقين النظام في منتصف الجلسة، ويسمح التبديل السريع للنموذج (hot-swapping) بتغيير أصوات TTS أثناء مكالمة مباشرة. تستخدم Jack in the Box هذه البنية لطلبات خدمة السيارات (drive-through). وتقوم Aircall و OpenPhone بدمجها للتعامل مع المكالمات.
ومع ذلك، فإن إدارة اتصال WebSocket هي النقطة التي يواجه فيها المطورون احتكاكاً مستمراً. تُظهر مناقشات GitHub الخاصة بـ Deepgram نمطاً مستمراً لأخطاء CLIENT_MESSAGE_TIMEOUT عندما يبدأ بث الصوت قبل أن يؤكد الخادم رسالة SettingsApplied. تتطلب المصافحة (handshake) الصحيحة انتظار Welcome، ثم Settings، ثم تأكيد SettingsApplied قبل إرسال أي بيانات صوتية. يؤدي التكوين الخاطئ لهذا إلى قطع الاتصال في غضون 2-3 ثوانٍ. الإصلاح موثق ولكنه غير بارز بشكل كافٍ في أدلة البدء السريع.
يبلغ الحد الأقصى لحصة البث المتزامن الافتراضية 1,200 طلب. يتطلب التوسع إلى ما هو أبعد من ذلك الاتصال بفريق مبيعات Deepgram، مما يسبب احتكاكاً للفرق سريعة النمو التي تصل إلى الحد الأقصى بشكل غير متوقع في بيئة الإنتاج.
الفئة المستهدفة لـ Deepgram
النقطة المثالية لـ Deepgram هي الفرق الهندسية التي تبني بنية تحتية صوتية للإنتاج حيث يكون زمن الانتقال الأقل من 300 مللي ثانية مطلباً وليس تفضيلاً. تتناسب تحليلات دعم العملاء في الوقت الفعلي، وأنظمة IVR، وميزات SaaS التي تدعم الصوت، ووكلاء الذكاء الاصطناعي الحواري بشكل جيد مع هذا الملف الشخصي. تستفيد منصات مراكز الاتصال التي تعالج آلاف التدفقات الصوتية المتزامنة من بنية بث Nova-3 وخيار النشر المحلي للصناعات الخاضعة للتنظيم.
يغطي الرصيد المجاني البالغ $200 (لا يتطلب بطاقة ائتمان) ما يقرب من 433 ساعة من التفريغ الصوتي أحادي اللغة (Monolingual) لـ Nova-3 بأسعار الدفع حسب الاستخدام. تُعد هذه ميزانية استكشاف كبيرة للمطورين المستقلين والفرق الصغيرة التي تقيّم واجهة برمجة التطبيقات قبل الالتزام بأي خطة.
ما لا تقدمه Deepgram
Deepgram هي واجهة برمجة تطبيقات (API). لا توجد واجهة ويب لتحميل ملف صوتي والحصول على نص مفرغ. يجب على المستخدمين غير التقنيين الذين يرغبون في تفريغ تسجيلات البودكاست أو صوت الاجتماعات دون كتابة تعليمات برمجية البحث في مكان آخر: تقدم كل من Otter.ai و Rev و Descript مسارات عمل للتفريغ الصوتي قائمة على واجهة المستخدم (UI). تم تصميم Deepgram للمطورين الذين يدمجون الصوت في التطبيقات.
الضبط الدقيق للنموذج المخصص ليس خدمة ذاتية. إذا كان 100 مصطلح رئيسي لكل طلب غير كافٍ وكنت بحاجة إلى تدريب نموذج خاص بمجال معين على بياناتك الصوتية الخاصة، فإن ذلك يتطلب عقد Enterprise. يجب على الفرق التي تبني لأكثر من 100 لغة التحقق من Universal-2 من AssemblyAI بدلاً من ذلك. الفرق التي يتمثل مطلبها الأساسي في عمق الذكاء الصوتي، وتحديداً الاستعلامات الحوارية حول النصوص المفرغة، أو اكتشاف المواضيع، أو استخراج الكيانات، ستجد أن LeMUR و Slam-1 من AssemblyAI أكثر قدرة بكثير.
تجاوز Deepgram إذا كنت بحاجة إلى مسار بتكلفة بنية تحتية صفرية ولديك القدرة الهندسية للاستضافة الذاتية. أوزان Whisper مجانية، وتشغيل الاستدلال (inference) على أجهزتك الخاصة يلغي الرسوم لكل دقيقة تماماً، على حساب أعباء DevOps وتعقيد بناء دعم البث في الوقت الفعلي من الصفر.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Deepgram.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)
