تخطَّ إلى المحتوى الرئيسي
Vantaige
AssemblyAI screenshot
AssemblyAI logo

AssemblyAI

مجاني جزئيًا

AssemblyAI هي واجهة برمجة تطبيقات (API) لتحويل الكلام إلى نص والذكاء الصوتي مصممة للمطورين. تقوم بنسخ الصوت باستخدام نماذج Universal-2 و Universal-3 Pro، وتضيف ميزة فصل المتحدثين، وتحليل المشاعر، والملخصات المدعومة بالنماذج اللغوية الكبيرة (LLM) عبر LeMUR، بأسعار تبدأ من $0.15 لكل ساعة صوتية.

الميزات:API

AssemblyAI هي واجهة برمجة تطبيقات (API) سحابية لتحويل الكلام إلى نص طورتها شركة AssemblyAI, Inc.، التي تأسست في سان فرانسيسكو عام 2017. تستهدف المنصة مطوري البرمجيات الذين يحتاجون إلى إضافة معالجة الصوت إلى تطبيقاتهم دون الحاجة إلى إدارة البنية التحتية لوحدات معالجة الرسومات (GPU)، أو تحديثات النماذج، أو توسيع نطاق مسارات العمل. تعالج المنصة أكثر من 40 تيرابايت من الصوت يوميًا وتتعامل مع 840 مليون طلب API شهريًا، مما يجعلها واحدة من أكثر خدمات النسخ الصوتي المدارة استخدامًا. على عكس أدوات النسخ الصوتي الموجهة للمستهلكين، لا تحتوي AssemblyAI على واجهة مستخدم تعتمد على النقر: بل تقوم بإرسال الصوت، لتعيد لك واجهة برمجة التطبيقات نصًا مهيكلًا وبيانات وصفية.

تتراوح تشكيلة النماذج الحالية من Universal-2 ($0.15/hr) لأعباء العمل المجمعة الحساسة للتكلفة، وصولاً إلى Universal-3 Pro ($0.21/hr) للحصول على أعلى دقة في النسخ الصوتي المسجل مسبقًا، و Universal-3 Pro Streaming ($0.45/hr) لتطبيقات الوكلاء الصوتيين في الوقت الفعلي. وعلاوة على النسخ الصوتي الأساسي، تقدم المنصة ميزات فصل المتحدثين، وتحليل المشاعر، واكتشاف الكيانات، وتنقيح معلومات التعريف الشخصية (PII)، والإشراف على المحتوى، والفصول التلقائية (Auto-Chapters). يطبق إطار عمل LeMUR، الذي تم إطلاقه في يوليو 2023، نماذج Claude أو GPT-4 على النصوص المنسوخة في طلب API واحد، حيث يعالج ما يصل إلى 10 ساعات من الصوت (حوالي 150 ألف رمز) للتلخيص، والأسئلة والأجوبة، والتدريب بالذكاء الاصطناعي دون أن يضطر المطورون إلى بناء مسارات النماذج اللغوية الكبيرة (LLM) الخاصة بهم.

ما الذي تقدمه AssemblyAI فعليًا في أبريل 2026

تضم حزمة نماذج AssemblyAI الآن خمسة خيارات متميزة بناءً على ما إذا كان عبء العمل مسجلًا مسبقًا أو في الوقت الفعلي. يُعد Universal-3 Pro النموذج الرائد للمعالجة المجمعة، بمعدل خطأ في الكلمات (WER) يبلغ 5.93% ودعم لـ 99 لغة بما في ذلك التبديل التلقائي بين اللغات. أما Universal-2، وهو إصدار أكتوبر 2024 الذي حل محل Universal-1، فيوفر دقة كلمات تبلغ 93.32% مع مكاسب ملحوظة في الأسماء الخاصة (أفضل بنسبة 24% من Universal-1)، والأرقام والحروف (أفضل بنسبة 21%)، وتنسيق النص (أفضل بنسبة 15%). هذه هي الأرقام التي تهم في الاستخدام الفعلي للإنتاج: تفشل برامج مراكز الاتصال عندما تكون أرقام الهواتف ورموز التأمين خاطئة، وليس عندما ينحرف معدل الخطأ في الكلمات (WER) بنسبة 0.5% عن مجموعة بيانات قياسية.

بالنسبة لأعباء العمل في الوقت الفعلي، يستخدم Universal-Streaming و Universal-3 Pro Streaming اتصالات WebSocket بزمن انتقال من طرف إلى طرف يقل عن 200 مللي ثانية. قرار هندسي رئيسي: يوفر البث في AssemblyAI نصوصًا غير قابلة للتغيير، مما يعني أنه بمجرد إرجاع الكلمة لا يتم تعديلها. غالبًا ما ترسل واجهات برمجة تطبيقات البث المنافسة "أجزاء" يتم تصحيحها مع تراكم السياق، مما يخلق مشاكل في إدارة الحالة لتطبيقات الوكلاء الصوتيين. يتيح النهج غير القابل للتغيير للوكلاء معالجة الكلام المنسوخ والتصرف بناءً عليه بينما يستمر المستخدم في التحدث.

تستند حزمة الذكاء إلى النسخ الصوتي. يغلف LeMUR مسار عمل يجمع بين التقسيم الذكي، وقاعدة بيانات متجهة، والتوجيه المتسلسل للأفكار (chain-of-thought prompting)، مما يتيح لطلب API واحد تشغيل الأسئلة والأجوبة أو إنشاء ملخصات عبر ساعات من الصوت. يفصل نظام فصل المتحدثين بين المتحدثين المتعددين في الملف. إضافة Medical Mode متوافقة مع قانون HIPAA ومحسنة للمفردات السريرية. يغطي تنقيح معلومات التعريف الشخصية (PII) 15 نوعًا من البيانات الحساسة عبر أكثر من 50 لغة.

"يعمل LeMUR بشكل مذهل فور استخدامه. لقد سمح لنا بالتركيز على المنتج بدلاً من البنية التحتية." -- ألكسندر كفامي، المؤسس المشارك والرئيس التنفيذي في Pathlight، يوليو 2023

موقع AssemblyAI مقارنة بـ Deepgram و OpenAI Whisper

المنافسان الرئيسيان هما Deepgram (واجهة برمجة تطبيقات مدارة مشابهة) و OpenAI Whisper (مفتوح المصدر، ذاتي الاستضافة). يختلفان في نموذج التكلفة، وعمق الميزات، والتعقيد التشغيلي بطرق تؤثر على قرار الشراء.

AssemblyAI مقابل Deepgram Nova-3: كلاهما واجهات برمجة تطبيقات مدارة تستهدف المطورين. أرقام الدقة متقاربة ولكنها محل جدل. تضع معايير AssemblyAI الخاصة نموذج Universal-3 Pro عند 5.93% WER مقابل Deepgram Nova-3 عند 7.9%؛ بينما تدعي معايير Deepgram العكس. ما هو أوضح هو زمن الانتقال: في معايير إطلاق Universal-Streaming في يونيو 2025، أبلغت AssemblyAI عن متوسط زمن انتقال يبلغ 307 مللي ثانية مقابل 516 مللي ثانية لـ Deepgram Nova-3، ومخرجات ضوضاء خاطئة أقل بنسبة 73%. نموذج التسعير هو فارق حقيقي: تتطلب Deepgram عادةً التزامات تعاقدية وحدودًا دنيا للإنفاق لحسابات الإنتاج، بينما تعتمد AssemblyAI بالكامل على الدفع حسب الاستخدام دون أي حدود دنيا. بالنسبة للذكاء الصوتي، الفجوة أوسع: يوفر LeMUR من AssemblyAI مسار عمل LLM مدمجًا فوق النصوص المنسوخة؛ بينما تتطلب Deepgram من المطورين بناء مساراتهم الخاصة. يتوفر النسخ الصوتي القابل للتوجيه (تعليمات سياق اللغة الطبيعية التي تعمل على تحسين الدقة للصوت الخاص بمجال معين) في AssemblyAI؛ بينما لا تقدم Deepgram هذه الميزة اعتبارًا من عام 2026.

AssemblyAI مقابل OpenAI Whisper: Whisper هو نموذج محول (transformer) مفتوح المصدر للتشفير وفك التشفير أصدرته OpenAI بموجب ترخيص MIT. القيمة الأساسية المقترحة هي التكلفة: الاستضافة الذاتية لـ Whisper على وحدة معالجة الرسومات (GPU) الخاصة بك تكلف صفرًا لكل ساعة صوتية بعد تكلفة البنية التحتية. تفرض واجهة برمجة تطبيقات Whisper المستضافة من OpenAI رسومًا تبلغ $0.36/hr. تفرض AssemblyAI رسومًا تبلغ $0.15/hr لـ Universal-2 أو $0.21/hr لـ Universal-3 Pro، وهي أرخص من Whisper المستضاف ولكنها ليست أرخص من المستضاف ذاتيًا. الفجوة المعمارية مهمة للميزات: لا يحتوي Whisper وحده على ميزة فصل المتحدثين، ولا البث المباشر، ولا تنقيح PII، ولا ميزات الذكاء الصوتي، ومعدلات الهلوسة أعلى بنسبة 30% تقريبًا من نماذج Universal في الصوت الإنتاجي (وفقًا لمعايير AssemblyAI). حالات الاستخدام في الوقت الفعلي لا تُخدم بشكل جيد بواسطة Whisper، الذي يعالج الصوت في أجزاء بدلاً من البث الحقيقي. السؤال العملي هو التكلفة الهندسية: تتطلب الاستضافة الذاتية لـ Whisper إدارة وحدات معالجة الرسومات، وأنظمة قائمة الانتظار، وتحديثات النماذج المستمرة. عادةً ما تدفع الفرق التي ترغب في إطلاق ميزة صوتية في دورة تطوير قصيرة (sprint) بدلاً من ربع سنة السعر بالساعة لـ AssemblyAI. غالبًا ما تجد الفرق التي تعالج ملايين الساعات شهريًا أن Whisper المستضاف ذاتيًا أرخص بمجرد إطفاء تكلفة البنية التحتية.

"النسخ الصوتي وفصل المتحدثين لديهم في مستوى آخر. نادرًا ما أحتاج إلى تعديل النصوص، وهو أمر نادر مع هذا النوع من الأدوات." -- مراجع على G2، 2025

كيف يبدو واقع سير عمل واجهة برمجة التطبيقات (API)

بالنسبة للنسخ الصوتي غير المتزامن (المسجل مسبقًا)، يتكون سير العمل من ثلاث خطوات: تحميل الصوت إلى AssemblyAI أو تمرير عنوان URL، والاستعلام عن معرف النص المنسوخ، واسترداد استجابة JSON المهيكلة التي تحتوي على النص، والطوابع الزمنية على مستوى الكلمة، وتسميات المتحدثين، وأي مخرجات ذكاء. تتوفر حزم تطوير البرمجيات (SDKs) لـ Python و Node.js و Go و Java و Ruby. الوثائق شاملة مع بيئات اختبار تفاعلية، ولهذا السبب حصلت AssemblyAI على شارة "قائد" (Leader) من G2 في تقرير شبكة التعرف على الصوت لخريف 2025.

بالنسبة للبث في الوقت الفعلي، يفتح المطورون اتصال WebSocket ويبثون أجزاء الصوت. تُرجع واجهة برمجة التطبيقات رموز النص النهائية فور وصولها. أضاف تحديث المنتج في أكتوبر 2025 ميزة "الرجوع الذكي للنموذج" (Intelligent Model Fallback)، مما يتيح للمطورين تحديد نماذج متعددة بترتيب الأولوية: تستخدم واجهة برمجة التطبيقات النموذج الأعلى دقة الذي يدعم اللغة المكتشفة، مع التراجع تلقائيًا عند الحاجة. هذا مهم للمنتجات متعددة اللغات حيث قد يتبدل ملف صوتي واحد بين اللغات في منتصف المحادثة.

حادثة محددة تستحق الذكر: عندما أطلقت AssemblyAI نموذج Universal-2 في أواخر أكتوبر 2024، خفضت في الوقت نفسه السعر الأساسي للنسخ الصوتي بنسبة 43%، من $0.37/hr إلى $0.15/hr للنموذج الجديد. ركز منشور المدونة الصادر في 31 أكتوبر 2024 بعنوان "ما وراء معدل خطأ الكلمات: Universal-2 يقدم الدقة حيثما يهم الأمر" على فئات الدقة الحاسمة للإنتاج بدلاً من معدل الخطأ الإجمالي (WER)، وهو ما كان تحولاً ملحوظاً في التموضع: كانت الرسالة هي أن الحصول على الأسماء الخاصة وأرقام الهواتف بشكل صحيح يهم مركز الاتصال أكثر من تحسن بنصف نقطة مئوية في معدل الخطأ الإجمالي. لاقى هذا التوجه صدى لدى عملاء المؤسسات في Calabrio و Siro، حيث أبلغ كلاهما عن نتائج أعمال مهمة بعد نشر Universal-2.

لمن تم بناء AssemblyAI

التوافق الأوضح هو مع فرق المطورين الذين يبنون ميزات صوتية في منتجات البرمجيات كخدمة (SaaS): ذكاء محادثات مراكز الاتصال، ومنصات البودكاست، والتوثيق الطبي، وتلخيص الاجتماعات، وبشكل متزايد تطبيقات الوكلاء الصوتيين باستخدام أطر عمل مثل LiveKit و Pipecat. طبقة LeMUR قيّمة بشكل خاص للفرق التي ترغب في تخطي بناء مسارات تحويل النص إلى LLM الخاصة بها. يغطي الامتثال لـ SOC2 Type II و HIPAA حالات الاستخدام في الرعاية الصحية والخدمات المالية حيث تتطلب متطلبات التعامل مع البيانات بنية تحتية مخصصة كبيرة.

تحصل الشركات الناشئة على أرصدة مجانية بقيمة $50 لإنشاء نماذج أولية دون الحاجة إلى بطاقة ائتمان. يتوسع نموذج الدفع حسب الاستخدام دون التزامات بحد أدنى، وهو أمر مهم للفرق في المراحل المبكرة غير المتأكدة من حجم الاستخدام. يحصل عملاء المؤسسات على أسعار مخصصة، وحدود تزامن أعلى، واتفاقيات مستوى خدمة (SLAs) مخصصة بمجرد أن يبرر الاستخدام التواصل مع فريق المبيعات.

قدم تحديث أكتوبر 2025 أيضًا بوابة LLM Gateway التي تدمج تحويل الكلام إلى نص، وفهم الكلام، واستدلال LLM في منصة واحدة مع فوترة موحدة، مستهدفة الفرق التي ترغب في تقليل عدد موردي واجهات برمجة التطبيقات وتبسيط مسارات البيانات.

ما لا تقدمه AssemblyAI

AssemblyAI ليس منتجًا استهلاكيًا. لا توجد واجهة ويب حيث يمكن للمستخدم غير التقني تحميل ملف صوتي وتنزيل نص منسوخ. حالة الاستخدام هذه تنتمي إلى أدوات مثل Otter.ai أو Rev أو Descript. أي شخص يصف نفسه بأنه "ليس مطورًا" يجب أن يبحث في مكان آخر.

إنه ليس الخيار الأرخص على نطاق واسع. عند معالجة أكثر من 100,000 ساعة من الصوت شهريًا، تصبح الاستضافة الذاتية لـ Whisper على أجهزة GPU مخصصة عادةً أرخص من الدفع بالساعة. يجب على الفرق التي تعمل بهذا الحجم حساب التكاليف: يمكن أن تتجاوز التكلفة الهندسية لصيانة البنية التحتية بسهولة وفورات تكلفة واجهة برمجة التطبيقات، ولكن يمكن أن تسير الأمور في الاتجاه المعاكس بمجرد وجود فريق منصة في مكانه.

إنه ليس منصة ذكاء متعددة اللغات كاملة الميزات بعد. النسخ الصوتي بـ 99 لغة حقيقي، ولكن LeMUR، و Auto-Chapters، وتحليل المشاعر، واكتشاف الكيانات، ومعظم ميزات الذكاء تهيمن عليها اللغة الإنجليزية. بناء ذكاء اصطناعي لمركز اتصال باللغة الإسبانية أو البرتغالية يصطدم بهذه الفجوات بسرعة.

إنه ليس منصة للضبط الدقيق (fine-tuning). يمكن للفرق التي تمتلك مفردات خاصة بمجال معين (مصطلحات طبية نادرة، أسماء منتجات مسجلة، مصطلحات صناعية) استخدام Keyterms Prompting لتحسين التعرف، ولكن لا يوجد تدريب مخصص للنماذج. تقدم Deepgram محركات مضبوطة لمجالات معينة؛ بينما تعتمد AssemblyAI على القدرات الجاهزة لنموذج Universal الخاص بها.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ AssemblyAI.