تخطَّ إلى المحتوى الرئيسي
Vantaige
Whisper screenshot
Whisper logo

Whisper

مجاني

OpenAI Whisper هو نموذج مجاني للتعرف على الكلام مرخص بموجب MIT، يقوم بتفريغ الصوتيات في 99 لغة. يستخدمه المطورون في مسارات عمل البودكاست، وملاحظات الاجتماعات، وترجمات الفيديو. يمكن استضافته ذاتياً بتكلفة صفرية؛ ومتاح أيضاً عبر واجهة برمجة تطبيقات OpenAI (API) بسعر $0.006 لكل دقيقة.

الميزات:APIOpen Source

Whisper هو نظام مفتوح المصدر للتعرف التلقائي على الكلام (ASR) تم بناؤه وإصداره بواسطة OpenAI في سبتمبر 2022. تم تدريبه على 680,000 ساعة من الصوتيات متعددة اللغات المجمعة من الإنترنت، ويغطي 99 لغة ويتعامل مع مجموعة واسعة من اللهجات، وظروف التسجيل، والمفردات المتخصصة. تم نشر أوزان النموذج وكود الاستدلال على GitHub بموجب ترخيص MIT، مما يعني أنه يمكن لأي شخص تنزيل Whisper وتعديله واستخدامه دون دفع رسوم ترخيص. توفر OpenAI أيضاً Whisper من خلال واجهة برمجة التطبيقات (API) الخاصة بها للفرق التي ترغب في استدلال مستضاف دون إدارة البنية التحتية لوحدات معالجة الرسومات (GPU) الخاصة بها.

اعتباراً من أبريل 2026، إصدار الإنتاج الموصى به هو Whisper large-v3-turbo، الذي تم إصداره في أكتوبر 2024، والذي يعمل بشكل أسرع بثماني مرات تقريباً من large-v3 بدقة شبه متطابقة في اللغات ذات الموارد العالية. وسعت مشاريع المجتمع من إمكانيات Whisper: حيث يقوم faster-whisper بإعادة حزم النموذج باستخدام CTranslate2 للحصول على مكاسب إضافية في السرعة؛ ويضيف WhisperX طوابع زمنية على مستوى الكلمة وتحديد المتحدثين (diarization)؛ أما distil-whisper فهو متغير مقطر تم تدريبه بواسطة Hugging Face وهو أسرع بست مرات مع معلمات أقل بنسبة 49%. يستخدم المطورون Whisper في إنتاج البودكاست، وتفريغ الاجتماعات، وكتابة التسميات التوضيحية للفيديو، وبناء مسارات بيانات الصوت، وأدوات إمكانية الوصول.

ما يقدمه Whisper في أبريل 2026

يُخرج Whisper تفريغات نصية عادية مع طوابع زمنية اختيارية، متوفرة كنص عادي، أو SRT، أو VTT، أو TSV، أو JSON. تمتد عائلة النموذج إلى خمسة أحجام أصلية: tiny (39M معلمة)، و base، و small، و medium، و large (1.5B معلمة). الأوزان الحالية الموصى بها للإنتاج هي large-v3-turbo، وهو متغير مقطر من large-v3 مُحسّن للإنتاجية دون الحاجة إلى البصمة الكاملة للذاكرة الخاصة بالنموذج الأصلي.

تعتمد المعالجة على التجزئة: يحلل Whisper الصوت في مقاطع مدتها 30 ثانية. توفر هذه البنية دقة عالية في الصوت المسجل ولكنها تعني أن النموذج لا يمكنه بث التفريغات في الوقت الفعلي. بالنسبة لمسارات العمل المجمعة مثل المعالجة اللاحقة للمقابلات، أو المحاضرات، أو المكالمات المسجلة، لا يمثل هذا قيداً. أما بالنسبة للتسميات التوضيحية المباشرة أو الوكلاء الصوتيين الذين يحتاجون إلى استجابات في أجزاء من الثانية، فهذا يمثل عائقاً كبيراً.

يمتد دعم اللغات ليشمل 99 لغة. الجودة عبر هذه اللغات ليست موحدة. تقدم اللغات الإنجليزية، والإسبانية، والفرنسية، والألمانية، واليابانية، والبرتغالية أداءً يقارب المستوى البشري في الصوتيات الواضحة. تنخفض التغطية بشكل كبير بالنسبة للغات ذات الموارد الأقل. أبلغ المستخدمون الذين يقومون بتفريغ لغة اليوروبا، أو اللهجات البنجابية الإقليمية، أو الكريولية الهايتية عن معدلات خطأ تتطلب تصحيحاً يدوياً كبيراً. تقوم ميزة الترجمة بتحويل الصوت من أي لغة مدعومة مباشرة إلى نص باللغة الإنجليزية، وهو أمر مفيد لفهرسة المحتوى متعدد اللغات.

تزامن إصدار large-v3-turbo في أكتوبر 2024 مع دورة إخبارية منفصلة: وثق تحقيق أجرته وكالة أسوشيتد برس (Associated Press) نُشر في نفس الشهر أن Whisper يهلوس النصوص بشكل منهجي في سياقات التفريغ الطبي، حيث يولد جملاً تبدو منطقية أثناء مقاطع الصوت الصامتة أو الضوضاء المحيطة. تضمنت وثائق OpenAI الخاصة بالفعل تحذيراً بأن النموذج "قد يولد نصاً لم يتم التحدث به"، لكن تقرير وكالة أسوشيتد برس لفت الانتباه إلى هذا الأمر على نطاق أوسع وأثار تساؤلات حول عمليات النشر الإنتاجية في إعدادات الرعاية الصحية والقانونية. سلوك الهلوسة هذا هو سلوك بنيوي، ولا يعتمد على حجم النموذج، ويستمر عبر جميع متغيرات Whisper بما في ذلك turbo.

"قمت بتشغيل Whisper على مقاطع صوتية صامتة للاختبار وقام بتوليد نص حشو يبدو منطقياً. ليس مجرد ضوضاء، بل جمل متماسكة لم يتم التحدث بها أبداً. هذا نمط فشل معروف وهو أمر مقلق للاستخدام الطبي." - u/quietcompute، r/MachineLearning، يناير 2025

موقع Whisper مقارنة بـ AssemblyAI Universal-3 و Deepgram Nova-3

المقارنة الصادقة هنا هي بين المفتوح والمغلق، وبين المعالجة المجمعة والوقت الفعلي. Whisper هو الخيار الوحيد في هذه المقارنة الذي يمكنك تشغيله دون اتصال بالإنترنت، وضبطه بدقة، وفحصه بالكامل. بينما AssemblyAI و Deepgram عبارة عن واجهات برمجة تطبيقات تجارية مغلقة.

AssemblyAI Universal-3 (تم إصداره في مارس 2024) هو نموذج تشفير وفك تشفير (encoder-decoder) مملوك تم تدريبه على مجموعات بيانات صوتية مرخصة، والتي تدعي AssemblyAI أنها أنظف من مجموعة تدريب Whisper المجمعة من الإنترنت. الفرق العملي: يدعم Universal-3 تفريغ البث في الوقت الفعلي عبر WebSocket بزمن انتقال من طرف إلى طرف يقل عن 300ms، وهو ما لا يمكن لبنية Whisper مجاراته. يتضمن Universal-3 أيضاً ميزة تحديد المتحدثين (diarization) المدمجة، مما يلغي الحاجة إلى تجميع مسار عمل منفصل. في اللغة الإنجليزية الحوارية، تدعم المعايير المستقلة بشكل عام ادعاء AssemblyAI بمعدل خطأ في الكلمات أقل من Whisper large-v3. تبدأ الأسعار بفئة مجانية (خمس ساعات شهرياً) ثم تنتقل إلى $0.37 في الساعة. يتفوق Whisper في اتساع اللغات (99 مقابل عدد أقل)، وتكلفة الاستضافة الذاتية الصفرية، وشفافية الكود، وعدم الاعتماد على الموردين.

Deepgram Nova-3 (تم إصداره في يناير 2025) يستخدم بنية بث غير انحدارية (non-autoregressive)، وهي معاكسة معمارياً لتصميم التشفير وفك التشفير الانحداري (autoregressive) الخاص بـ Whisper. يسمح هذا لـ Nova-3 بتقديم تفريغ البث بزمن انتقال يقل عن 200ms ودرجات ثقة على مستوى الكلمة في الوقت الفعلي، مما يجعله الخيار المعياري لنشر الوكلاء الصوتيين والتسميات التوضيحية المباشرة. يغطي Nova-3 بشكل أصلي 36 لغة، وهو عدد أقل من Whisper ولكن مع اتساق أعلى عبر تلك اللغات. يبلغ سعر واجهة برمجة التطبيقات (API) $0.0043 لكل دقيقة، وهو أرخص من واجهة برمجة تطبيقات Whisper من OpenAI البالغة $0.006 لكل دقيقة. يتفوق Whisper مرة أخرى في الانفتاح، والاستضافة الذاتية، والنطاق الكامل المكون من 99 لغة.

عادة ما يتلخص الخيار العملي في سؤال واحد: هل تحتاج إلى مخرجات في الوقت الفعلي؟ إذا كانت الإجابة نعم، فإن Whisper غير قابل للتطبيق بدون حلول بديلة معقدة للتجزئة والتي لا تزال تُحدث تأخيراً. إذا كنت تعالج الصوت المسجل على دفعات، فإن Whisper (المستضاف ذاتياً) يوفر دقة تنافسية أو أفضل بتكلفة صفرية لكل دقيقة على نطاق واسع.

"إن whisper-large-v3-turbo مثير للإعجاب حقاً. أقوم بتفريغ تسجيلات مقابلات مدتها 4 ساعات ومعدل الخطأ في الكلمات (WER) يمكن مقارنته بما كنت أدفعه لـ Rev.com مقابل $0.25/دقيقة. التحسن في السرعة مقارنة بـ v3 هائل." - u/mlpraktiker، r/MachineLearning، نوفمبر 2024

واقع الترخيص وحقوق النشر

يعد ترخيص MIT الخاص بـ Whisper أحد أكثر التراخيص تساهلاً في مجال الذكاء الاصطناعي: يمكنك استخدامه تجارياً، وإعادة توزيعه، وتعديله، وبناء منتجات فوقه دون دفع إتاوات أو الحصول على أذونات إضافية. يغطي الترخيص أوزان النموذج وكود الاستدلال. لا يوجد شرط "الاستخدام التجاري يتطلب اتفاقية مؤسسية" الذي تتضمنه بعض النماذج المفتوحة.

مسار الاستضافة الذاتية مجاني تماماً. يمكنك تنزيل الأوزان من Hugging Face Hub، وتثبيت حزمة Python، وتشغيل التفريغ محلياً. تكاليف البنية التحتية لوحدة معالجة الرسومات (GPU) تقع على عاتقك، وليس على عاتق OpenAI. المطور الذي يقوم بتشغيل large-v3-turbo على وحدة معالجة رسومات A10G مستأجرة من خلال مزود سحابي يدفع سعر وحدة معالجة الرسومات، وليس رسوماً لكل تفريغ. على نطاق واسع، تكون الجوانب الاقتصادية مقنعة: دار إنتاج بودكاست تعالج 1,000 ساعة شهرياً ستدفع حوالي $360 بأسعار واجهة برمجة تطبيقات OpenAI، أو جزءاً بسيطاً من ذلك في حوسبة وحدة معالجة الرسومات عند تشغيل faster-whisper محلياً.

يفرض مسار واجهة برمجة تطبيقات OpenAI رسوماً قدرها $0.006 لكل دقيقة من الصوت المعالج. هذا هو معدل الدفع حسب الاستخدام القياسي دون الحاجة إلى اشتراك. تستخدم الفرق التي تريد بنية تحتية مُدارة دون امتلاك أجهزة GPU هذا المسار. لا يوجد اشتراك شهري أو تسعير للمقاعد. تقبل نقطة نهاية واجهة برمجة التطبيقات (`api.openai.com/v1/audio/transcriptions`) ملفات صوتية تصل إلى 25MB وتعيد التفريغ بالتنسيق المطلوب.

تفرعات المجتمع (Community forks) مثل faster-whisper و distil-whisper مرخصة أيضاً بموجب MIT. يستخدم WhisperX أداة pyannote.audio لتحديد المتحدثين، ولدى pyannote نموذج وصول خاص بها على Hugging Face يتطلب تقييد الحساب قبل تنزيل نماذج معينة. وقد تسبب هذا في احتكاك للفرق التي تحاول أتمتة إعداد مسار العمل الخاص بها، نظراً لأن التقييد يتطلب خطوة طلب رمز مميز (token) يدوية.

أين يقصر Whisper بشكل ملحوظ

الهلوسة في الصمت والصوت منخفض الإشارة. هذا هو أخطر قيد موثق. يولد Whisper نصاً يبدو واثقاً أثناء المقاطع التي لا تحتوي على كلام، أو الضوضاء المحيطة، أو الصوت غير المسموع. تقلل المعلمات `no_speech_threshold` و `logprob_threshold` من هذا السلوك ولكنها لا تقضي عليه. بالنسبة لمتطلبات الدقة الحرفية (الطبية، والقانونية، والمحاضر الرسمية)، يحتاج كل مقطع ناتج إلى التحقق من صحته. هذا ليس مصدر قلق نظري: وثق تحقيق وكالة أسوشيتد برس في أكتوبر 2024 حوادث محددة حيث أدرج Whisper كلمات لم يتم التحدث بها أبداً في مخرجات التفريغ الطبي.

لا يوجد بث مدمج. بنية التجزئة لمدة 30 ثانية في Whisper هي خاصية ثابتة لكيفية تدريب النموذج. لا يمكنه إنتاج تفريغات جزئية عند وصول الصوت. تتضمن الحلول البديلة للمجتمع اكتشاف النشاط الصوتي (VAD) لتقسيم الصوت إلى أجزاء على مستوى الجملة، ولكن هذه الحلول تضيف تأخيراً وتعقيداً. بالنسبة للوكلاء الصوتيين، أو التسميات التوضيحية للاجتماعات المباشرة، أو أي حالة استخدام يجب أن تظهر فيها المخرجات في غضون 500ms من الكلام، يتطلب Whisper هندسة كبيرة حول قيوده الأساسية.

تحديد المتحدثين يتطلب تجميعاً من جهة خارجية. مخرجات Whisper عبارة عن تفريغ مسطح بدون تسميات للمتحدثين. تتطلب إضافة تحديد المتحدثين استخدام WhisperX بالإضافة إلى pyannote.audio، وهو ما يتضمن تثبيتاً منفصلاً، وحساب Hugging Face مع وصول مقيد للنموذج، وذاكرة GPU إضافية. تجد الفرق القادمة من واجهات برمجة التطبيقات التجارية التي تتضمن تحديد المتحدثين كمفتاح تبديل واحد أن عمل التكامل هذا كبير.

متطلبات وحدة معالجة الرسومات (GPU) لـ large-v3. يتطلب تشغيل large-v3 بسرعة مفيدة ما لا يقل عن 10GB من VRAM في fp16. تواجه وحدات معالجة الرسومات الاستهلاكية مثل RTX 3060 (12GB) أخطاء نفاد الذاكرة مع الإعدادات الافتراضية. أدى large-v3-turbo إلى تحسين هذا بشكل كبير، لكن المطورين الذين يريدون أقصى دقة على large-v3 لا يزالون بحاجة إلى أجهزة قوية. تعمل النماذج الصغيرة والمتوسطة بشكل مقبول على وحدة المعالجة المركزية (CPU) ولكنها تنتج مخرجات أسوأ بشكل ملحوظ في الصوتيات الصعبة.

تباين جودة اللغة. يدعم Whisper 99 لغة، لكن توزيع الجودة متفاوت. يقدم النموذج أداءً يقارب المستوى البشري في اللغة الإنجليزية واللغات الأوروبية الرئيسية؛ الأداء في اللغات ذات الموارد الأقل غير متسق بدرجة كافية لدرجة أن المستخدمين الذين يعالجون لغة اليوروبا، أو اللهجات العربية الإقليمية، أو اللغات الآسيوية الأقل شيوعاً يصفون المخرجات بشكل متكرر بأنها تتطلب مراجعة يدوية كاملة.

لمن تم تصميم Whisper

تم تصميم Whisper خصيصاً للمطورين. لا توجد واجهة مستخدم ويب رسمية، ولا واجهة سحب وإفلات، ولا لوحة تحكم مُدارة من OpenAI. يتطلب البدء استخدام Python، و pip، وإما وحدة معالجة رسومات (GPU) تدعم CUDA أو الصبر لتشغيل نماذج أصغر على وحدة المعالجة المركزية (CPU). إذا كان هذا يصف إعدادك، فإن Whisper هو أحد أكثر الأدوات المجانية قدرة والمتاحة للتفريغ على أي نطاق.

أقوى حالة استخدام هي المعالجة المجمعة الحساسة للتكلفة: إنتاج البودكاست، وإنشاء ترجمات الفيديو، وأرشفة المحاضرات المسجلة، وتفريغ صوت المقابلات للبحث، ومعالجة تسجيلات مركز الاتصال. عند 1,000 ساعة من الصوت شهرياً، فإن إعداد faster-whisper المستضاف ذاتياً يكلف حوسبة وحدة معالجة الرسومات فقط. نفس الحجم من خلال واجهة برمجة تطبيقات تجارية يكلف $360 أو أكثر. الجوانب الاقتصادية لا تقبل المنافسة.

يناسب Whisper أيضاً عمليات النشر دون اتصال بالإنترنت والمعزولة عن الشبكات (air-gapped). يمكن لفرق تكنولوجيا المعلومات في مجال الرعاية الصحية، والمقاولين الحكوميين، والشركات القانونية التي لا يمكنها إرسال الصوت إلى واجهات برمجة التطبيقات الخارجية تشغيل Whisper بالكامل داخل بنيتها التحتية الخاصة دون أن تغادر أي بيانات بيئتها. يعني ترخيص MIT أن هذا الاستخدام مسموح به دون قيود.

تجاوز Whisper عندما: تحتاج إلى تفريغ مباشر بزمن انتقال يقل عن 500ms للوكلاء الصوتيين أو التطبيقات التفاعلية؛ عندما يكون المستخدمون غير تقنيين ويحتاجون إلى واجهة ويب؛ عندما تعالج صوتاً طبياً أو قانونياً حيث يكون خطر الهلوسة غير مقبول بدون طبقة تحقق مخصصة؛ أو عندما تحتاج إلى تحديد المتحدثين على مستوى الإنتاج جاهزاً للاستخدام. في هذه الحالات، يحل AssemblyAI Universal-3 أو Deepgram Nova-3 فجوات الوقت الفعلي وتحديد المتحدثين، على حساب الاعتماد على الموردين والتسعير بالدقيقة.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن Whisper.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Whisper.