
طورت Hume AI واجهة EVI، وهي واجهة صوتية تعاطفية تقرأ المشاعر من صوت المتصل وتستجيب بنبرة وإيقاع متطابقين. أسسها Alan Cowen، الباحث السابق في مجال المشاعر في Google، وهي تقنية الذكاء الاصطناعي الصوتي التجارية الوحيدة التي تتمتع بذكاء عاطفي ثنائي الاتجاه مدمج في بنيتها الأساسية.
شركة Hume AI هي شركة أبحاث في مجال الذكاء الاصطناعي تأسست في مارس 2021 على يد Alan Cowen، وهو عالم إدراكي أمضى سنوات في قيادة أبحاث الحوسبة العاطفية في Google AI قبل إكمال درجة الدكتوراه في علم النفس في UC Berkeley. سُميت الشركة تيمناً بالفيلسوف David Hume، الذي تتجلى حجته بأن المشاعر تحرك الخيارات البشرية في كل قرار يتعلق بالمنتج. في مارس 2024، جمعت Hume تمويلاً بقيمة $50M في جولة من الفئة B بقيادة EQT Ventures، وأصدرت في الوقت نفسه منتجها الرائد، الواجهة الصوتية التعاطفية (EVI)، للجمهور عبر واجهة برمجة التطبيقات (API). المشكلة الأساسية التي تحلها Hume هي مشكلة تتجاهلها كل تقنيات الذكاء الاصطناعي الصوتي الأخرى: المتصل الذي يبدو محبطاً أو خائفاً أو حزيناً يجب ألا يتلقى نفس النبرة التي يتلقاها المتصل الذي يبدو مبتهجاً، ويجب على الذكاء الاصطناعي نفسه أن يتكيف، ليس فقط من خلال توليد كلام معبر، بل قراءة الدلالات العاطفية الخفية فيما يسمعه.
نموذج EVI هو نموذج لتحويل الكلام إلى كلام يعالج الصوت مباشرة، وليس مساراً منفصلاً لتحويل الكلام إلى نص (STT) يغذي نموذج لغة كبير (LLM) يغذي محرك تحويل النص إلى كلام (TTS)، وهذا هو ما يجعله يحقق زمن انتقال استجابة أقل من 300ms مع تحليل الإشارات العروضية في صوت المتصل في نفس الوقت. يقدم الإصدار الحالي، EVI 3 (الذي تم إطلاقه في 29 مايو 2025)، استنساخاً صوتياً مخصصاً من مقطع صوتي مدته أقل من 30 ثانية، ودعماً لأكثر من 200,000 صوت مصمم مسبقاً، وتكاملاً مع Claude 4 و Gemini 2.5 و Kimi K2، ومخرجات معبرة عبر 30 أسلوباً عاطفياً وصوتياً متميزاً تتراوح من الطمأنينة الهادئة إلى الحماس العالي الطاقة. إلى جانب EVI، تقدم Hume محرك Octave لتحويل النص إلى كلام (تم إصداره في ديسمبر 2024) وواجهة برمجة تطبيقات لقياس التعبيرات (Expression Measurement API) لتحليل المحتوى العاطفي عبر الصوت والفيديو والصور. تبدأ الخطط من $3/month لفئة Starter، مع توفر فئة مجانية للتقييم.
ما يقدمه Hume EVI في مايو 2026
من الأفضل فهم EVI 3 كنموذج موحد للغة والكلام بدلاً من كونه مساراً مجمعاً. إن تدريبه المسبق على تريليونات من الرموز النصية وملايين الساعات من الكلام يعني أنه يفهم كيف تتفاعل الخصائص الصوتية مع اللغة، وليس فقط الكلمات التي قيلت. عندما ترتفع طبقة صوت المتصل أو تقصر جمله وتتقطع، يكتشف EVI تلك الإشارات ويعدل استجابته الخاصة: عن طريق الإبطاء، وتنعيم النبرة، وإضافة فترات توقف تشير إلى أنه يعالج بصدق ما قيل قبل الإجابة.
من حيث القدرات الخام: يوفر EVI 3 زمن انتقال للمحادثة يبلغ حوالي 300ms، مع تمكين الوضع الفوري افتراضياً والذي يبدأ في إرسال أجزاء صوتية في غضون 200ms تقريباً. وهو يدعم أكثر من 11 لغة، على الرغم من أن المنتج يركز بوضوح على اللغة الإنجليزية في التحسين. يلتقط الاستنساخ الصوتي من مقطع صوتي مدته أقل من 30 ثانية الجرس الصوتي واللكنة والإيقاع والنبرة والشخصية المستنتجة، مما يجعل من الممكن بناء صوت مخصص لمنتج مؤسسي دون أسابيع من التسجيل في الاستوديو. يمكن لواجهة برمجة تطبيقات قياس التعبيرات، المقدمة بشكل منفصل بأسعار الدفع حسب الاستخدام، تحليل المحتوى العاطفي من الفيديو مع الصوت ($0.0828/min)، والصوت فقط ($0.0639/min)، والصور ($0.00204/image)، مما يفتح حالات استخدام تحليلية تتجاوز مجرد توليد الصوت.
كان إطلاق EVI 3 في مايو 2025 علامة فارقة موثوقة. في الاختبارات العمياء التي نشرتها Hume جنباً إلى جنب مع الإصدار، تفوق EVI 3 على GPT-4o و Gemini و Sesame في تحديد ثمانية من أصل تسعة مشاعر تم اختبارها من نبرة الصوت وحدها. صرح Alan Cowen عند الإطلاق: "في Hume، وعدنا أنفسنا بأنه قبل نهاية عام 2025، سنحقق تجربة ذكاء اصطناعي صوتي يمكن تخصيصها بالكامل." وقد أوفى EVI 3 بهذا الوعد المحدد، حيث لم يكن إنشاء صوت مخصص دون ضبط دقيق ممكناً في إصدارات EVI السابقة.
تؤكد عمليات النشر في العالم الحقيقي الادعاءات الفنية. استخدمت Vonova، وهي منصة لدعم العملاء، وكلاء صوتيين مدعومين بـ EVI لتحقيق انخفاض بنسبة 40% في التكاليف التشغيلية مقارنة بمراكز الاتصال التقليدية، وتحسن بنسبة 20% في معدل حل الذكاء الاصطناعي دون تصعيد بشري. قامت Thumos Care، وهي منصة للرعاية الصحية الوقائية، بدمج EVI لمحادثات المرضى حيث تكون الحساسية العاطفية ذات مغزى سريري. قال رئيسهم التنفيذي Shan: "كان EVI من Hume تحويلياً. لقد سرّع من تطويرنا للميزات الذكية عاطفياً وساعد في توسيع عروض منتجاتنا." أبلغت Ream، وهي منصة للتدريب على الصحة العقلية، عن مضاعفة مستخدميها النشطين يومياً بعد التحول إلى التدريب الصوتي المدعوم بـ EVI بدلاً من التفاعلات القائمة على النص.
موقع Hume EVI مقارنة بـ ElevenLabs و Cartesia AI
تُعد ElevenLabs المقارنة الأكثر مباشرة في التموضع في السوق، لكن المنتجات تختلف ميكانيكياً. التكنولوجيا الأساسية لـ ElevenLabs هي نموذج لتحويل النص إلى كلام لا يقرأ الحالة العاطفية من صوت المستخدم بشكل أصلي. تكمن قوتها في جودة المخرجات واتساعها: أكثر من 70 لغة (مقارنة بـ 11 لغة في Hume)، ومكتبة صوتية بحجم مماثل، ودرجات طبيعية للكلام تبلغ 89.6% في المعايير المستقلة مقابل 78.5% لـ Hume. يقدم نموذج v3 من ElevenLabs سرداً نظيفاً ومتسقاً "يمكن أن يمر ككلام بشري" عبر إنشاء المحتوى، وإنتاج الكتب الصوتية، والنشر متعدد اللغات. تتوفر المشاعر في ElevenLabs من خلال علامات SSML والتوجيه، ولكنها معلمة من جانب المخرجات، فالنموذج لا يستمع إلى كيف بدوت ويتكيف. بالنسبة لوكيل دعم العملاء الذي يحتاج إلى اكتشاف متصل محبط والاستجابة بتهدئة حقيقية، لا توفر ElevenLabs آلية أصلية للقيام بذلك. بالنسبة لمنشئ البودكاست الذي يحتاج إلى سرد متعدد اللغات بـ 40 لغة، فإن ElevenLabs هي الخيار الواضح و Hume ليست الأداة المناسبة.
تعمل Cartesia AI في طبقة مختلفة تماماً. نموذج Sonic من Cartesia هو محرك بث TTS نقي يستهدف وقتاً أقل من 90ms للوصول إلى أول صوت، مقارنة بـ 200-300ms في Hume. تُعد Cartesia أرخص بنسبة 33% تقريباً لكل حرف ($0.00004 مقابل $0.00006) وتستهدف المطورين الذين يقومون بتجميع مسارات الصوت الخاصة بهم: فهم يجلبون STT، ويوجهون إلى LLM الخاص بهم، ويستخدمون Cartesia لتوليف سريع ونظيف على جانب المخرجات. لا تحتوي Cartesia على اكتشاف للمشاعر في أي من الاتجاهين. المقايضة واضحة: إذا كان زمن الانتقال وكفاءة التكلفة هما القيود وكنت على استعداد لإدارة طبقة السياق العاطفي بنفسك، فإن Cartesia تفوز. إذا كانت الاستجابة العاطفية بحاجة إلى أن تكون مدمجة في نموذج الصوت نفسه، وهو ما يهم أكثر في الصحة العقلية والرعاية الصحية وتفاعلات العملاء عالية المخاطر، فلا يمكن لـ Cartesia أن تحل محل EVI.
بالنسبة للمطورين الذين يبنون أنظمة قد يكون فيها المتصلون في حالة ضيق أو غضب أو خوف، فإن ثنائية الاتجاه هي بيت القصيد. يقرأ EVI ما يسمعه؛ بينما لا تفعل ElevenLabs و Cartesia ذلك. هذا التمييز يضيق السوق المستهدف لـ Hume ولكنه يجعلها متميزة حقاً داخل تلك المساحة الأضيق، تماماً مثل كيف تهيمن Whisper على دقة تحويل الكلام إلى نص ولكنها ليست نموذجاً للمحادثة. يُظهر إقران أدوات مثل OpenVoice للاستنساخ الصوتي المخصص أو PlayHT لتوليد الصوت مدى ازدحام المساحة المجاورة، ولكن لا تحاول أي من تلك الأدوات تحقيق ذكاء عاطفي ثنائي الاتجاه على مستوى النموذج.
"لقد أذهلتني دقة اكتشاف المشاعر. استطاعت Hume AI التمييز بين المتصلين المنزعجين والغاضبين."، مراجع، fahimai.com، 2026
واقع الترخيص وحقوق النشر
تثير قدرة الاستنساخ الصوتي في EVI 3 نفس الأسئلة التي تتبع أي منصة ذكاء اصطناعي صوتي. تطلب Hume من المستخدمين تأكيد امتلاكهم لحقوق أي صوت يقومون باستنساخه، وتحظر شروط الخدمة استنساخ الأصوات دون موافقة. من الناحية العملية، هذا حاجز حماية ذاتي الرقابة. لا تمتلك Hume طبقة منفصلة للتحقق من الصوت، لذا تقع المسؤولية على عاتق المطور أو العميل المؤسسي. تقع واجهة برمجة تطبيقات قياس التعبيرات، التي تعالج الصوت والفيديو لجهات خارجية بحثاً عن المحتوى العاطفي، في مشهد قانوني أكثر تعقيداً: استخدامها لتحليل مكالمات العملاء دون الإفصاح قد يخلق مسؤولية قانونية اعتماداً على الولاية القضائية، ولا توضح وثائق Hume هذا الخطر بشكل صريح في تدفق الإعداد.
يتم تضمين الحقوق التجارية للصوت المُولد بواسطة EVI في جميع الخطط المدفوعة؛ وتُعد خطة Creator ($7-$14/mo) نقطة الدخول للحصول على ترخيص تجاري. مخرجات الفئة المجانية مخصصة للتقييم فقط ولا يمكن استخدامها في منتجات الإنتاج. بالنسبة للمؤسسات في الصناعات الخاضعة للتنظيم، مثل الرعاية الصحية والخدمات المالية، تضع Hume واجهة EVI كمنتج متوافق مع HIPAA، وهو تمييز ذو مغزى مقارنة بأدوات الذكاء الاصطناعي الصوتي الأقل وعياً بالامتثال، على الرغم من أنه يجب على المؤسسات التحقق من تفاصيل إعداد اتفاقية شراكة الأعمال الخاصة بها بدلاً من افتراض التغطية.
أين تقصر Hume EVI بشكل ملحوظ
تُعد فجوة تغطية اللغات هي الحد الصارم الأكثر وضوحاً. يدعم EVI حوالي 11 لغة اعتباراً من أوائل عام 2026. بينما تدعم ElevenLabs أكثر من 70 لغة. إذا كان منتجك يخدم مستخدمين غير ناطقين باللغة الإنجليزية بأي حجم كبير، فإن EVI ليس طبقة صوتية أساسية قابلة للتطبيق اليوم. هذه ليست فجوة بسيطة يمكن الالتفاف حولها، بل هي عائق أمام النشر لأي حالة استخدام عالمية أو متعددة اللغات لدعم العملاء أو الرعاية الصحية.
يتطلب الوصول إلى EVI عملاً هندسياً. لا توجد واجهة مستخدم رسومية (GUI) حيث يمكن لغير المطورين بناء واختبار ونشر وكيل صوتي. كل تكوين ذي مغزى، ومطالبات النظام، واختيار الصوت، وتوجيه LLM، وحقن السياق، يحدث من خلال واجهة برمجة التطبيقات (API) أو حزم تطوير البرمجيات (SDKs). لا يمكن للفرق الصغيرة التي تفتقر إلى الموارد الهندسية خدمة نفسها. لا توفر الدقائق الخمس المجانية من EVI في الفئة المجانية أي شيء تقريباً للتقييم؛ يتطلب الاختبار المجدي فئة Starter كحد أدنى.
يمكن أن تفاجئ الفواتير الفرق عند التوسع. يفرض نموذج التجاوز رسوماً تتراوح بين $0.04 و $0.07 لكل دقيقة EVI تتجاوز مخصصات الخطة. يمكن لفريق دعم العملاء الذي لديه حجم مكالمات كبير في شهر مزدحم أن يجد أن خطة Pro بقيمة $70 (تتضمن 1,200 دقيقة EVI) تتراكم عليها مئات الدولارات من التجاوزات. على عكس تسعير Cartesia الثابت لكل حرف أو نموذج الائتمان الأكثر وضوحاً في ElevenLabs، يتطلب هيكل تكلفة Hume مراقبة دقيقة لأعباء عمل الإنتاج.
حدود التزامن مقيدة بالخطط بطرق تصبح مزعجة. يتطلب توسيع جلسات EVI المتزامنة الانتقال إلى فئات Business ($500/mo) أو Enterprise. تصطدم الفرق التي تقوم ببناء نماذج أولية على Starter وتنمو بسرعة بهذه الأسقف قبل أن يكون لديها الإيرادات لتبرير القفزة في الخطة.
"كان الأسبوع الأول صعباً. استغرق إعداد استدعاءات واجهة برمجة التطبيقات وقتاً أطول مما توقعت."، مستخدم مطور، تمت الإشارة إليه في مراجعة fahimai.com لعام 2026
لمن تم تصميم Hume EVI
يُعد EVI الخيار الصحيح للفرق الهندسية التي تبني تطبيقات صوتية للمحادثة حيث يكون السجل العاطفي لكل من المتصل واستجابة الذكاء الاصطناعي متطلبات أساسية. دعم العملاء للتفاعلات عالية المخاطر أو الحساسة، والتدريب على الصحة العقلية، واستقبال مرضى الرعاية الصحية، وتطبيقات التدريس حيث يحتاج المستخدم المنزعج أو المرتبك إلى أكثر من مجرد معلومات صحيحة، بل يحتاج إلى صوت يستجيب لكيف يبدو صوته بالفعل. في تلك السياقات، لا يُعد الذكاء العاطفي ثنائي الاتجاه من Hume مجرد ميزة إضافية لطيفة؛ بل هو الميزة الأساسية التي تميزه عن مجرد إرفاق كلمات رئيسية للمشاعر بمطالبة TTS قياسية.
تجاوز Hume EVI إذا كان متطلبك الأساسي هو التغطية متعددة اللغات، أو سرد المحتوى، أو إنتاج الكتب الصوتية، أو تحسين زمن الانتقال النقي لمسار صوتي. يتم تقديم حالات الاستخدام هذه بشكل أفضل بواسطة ElevenLabs أو Cartesia AI على التوالي، بتكلفة أقل وتعقيد تكامل أقل. تجاوزه أيضاً إذا لم يتمكن فريقك من تخصيص وقت هندسي للتكامل، فهذا ليس منتجاً للمستخدمين غير التقنيين الذين يرغبون في بناء وكيل صوتي من خلال واجهة مرئية.
تشير جولة التمويل من الفئة B بقيمة $50M من EQT Ventures في مارس 2024، جنباً إلى جنب مع Northwell Holdings (نظام رعاية صحية) و LG Technology Ventures من بين المستثمرين، إلى أين ترى الشركة مستقبلها: الصناعات الخاضعة للتنظيم وعمليات النشر المؤسسية حيث تكون طبقة الذكاء العاطفي ملكية فكرية يمكن الدفاع عنها، وليست مجرد خدعة هندسية للمطالبات. بالنسبة للمطورين الذين يبنون في تلك المساحات، فإن السجل البحثي لـ Hume، ومنهجية تدريب RLHE، ونتائج العملاء القابلة للقياس من Vonova و Thumos Care و Ream تجعلها الذكاء الاصطناعي الصوتي المتخصص الأكثر مصداقية المتاح حالياً.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Hume AI.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

AI Receptionist for Solo Professionals: Replace the Answering Service (2026)
