

LiveKit هي البنية التحتية مفتوحة المصدر لتقنية WebRTC وإطار عمل وكلاء الذكاء الاصطناعي الذي يشغل وضع الصوت في ChatGPT. تأسست في عام 2021، وتمنح المطورين تحكماً كاملاً في مسارات الصوت والفيديو في الوقت الفعلي، بدءاً من خوادم الوسائط ذاتية الاستضافة وصولاً إلى تنسيق الوكلاء الجاهزين للإنتاج.
LiveKit هي منصة بنية تحتية للاتصالات في الوقت الفعلي مفتوحة المصدر وإطار عمل لوكلاء الذكاء الاصطناعي، صممها Russ d'Sa و David Zhao، اللذان أسسا الشركة في عام 2021. تشغل المنصة البنية التحتية الصوتية وراء وضع الصوت في ChatGPT التابع لشركة OpenAI، وتُستخدم في بيئات الإنتاج من قبل Tesla و Salesforce Agentforce و xAI ومشغلي خدمات الطوارئ. في يناير 2026، جمعت LiveKit تمويلاً بقيمة $100 مليون بتقييم بلغ $1 billion، بقيادة Index Ventures، مما رسخ مكانتها كطبقة البنية التحتية المفضلة لنشر تقنيات الذكاء الاصطناعي الصوتي للمؤسسات على نطاق واسع.
تقدم المنصة منتجين متصلين: خادم وسائط يعتمد على وحدة التوجيه الانتقائي (SFU) مبرمج بلغة Go ومرخص بموجب Apache 2.0 (بـ 18.5K نجمة على GitHub)، و LiveKit Agents، وهو إطار عمل مبني بـ Python و Node.js لبناء وكلاء ذكاء اصطناعي صوتي في الوقت الفعلي (10.3K نجمة، 3.1K تفرع، الإصدار 1.5.7 اعتباراً من أبريل 2026). يدعم إطار عمل الوكلاء مسار STT-LLM-TTS بالكامل مع تكاملات أصلية لـ OpenAI GPT-4o و Realtime API، وتحويل الكلام إلى نص من Deepgram، وتحويل النص إلى كلام من Cartesia، و Google Gemini Live مع الرؤية، واكتشاف النشاط الصوتي من Silero. وتكتمل مجموعة ميزات الإنتاج باكتشاف الأدوار الدلالية، ودعم أدوات بروتوكول سياق النموذج (MCP)، والاتصالات الهاتفية عبر SIP، ومنصة مدمجة لمراقبة الوكلاء.
ما الذي تفعله LiveKit فعلياً في مايو 2026
يتعامل خادم LiveKit مع توجيه الصوت والفيديو في الوقت الفعلي باستخدام بنية SFU: يرسل الناشرون تدفق وسائط مشفر واحد إلى الخادم، والذي يقوم بتوجيهه إلى المشتركين دون إعادة تشفيره، مما يحافظ على انخفاض عرض النطاق الترددي للرفع وتقليل زمن الوصول إلى الحد الأدنى. الخادم قابل للتوسع أفقياً، ويستخدم Redis للتوجيه من نظير إلى نظير عبر العقد، ويمكن تشغيله على خادم افتراضي خاص (VPS) واحد أو عبر مئات العقد بنفس التكوين. وتقع طبقة الوكلاء فوق هذا النقل، لتربط نماذج الذكاء الاصطناعي بتدفقات WebRTC.
يحدد إطار عمل LiveKit Agents مساراً قياسياً يتعامل مع اكتشاف النشاط الصوتي، والنسخ النصي، واستنتاج النماذج اللغوية الكبيرة (LLM)، وتشغيل تحويل النص إلى كلام. يستخدم اكتشاف الأدوار الدلالية، الذي تم تقديمه في عام 2025، مصنف محولات (transformer) لتحديد متى ينتهي المستخدم من التحدث بدلاً من الاعتماد على مدة الصمت وحدها. يقلل هذا بشكل كبير من المقاطعات الخاطئة في البيئات الصاخبة أو عندما يتوقف المستخدمون مؤقتاً في منتصف الجملة. كشف إعلان الشراكة مع OpenAI في أكتوبر 2024، والذي كتبه d'Sa ونُشر في 3 أكتوبر 2024، عن واجهة برمجة تطبيقات الوكيل متعدد الوسائط (Multimodal Agent API) مع دعم مدمج لـ OpenAI Realtime API، مما يوفر زمن وصول صوتي ثنائي الاتجاه يبلغ حوالي 300ms ومزامنة تلقائية للنسخ النصي أثناء التشغيل. ولأول مرة، أصبح بإمكان المطورين بناء تطبيقات باستخدام نفس البنية التحتية الصوتية التي يستخدمها ChatGPT داخلياً.
وبعيداً عن الصوت، تدعم المنصة حالات استخدام الذكاء الاصطناعي المادي. يشمل نشر Tesla سياقات المبيعات والمساعدة على الطريق والتأمين والدعم حيث تحتاج السيارة أو المنشأة إلى بث الصوت ثنائي الاتجاه إلى وكيل مستضاف على السحابة. تتعامل وحدة SFU مع توجيه الوسائط منخفض المستوى؛ بينما يتعامل إطار عمل الوكلاء مع منطق المحادثة.
"كانت مرونة LiveKit وأداؤها حاسمين في تقديم تجارب صوتية موثوقة بزمن وصول منخفض." - Thomas Cornelius، Product Hunt، مايو 2025
موقع LiveKit مقارنة بـ Pipecat و Daily
يعد Pipecat أقرب منافس من حيث البنية. تم بناء Pipecat بواسطة فريق Daily وهو مفتوح المصدر بلغة Python، ويستخدم نموذج مسار قائم على الإطارات: تتدفق إطارات الصوت عبر مراحل مرتبة، من النقل إلى STT إلى LLM إلى TTS والعودة. هذا التجريد يجعله بديهياً للمطورين الذين يفكرون في المسارات ويريدون إدخال وإخراج خدمات الذكاء الاصطناعي. يعد Pipecat مستقلاً عن النقل من حيث المبدأ ويمكنه تقنياً الاتصال بغرفة LiveKit أو واجهة خلفية أخرى لـ WebRTC، ولكن اقترانه الأصلي هو البنية التحتية المدارة لـ Daily. المقايضة هنا هي الإسهاب: يتطلب Pipecat المزيد من التوصيل اليدوي، والمزيد من تكوين بيانات الاعتماد في التعليمات البرمجية، والمزيد من القرارات حول ترتيب المسار. يوفر LiveKit Agents واجهة برمجة تطبيقات أنظف مع تعليمات برمجية نمطية أقل للفرق التي تتبنى نهج WebRTC أولاً، بينما يعد نموذج إطارات Pipecat أكثر ملاءمة للمطورين الذين يريدون تحكماً دقيقاً في كيفية تدفق الصوت بين الخدمات.
Daily هي الشركة التي تقف وراء Pipecat وتدير بنيتها التحتية الخاصة المدارة ومغلقة المصدر لـ WebRTC مع أكثر من 75 نقطة تواجد عالمية ومتوسط تأخير للقفزة الأولى يبلغ 13ms. ما يميز Daily هو مساحة السطح المبنية مسبقاً: مكونات واجهة مستخدم جاهزة للاستخدام، وغرف فرعية، ونسخ نصي، وتسجيل، ودردشة. غالباً ما تختار الفرق التي ترغب في إطلاق منتج فيديو بسرعة دون إدارة البنية التحتية للوسائط Daily. بينما ما يميز LiveKit هو الملكية: يمكن استضافة خادم Apache 2.0 ذاتياً على أي جهاز، وتعديله بحرية، وتدقيقه بالكامل. لا تمتلك Daily بديلاً للاستضافة الذاتية. بالنسبة للفرق التي يكون فيها الصوت هو المنتج الأساسي وليس ميزة إضافية، وخاصة للفرق التي لديها متطلبات امتثال مثل HIPAA أو تفويضات إقامة البيانات، فإن خيار الاستضافة الذاتية من LiveKit يعد ميزة حاسمة لا يمكن لـ Daily مضاهاتها.
أين يقع Vapi و Retell AI في هذه الصورة: كلاهما منصتان لوكلاء الصوت المدارين بالكامل واللذان يجردان طبقة البنية التحتية بأكملها. إنهما أسرع في البدء ولا يتطلبان إدارة خوادم، لكنهما يسلمان التحكم في توجيه الوسائط وتوجيه النماذج ومسار البيانات إلى برنامج كخدمة (SaaS) تابع لجهة خارجية. تعد LiveKit الخيار الأمثل عندما تكون الهوامش أو الامتثال أو اتفاقيات مستوى الخدمة (SLAs) لزمن الوصول أو التكامل العميق أكثر أهمية من وقت إجراء المكالمة الأولى.
"يعد بث WebRTC أمراً صعباً حقاً وتوفر LiveKit حلاً مداراً رائعاً وسهل الاستخدام للمطورين." - Awais Shafique، Product Hunt، مايو 2025
كيف تبدو حلقة تطوير الوكيل فعلياً
يبدأ مشروع LiveKit Agents القياسي بعملية عامل (worker) بلغة Python تتصل بمثيل خادم LiveKit، سواء كان مستضافاً ذاتياً أو على LiveKit Cloud. يستمع العامل للغرف أو الإرسالات الواردة، ويولد مثيل وكيل لكل جلسة. يتم تعريف منطق الوكيل كفئة (class) مع خطافات دورة الحياة (lifecycle hooks) لـ on_enter و on_message و on_exit. تتم إضافة تكاملات النماذج عبر حزم الإضافات: يغطي pip install "livekit-agents[openai,silero,deepgram,cartesia,turn-detector]~=1.4" حزمة الإنتاج الأكثر شيوعاً.
بالنسبة لحالات استخدام الاتصالات الهاتفية، تتعامل حزمة SIP الخاصة بـ LiveKit مع مكالمات PSTN الواردة والصادرة من خلال طبقة تكوين، وتربط المكالمات الهاتفية بنفس مسار الوكيل دون تعليمات برمجية إضافية. توفر منصة مراقبة الوكلاء التي تم تقديمها في أواخر عام 2025 طرق عرض للجدول الزمني لكل جلسة، وأحداث اكتشاف الأدوار، وسجلات استدعاء النماذج، مما يجعل تصحيح أخطاء الإنتاج قابلاً للتتبع دون بناء بنية تحتية مخصصة للتسجيل.
يعد الاختبار استثماراً ملحوظاً في إطار العمل: تتضمن أدوات الاختبار المدمجة محاكاة الوظائف على مستوى الوحدة، ومحاكاة السيناريوهات، ونظام تحقق قائم على التحكيم يستخدم نموذج لغوي كبير (LLM) لتقييم ما إذا كانت استجابات الوكيل تلبي القصد من حالة الاختبار. يعد هذا أكثر تطوراً بكثير من خطافات التكامل المستمر (CI) الأساسية المتوفرة في Pipecat أو الاختبار اليدوي الذي تقوم به معظم الفرق مع الوكلاء المستضافين على Vapi.
لمن تم بناء LiveKit
LiveKit هي بنية تحتية لمهندسي الواجهة الخلفية الذين يرغبون في امتلاك حزمة التقنيات بالكامل. يمتلك الفريق المناسب لـ LiveKit مطور Python أو Node.js يشعر بالراحة في قراءة وثائق WebRTC، وإعداد DevOps قادر على تشغيل ملف Go ثنائي أو حاوية Docker (للاستضافة الذاتية)، ومنتجاً يعتبر الصوت فيه ميزة أساسية وليس إضافة اختيارية.
تشمل الملاءمات المحددة أتمتة دعم العملاء حيث يبرر حجم المكالمات تحسين التكلفة لكل دقيقة مقارنة بهوامش ربح المنصات المدارة؛ وتطبيقات الرعاية الصحية والقانونية التي تتطلب الامتثال لـ HIPAA وإقامة البيانات التي لا يمكن تفويضها لبرنامج كخدمة (SaaS) تابع لجهة خارجية؛ ومنتجات الروبوتات والذكاء الاصطناعي المادي التي تحتاج إلى بث وسائط ثنائي الاتجاه مع الحد الأدنى من القفزات الوسيطة؛ وأدوات المطورين ومساعدي البرمجة الذين يحتاجون إلى إقران الصوت بمسارات استخدام الأدوات عبر MCP. غالباً ما تظهر شركات مثل ElevenLabs ومستخدمي Whisper معاً في حزم نشر LiveKit، حيث يغذون مخرجات TTS أو STT الخاصة بهم من خلال مسار الوكيل.
تم ذكر Spotify و Meta و Microsoft و Character AI و Speak و Fanatics كعملاء في المواد العامة لـ LiveKit، والتي تغطي حالات استخدام تتراوح من جلسات الاستماع للموسيقى إلى ميزات الشبكات الاجتماعية إلى منصات تفاعل المعجبين.
كما كشفت جولة التمويل Series C في يناير 2026 عن قطاع ناشئ للذكاء الاصطناعي المادي: تستخدم Tesla منصة LiveKit للتفاعلات الصوتية عبر المبيعات والدعم والتأمين والمساعدة على الطريق. يختلف نمط النشر هذا، حيث تقوم مركبة أو جهاز ببث الصوت في الوقت الفعلي إلى وكيل مستضاف على السحابة، عن المكالمة النموذجية من المتصفح إلى السحابة ويمثل فئة لا تعالجها معظم المنصات المدارة على الإطلاق. تحافظ بنية SFU الخاصة بـ LiveKit، والتي توجه الوسائط دون إعادة تشفير، على زمن وصول الذهاب والإياب منخفضاً بما يكفي لعمليات النشر على جانب المركبة حيث قد تؤدي بضع مئات من الأجزاء من الثانية الإضافية إلى جعل التجربة تبدو معطلة.
ما لا تقدمه LiveKit
لا تقدم LiveKit واجهة بدون تعليمات برمجية (no-code) أو بتعليمات برمجية منخفضة (low-code). لا يوجد منشئ وكلاء يعتمد على السحب والإفلات، ولا واجهة مستخدم لتوفير أرقام الهواتف، ولا لوحة تحكم لتحليلات المكالمات على غرار منتجات Vapi أو Retell. كل تكامل يتطلب كتابة تعليمات برمجية.
إنها ليست حلاً لمعالجة الصوت المجمعة (batch processing). تم بناء المنصة بأكملها حول البث في الوقت الفعلي؛ إذا كان سير العمل لا يتضمن طرفين في جلسة مباشرة، فلا يوجد مكان لـ LiveKit فيه.
إنها ليست بديلاً جاهزاً لـ Daily إذا كان منتجك يعتمد على مكونات واجهة مستخدم مبنية مسبقاً لمكالمات الفيديو، أو عناصر تحكم في مشاركة الشاشة، أو دردشة داخل المكالمة. توفر LiveKit البنية التحتية للوسائط؛ بينما تقع مسؤولية طبقة الواجهة على عاتق المطور. هذا التمييز مهم عملياً: سيجد الفريق الذي يبني منتجاً مشابهاً لـ Zoom أن Daily أسرع في الإطلاق لأن Daily تدمج أساسيات واجهة المستخدم. بينما سيجد الفريق الذي يبني منتج دعم عملاء يعتمد على الصوت أولاً فوق تطبيق الويب الخاص به أن LiveKit تناسبه بشكل أفضل لأنهم لا يحتاجون إلى مكونات واجهة Daily المدمجة ولا يريدون الدفع مقابلها.
كما أن LiveKit غير مناسبة للفرق التي يكون اهتمامها الأساسي هو تكلفة التشغيل عند أحجام المكالمات الصغيرة. على النطاق المنخفض، تكون التكلفة الإضافية لكل دقيقة للمنصات المدارة مثل Vapi ضئيلة، ووقت الهندسة الذي يتم توفيره من خلال عدم إدارة البنية التحتية لـ WebRTC يفوق بكثير فارق التكلفة. يجعل خيار الاستضافة الذاتية تشغيل LiveKit مجانياً حقاً، ولكن البنية التحتية "المجانية" لا تزال تتطلب مهندسين لصيانتها. لا تميل الجدوى الاقتصادية بوضوح لصالح LiveKit إلا عندما يكون لدى الفريق حجم مكالمات كافٍ يجعل هوامش ربح SaaS لكل دقيقة بنداً يستحق التحسين، وعادة ما يكون ذلك أعلى من 50,000 دقيقة شهرياً، وهو ما يتوافق تقريباً مع حد فئة Scale الخاصة بـ LiveKit.
تجاوز LiveKit للنماذج الأولية السريعة. إذا كان الهدف هو اختبار مفهوم وكيل صوتي في عطلة نهاية الأسبوع، فإن Vapi أو Retell ستنتج رقم هاتف يعمل وتدفق مكالمات في أقل من ساعة. يفترض إعداد LiveKit، حتى باستخدام خيار الاستضافة السحابية، الإلمام بمفاهيم WebRTC، والبرمجة غير المتزامنة في Python، وتصحيح أخطاء الأنظمة الموزعة. ومع ذلك، يلاحظ المطورون الذين يتجاوزون منحنى التعلم هذا بشكل متكرر أنهم يكتسبون فهماً كافياً منخفض المستوى يجعل من الصعب التخلي عن LiveKit: كما عبر أحد المعلقين على HackerNews، بمجرد أن تعرف LiveKit جيداً بما فيه الكفاية، فإنك "تعرف أكثر مما هو صحي" عن الأجزاء الداخلية لـ WebRTC، مما يجعلك أكثر عرضة لبناء نظامك الخاص في المرة القادمة. تُقرأ هذه الملاحظة كانتقاد ولكنها أيضاً دليل على أن LiveKit تنجح في تعليم البنية التحتية الأساسية للمهندسين الذين يتعاملون معها بجدية.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن LiveKit.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ LiveKit.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

Google vs OpenAI vs Anthropic Agents: The May 2026 Platform Showdown

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
