تخطَّ إلى المحتوى الرئيسي
Vantaige
Cerebras screenshot

تُعد Cerebras Inference واجهة برمجة تطبيقات سحابية للنماذج اللغوية الكبيرة (LLM) مدعومة بشريحة WSE-3 بحجم الرقاقة، وهي أكبر معالج ذكاء اصطناعي تم تصنيعه على الإطلاق. توفر الواجهة سرعة تتراوح بين 2,000 إلى 3,000 رمز (token) في الثانية للنماذج المفتوحة، مما يجعلها أسرع بـ 10 إلى 20 مرة من البدائل المعتمدة على وحدات معالجة الرسومات (GPU)، بأسعار تبدأ من $0.10 لكل مليون رمز.

حالات الاستخدام:البرمجة والتطوير
الميزات:API

شركة Cerebras Systems هي شركة متخصصة في أجهزة الذكاء الاصطناعي مقرها سانتا كلارا، وقد ابتكرت WSE-3، وهي أكبر شريحة تم تصنيعها على الإطلاق: رقاقة سيليكون واحدة تبلغ مساحتها 46,225 مليمتراً مربعاً، وتحتوي على 4 تريليونات ترانزستور و900,000 نواة حوسبة محسّنة للذكاء الاصطناعي. وبدلاً من تقطيع رقاقة السيليكون إلى عشرات الشرائح الصغيرة، تتعامل Cerebras مع الرقاقة بأكملها كمعالج واحد موحد، حيث تخزن مصفوفات أوزان النماذج اللغوية الكبيرة (LLM) بالكامل في ذاكرة SRAM مدمجة بسعة 44 GB بنطاق ترددي للذاكرة يبلغ 21 بيتابايت في الثانية. يقدم النظام التجاري CS-3 هذه الشريحة كجهاز مبرد بالماء. وتُعد Cerebras Inference، التي أُطلقت في 27 أغسطس 2024، واجهة برمجة التطبيقات السحابية العامة التي تمنح المطورين إمكانية الوصول إلى هذه الأجهزة لإجراء استدلالات النماذج اللغوية الكبيرة بسرعات لا يمكن لأي مجموعة من وحدات معالجة الرسومات (GPU) مضاهاتها.

توفر واجهة برمجة تطبيقات الاستدلال كتالوجاً متجدداً من النماذج المفتوحة الرائدة، بما في ذلك GPT-OSS-120B (الذي يصل إلى حوالي 3,000 رمز في الثانية)، وQwen3-235B (بسرعة تصل إلى 2,500 رمز في الثانية مع سياق 262K)، وLlama 4 Maverick (حوالي 2,522 رمزاً في الثانية)، وLlama 3.1 8B (بسرعة 2,337 رمزاً في الثانية بتكلفة $0.10 لكل مليون رمز). تتوافق واجهة برمجة التطبيقات مع OpenAI، لذا لا يتطلب التكامل سوى تغيير عنوان URL الأساسي ومفتاح API. توفر الباقة المجانية مليون رمز يومياً دون قائمة انتظار. بينما تتيح باقات الشركات والمطورين حدوداً أعلى للطلبات وجدولة ذات أولوية. في يناير 2026، وقعت OpenAI صفقة بقيمة $10 مليار للحصول على 750 ميجاوات من قدرات حوسبة Cerebras حتى عام 2028، كما نشرت AWS أجهزة CS-3 في مراكز بياناتها، مما جعل Cerebras متاحة عبر AWS Bedrock.

ما الذي تقدمه Cerebras Inference فعلياً في أبريل 2026

تُعد Cerebras Inference واجهة برمجة تطبيقات مخصصة للاستدلال فقط، وليست منصة تدريب أو خدمة ضبط دقيق (fine-tuning). فهي تقوم بتشغيل النماذج اللغوية مفتوحة الأوزان بسرعات تُحدث ثورة في اقتصاديات تطبيقات الذكاء الاصطناعي في الوقت الفعلي. فعندما تستغرق مجموعة وحدات معالجة الرسومات (GPU) من 12 إلى 15 ثانية لإرجاع استجابة من نموذج Llama 70B، تقدم Cerebras نفس الاستجابة في أقل من ثانيتين. وعندما تكمل مجموعة GPU مسار استنتاج لنموذج 405B في 45 ثانية، تنجزه Cerebras في 3 إلى 4 ثوانٍ. أرقام الإنتاجية المستمدة من معايير Artificial Analysis لعام (2025) ليست نظرية: نموذج GPT-OSS-120B بسرعة تقارب 3,000 رمز في الثانية، ونموذج Llama 3.1 8B بسرعة تقارب 2,337 رمزاً في الثانية.

يتضمن كتالوج النماذج الحالي (أبريل 2026) نموذج GPT-OSS-120B بمتغيراته العالية والمنخفضة، وGLM-4.7 (بسياق 131K)، وQwen3-235B وQwen3-32B، وLlama 4 Scout. تتراوح نوافذ السياق من 33K إلى 262K رمزاً بناءً على النموذج. تعمل جميع النماذج بدقة 16-bit بشكل أصلي، مما يعني عدم وجود تنازلات في جودة المخرجات بسبب التكميم (quantization). تتبع واجهة برمجة التطبيقات تنسيق OpenAI Chat Completions، وتدعم استدعاء الوظائف (function calling) والبث (streaming)، ويمكن الوصول إليها عبر OpenRouter وHuggingFace بالإضافة إلى الوصول المباشر. عقدت Meta شراكة مع Cerebras لتشغيل واجهة برمجة تطبيقات Llama، مما يمنح المطورين سرعات استدلال أسرع بما يصل إلى 18 مرة مقارنة بحلول GPU التقليدية للوصول إلى نماذج Llama.

"لقد كانت Cerebras بمثابة اكتشاف حقيقي عندما يتعلق الأمر بالاستدلال. أكنّ الكثير من الاحترام لمؤسسهم وفريقهم وابتكارهم وتقنيتهم."، maz1b، Hacker News، أكتوبر 2025

موقع Cerebras مقارنة بـ Groq وSambaNova

قامت ثلاث شركات ببناء شرائح سيليكون مخصصة خصيصاً للتفوق على NVIDIA في مجال الاستدلال: Cerebras، وGroq، وSambaNova. تختلف بنيات شرائحهم بشكل جذري، وهذه الاختلافات تلعب دوراً مهماً في كيفية استخدامك لكل منها.

Cerebras مقابل Groq: تعتمد وحدة معالجة اللغة (LPU) من Groq على تصميم خط أنابيب خطي حيث تتدفق البيانات عبر الوحدات الوظيفية بخطى متزامنة. تحمل كل شريحة Groq ذاكرة SRAM بسعة 230 MB فقط، لذا فإن تشغيل نموذج 70B يتطلب مئات من شرائح Groq المتصلة بشبكة نسيجية خاصة، ويتطلب نموذج 400B آلاف الشرائح، مما يرفع استهلاك الطاقة على مستوى الرف (rack) إلى مئات الكيلووات. تُحسّن Groq أجهزتها من أجل الحتمية (determinism) والاستدلال بدقة 8-bit؛ بينما تعمل دقة 16-bit بشكل أبطأ بكثير على أجهزة Groq. في المقابل، تقضي شريحة Cerebras WSE-3 على الحاجة للشبكات بين الشرائح تماماً: حيث تحتفظ ذاكرة SRAM المدمجة بسعة 44 GB بالنموذج على رقاقة واحدة، وتعمل دقة 16-bit بشكل أصلي. تُظهر معايير Artificial Analysis المستقلة (2025) أن Cerebras أسرع بـ 6 مرات من Groq على نفس النماذج: GPT-OSS-120B بسرعة تقارب 3,000 مقابل حوالي 493 رمزاً في الثانية، وLlama 3.3 70B بسرعة تتجاوز 2,500 مقابل حوالي 403 رموز في الثانية. استحوذت NVIDIA على Groq في أواخر عام 2025 مقابل $20 مليار؛ وبذلك انتهت استقلالية Groq كمنافس، على الرغم من استمرار تشغيل المنتج.

Cerebras مقابل SambaNova: تستخدم شريحة SN40L من SambaNova وحدة تدفق بيانات قابلة لإعادة التكوين (RDU) مع تسلسل هرمي للذاكرة من ثلاث طبقات: SRAM، وHBM، وDRAM. تقوم وحدة RDU بتعيين الرسم البياني الحسابي الكامل لنموذج الذكاء الاصطناعي مباشرة على الشريحة كخط أنابيب مخصص لتدفق البيانات. تعني هذه الذاكرة المتدرجة أن SambaNova يمكنها الاحتفاظ بنماذج كبيرة متعددة في وقت واحد وتقديمها دون الحاجة إلى إعادة تحميل الأوزان. يتسع نظام SambaNova بالكامل في 16 شريحة تستهلك حوالي 10 kW في المتوسط، مقارنة بـ Cerebras التي تحتاج إلى أجهزة CS-3 كاملة مبردة بالماء تستهلك كل منها 20-27 kW. تدعي SambaNova أداءً أفضل بـ 40 مرة لكل مساحة مقارنة بـ Groq وأفضل بـ 10 مرات من Cerebras على نموذج Llama 3.1 70B. الاختلاف الحاسم للمشترين: تدعم SambaNova النشر المحلي (on-premises) للشركات؛ بينما تقتصر Cerebras على السحابة فقط. تُعد إنتاجية SambaNova لكل مستخدم للطلبات الفردية أقل من Cerebras من حيث الرموز الخام في الثانية، لكن SambaNova يمكنها خدمة عدد أكبر من المستخدمين المتزامنين دون عبء إعادة تحميل النموذج.

كيف يبدو واقع واجهة برمجة تطبيقات الاستدلال في الاستخدام اليومي

ميزة السرعة حقيقية ويمكن ملاحظتها على الفور. يُبلغ المطورون الذين يبنون مساعدي البرمجة (أضاف Cline دعم Cerebras في الإصدار v3.20.4، وRoo Code في الإصدار v3.25.5) عن استجابات شبه فورية للنماذج مقارنة بمزودي الخدمات المعتمدين على GPU. بالنسبة للتطبيقات التفاعلية، فإن الفرق بين استجابة تستغرق ثانيتين واستجابة تستغرق 0.15 ثانية ليس مجرد إحصائية معيارية. بل إنه يغير من طبيعة تفاعلات المنتج الممكنة. بسرعة 2,337 رمزاً في الثانية لنموذج Llama 3.1 8B، تصل استجابة مكونة من 500 رمز في حوالي 0.2 ثانية.

ومع ذلك، يتضمن الواقع اليومي بعض العقبات التي لا تعكسها المعايير. يعني الحد الأقصى البالغ 30 طلباً في الدقيقة للباقة المجانية أن أي تطبيق يضم أكثر من مستخدم متزامن واحد سيصل إلى الحدود القصوى على الفور. ونظراً لأن الاستدلال سريع جداً، يمكن للعملاء إرسال تدفقات بيانات مفاجئة (burst traffic) عن غير قصد تتجاوز حدود الطلبات قبل أن يقرأ المستخدم البشري الاستجابة السابقة. يحتاج المطورون إلى بناء منطق إعادة محاولة صريح مع تأخيرات. التخزين المؤقت للمطالبات (Prompt caching)، والذي تقدمه كل من Anthropic وOpenAI لتقليل التكاليف على السياق المتكرر، غير متوفر في Cerebras. بالنسبة للحلقات الوكيلة (agentic loops) التي تعيد بناء سجل الرسائل بالكامل عند كل استدعاء للأداة، تتراكم تكاليف الرموز بالسعر الكامل في كل دورة. أفاد أحد المطورين: بدون التخزين المؤقت، فإنك ترسل سجل الرسائل السابق بالكامل كرموز إدخال في كل استدعاء. هذا ليس مصدر قلق نظري، بل هو المحرك الرئيسي للتكلفة لعمليات نشر الوكلاء المعقدة على المنصة.

"يبدو أن حدود الطلبات تُطبق بسرعة كبيرة والنتائج أقل جودة من Claude Code وينتهي الأمر بتكلفة أعلى.". معلق على Hacker News، موضوع Cerebras Code، 2025

كما أن توفر النماذج أقل استقراراً مقارنة بمزودي الخدمات السحابية المعتمدين على GPU. تقوم Cerebras بتدوير دعم النماذج بنشاط حيث يقوم فريقها الهندسي بتحسين نقاط التحقق (checkpoints) الجديدة. يحمل كل من Llama 3.1 8B وQwen3-235B إشعار إيقاف (deprecation) بحلول 27 مايو 2026. يحتاج المطورون الذين يبنون تطبيقات إنتاجية إلى مراقبة توفر النماذج والتعامل مع عمليات الإيقاف. كما أن كتالوج النماذج أضيق من بدائل السحابة المعتمدة على GPU: خمسة نماذج نشطة مقابل العشرات المتاحة على Together AI أو Replicate.

الفئة المستهدفة من Cerebras

تم تصميم Cerebras Inference خصيصاً لحالات الاستخدام التي يكون فيها زمن الوصول (latency) هو العائق، وليس التكلفة أو تنوع النماذج. الوكلاء الصوتيون في الوقت الفعلي الذين يحتاجون إلى استجابات نموذجية في أقل من 200 مللي ثانية، ومساعدو البرمجة المباشرة حيث يدرك المستخدمون الفرق بين الإكمالات التي تستغرق ثانيتين وتلك التي تستغرق 0.1 ثانية، والأنظمة الوكيلة التي تربط العشرات من استدعاءات النماذج بالتسلسل. هذه هي أعباء العمل التي تغير فيها سرعة Cerebras ما هو ممكن، وليس فقط ما هو مريح. وتؤكد قائمة العملاء الأوائل ذلك: GlaxoSmithKline لاكتشاف الأدوية (استدلال معقد لمجال البروتين)، وCognition لوكلاء البرمجة، والآن OpenAI لتقديم خدمات ChatGPT الإنتاجية على نطاق واسع.

يستفيد الباحثون وعلماء البيانات الذين يجرون تجارب استدلال واسعة النطاق من الباقة المجانية التي توفر مليون رمز يومياً، مما يسمح ببناء نماذج أولية حقيقية للتطبيقات الحساسة للسرعة دون أي تكلفة. يُعد تسعير $0.10 لكل مليون رمز لنموذج Llama 3.1 8B من بين أدنى الأسعار في الصناعة لأي نموذج مستضاف، مما يجعل التجارب عالية الإنتاجية قابلة للتنفيذ.

تجنب استخدامها عندما: تحتاج إلى مدخلات متعددة الوسائط (صور، صوت، فيديو): تدعم Cerebras النصوص فقط. تجنبها للنشر المحلي (on-premises)، وهو أمر غير عملي مادياً نظراً لعامل الشكل ومتطلبات الطاقة لنظام CS-3. تجنبها للتطبيقات الوكيلة التي تعتمد على التخزين المؤقت للمطالبات للتحكم في التكاليف. تجنبها إذا كان التوفر المستمر للنماذج أمراً بالغ الأهمية لمجموعة الإنتاج الخاصة بك: جدول تدوير النماذج صارم بما يكفي ليتطلب أعباء صيانة إضافية. يجب على الفرق التي تحتاج إلى ضبط دقيق مكثف، أو تخصيص نماذج متخصصة، أو كتالوج نماذج واسع أن تنظر إلى السحابات المعتمدة على GPU أو منصة الشركات من SambaNova بدلاً من ذلك.

ما لا تقدمه Cerebras

Cerebras ليست شركة نماذج ذكاء اصطناعي. فهي لا تقوم بتدريب النماذج الأساسية أو تمتلك أوزان النماذج. بل تقدم نماذج مفتوحة صممتها Meta وAlibaba وغيرها، وتقوم بتشغيلها بشكل أسرع من أي منصة أخرى. إذا توقف النظام البيئي للنماذج المفتوحة عن إنتاج أوزان تنافسية، فلن يكون لدى Cerebras أي نماذج لتقديمها. تعتمد الشركة كلياً على الإصدار المستمر للنماذج مفتوحة الأوزان التي يمكنها تحسينها لأجهزتها.

Cerebras ليست نظاماً بيئياً متوافقاً مع GPU. حزمة برمجياتها خاصة وليست مبنية على CUDA. في حين يصل المطورون إلى واجهة برمجة التطبيقات من خلال الواجهة القياسية المتوافقة مع OpenAI، فإن أي أنوية مخصصة (custom kernels) أو مخططات تكميم (quantization schemes) أو تعديلات نماذج محسّنة لـ CUDA لن يتم نقلها. هذا الأمر مهم للفرق التي تمتلك خطوط أنابيب استدلال محسّنة لـ GPU وترغب في ترحيلها.

Cerebras ليست مورداً للأجهزة المحلية (on-premises) لمعظم المشترين. جهاز CS-3 هو جهاز مبرد بالماء يستهلك 20-27 kW، ويتطلب بنية تحتية مخصصة لمراكز البيانات. ما لم تكن بحجم AWS، فإنك تستخدم Cerebras كواجهة برمجة تطبيقات سحابية، ولا تقوم بنشر أجهزتها. هذا يعني أن زمن الوصول والإنتاجية للاستدلال يعتمدان على ظروف الشبكة المتصلة بمراكز بيانات Cerebras (ستة مراكز في أمريكا الشمالية وأوروبا اعتباراً من أوائل عام 2026).

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Cerebras.