

Braintrust هي منصة مراقبة تعتمد على التقييم أولاً (eval-first) للفرق التي تطلق منتجات النماذج اللغوية الكبيرة (LLM)، حيث تدمج التتبع، ومجموعات البيانات، وأدوات التقييم، وبوابات جودة CI/CD في سير عمل واحد. تُستخدم من قبل OpenAI و Stripe و Notion، وهي منصة مدفوعة ومغلقة المصدر، مع قفزة كبيرة في التكلفة عند الانتقال من الباقة المجانية إلى المدفوعة.
Braintrust هي منصة تقييم ومراقبة شاملة ومغلقة المصدر للفرق التي تبني منتجات مدعومة بالنماذج اللغوية الكبيرة (LLM)، وتتمحور حول مبدأ صريح: لا يمكنك معرفة ما إذا كانت ميزة الذكاء الاصطناعي تتحسن أو تتراجع دون قياس منهجي، واختبارات البرمجيات التقليدية لا تنطبق على المخرجات الاحتمالية. تأسست في سان فرانسيسكو على يد Ankur Goyal، الذي استحوذت Figma على شركته السابقة Impira، وتوفر للفرق الهندسية حلقة منظمة، وتلتقط التتبعات، وتحدد معايير الجودة باستخدام أدوات التقييم (scorers)، وتجري تجارب على مجموعات بيانات ذات إصدارات، وتتحكم في الإصدارات بناءً على الجودة. قائمة العملاء قوية بشكل استثنائي بالنسبة لفئة حديثة، حيث تشمل OpenAI و Stripe و Notion و Vercel و Airtable و Zapier، وهو أوضح دليل على أن نهج التقييم أولاً يلقى صدى لدى الفرق الجادة.
تجمع المنصة بين التسجيل والتتبع على Brainstore، وهي قاعدة بيانات خاصة تقول الشركة إنها أسرع بشكل ملحوظ في الاستعلام عن بيانات التتبع، مع إطار عمل للتقييمات، ومجموعات بيانات ذات إصدارات، وبيئة اختبار للمطالبات (prompt playground)، وأدوات تقييم آلية تشمل التقييم بواسطة النماذج اللغوية (LLM-as-judge)، والتعليمات البرمجية، والمراجعة البشرية. يمكن لبوابات جودة CI/CD حظر النشر عندما تتراجع التقييمات، وتُظهر ميزة Topics تلقائياً مجموعات الفشل من حركة مرور الإنتاج، بينما يقوم وكيل الذكاء الاصطناعي المدمج Loop، الذي أُطلق في نوفمبر 2025، بتحليل التتبعات بلغة بسيطة ويقترح مجموعات بيانات تقييمية وأدوات تقييم. تغطي حزم تطوير البرمجيات (SDKs) لغات Python و TypeScript و Go و Ruby و C#، وتعمل مكتبة autoevals مفتوحة المصدر بشكل مستقل، وقد جمعت الشركة 80 مليون دولار في جولة تمويل من السلسلة B بتقييم بلغ 800 مليون دولار في فبراير 2026.
ما تقدمه Braintrust لفرق الذكاء الاصطناعي في يونيو 2026
مركز الثقل هنا هو التقييم، وليس التتبع. في حين تبدأ معظم أدوات المراقبة من تسجيل الإنتاج وتضيف التقييم لاحقاً، تُبنى Braintrust انطلاقاً من سير عمل التجارب إلى الخارج، ولهذا السبب فهي تناسب الفرق التي تتعامل مع الجودة كشيء يجب قياسه وفرضه بدلاً من مجرد مراقبته.
"لم أرَ من قبل تحولاً في سير العمل يشبه ذلك الذي يدمج التقييمات في العمليات الهندسية السائدة." Malte Ubl، قسم الهندسة في Vercel، أكتوبر 2024.
من الناحية العملية، يعني هذا أنك تقوم بتجهيز تطبيقك، وسحب المحادثات الحقيقية إلى مجموعة بيانات، وتحديد أدوات التقييم، وإجراء تجارب تنتج مقارنات جنباً إلى جنب ذات دلالة إحصائية. يقوم تكامل GitHub Actions بتشغيل هذه التقييمات على كل طلب سحب (pull request) وينشر النتائج كتعليق، بحيث لا يتم شحن أي تغيير في المطالبة إلا إذا تجاوز معيار الجودة. تكتشف ميزة Topics، التي أصبحت متاحة للعموم في يونيو 2026، أنماط الفشل دون الحاجة إلى وضع علامات يدوية، ويقوم وكيل Loop، الذي أُطلق في 24 نوفمبر 2025، بتحويل سؤال مثل "هل زادت الهلوسة هذا الأسبوع؟" إلى تحليل فعلي مع اقتراح إصلاحات. جولة التمويل من السلسلة B بقيمة 80 مليون دولار بقيادة ICONIQ في فبراير 2026، مع عودة Andreessen Horowitz و Greylock، تمول خارطة الطريق التي تقف وراء كل ذلك.
مقارنة بين Braintrust و Langfuse و Arize Phoenix
في مواجهة Langfuse، يكمن الاختلاف في الفلسفة والترخيص. تعتمد Langfuse على التتبع أولاً وهي مفتوحة المصدر بالكامل بموجب ترخيص MIT، ويمكن لأي شخص استضافتها ذاتياً، وقد استحوذت عليها ClickHouse في يناير 2026، بينما تعتمد Braintrust على التقييم أولاً، وهي مغلقة المصدر وتعمل على محرك Brainstore الخاص بها، ولا توفر فئة مجانية للاستضافة الذاتية. الفرق التي تبحث عن حرية المصادر المفتوحة تبدأ مع Langfuse؛ بينما الفرق التي ترغب في أعمق أدوات التقييم والتجارب الأصلية تبدأ مع Braintrust. وفي مواجهة Arize Phoenix، يكمن التباين في الاكتشاف مقابل الفرض. تعتمد Phoenix على OpenTelemetry، وهي مجانية للاستضافة الذاتية، وتحمل شمولية انحراف تعلم الآلة (ML-drift) من جذور المراقبة الخاصة بـ Arize، مما يجعلها قوية في اكتشاف الأخطاء في الإنتاج. في المقابل، تعد Braintrust أقوى في إصلاح الأخطاء بشكل منهجي، مع بوابات CI/CD وسير عمل مجموعات بيانات أكثر نضجاً. باختصار: تبرز Phoenix المشكلة، بينما تغلق Braintrust الحلقة لمعالجتها.
تكلفة سير العمل القائم على التقييم أولاً
توفر Braintrust باقة Starter مجانية حقاً مع عدد غير محدود من المستخدمين، و 1 جيجابايت من البيانات المعالجة و 10,000 تقييم شهرياً، مع الاحتفاظ بالبيانات لمدة 14 يوماً. القفزة نحو الباقات المدفوعة كبيرة: تبلغ تكلفة باقة Pro مبلغاً ثابتاً قدره 249 دولاراً شهرياً، مع عدد غير محدود من المستخدمين أيضاً، وترفع البيانات المشمولة إلى 5 جيجابايت والتقييمات إلى 50,000 مع الاحتفاظ بالبيانات لمدة 30 يوماً، بالإضافة إلى التحكم في الوصول القائم على الأدوار (RBAC) ودعم ذي أولوية. تضيف باقة Enterprise فترات احتفاظ مخصصة، ونشراً هجيناً أو محلياً، واتفاقية مستوى خدمة (SLA) متميزة.
"التقييمات هي حجر الزاوية في هندسة الذكاء الاصطناعي المنهجية." Ankur Goyal، مؤسس Braintrust، أكتوبر 2024.
العقبة الحقيقية تكمن في نموذج الاستخدام. فبالإضافة إلى الرسوم الثابتة، يتم احتساب تكلفة استيعاب البيانات والتقييمات لكل وحدة، ويمكن لأعباء عمل الوكلاء التي تولد العديد من النطاقات (spans) والتقييمات لكل تشغيل أن تراكم رسوم التجاوز بسرعة، حيث يضيف 450,000 تقييم يتجاوز الحد المسموح به في باقة Pro حوالي 675 دولاراً إلى الفاتورة. كما لا توجد باقة وسيطة بين الباقة المجانية وباقة 249 دولاراً، مما يجعل الانتقال مفاجئاً للفرق الصغيرة.
أين تحبط Braintrust الفرق
تتركز الشكاوى الأكثر شيوعاً حول التكلفة والدعم. من الصعب وضع نموذج للتسعير قبل التسجيل لأنه يمزج بين رسوم ثابتة ورسوم لكل جيجابايت ولكل تقييم، والقفزة من الباقة المجانية إلى 249 دولاراً دون وجود خيار وسيط تفاجئ الفرق الصغيرة. كما تتعرض جودة الدعم لانتقادات متكررة في مراجعات الجهات الخارجية، حيث توصف أوقات الاستجابة البطيئة بأنها نمط منهجي وليست حوادث معزولة، وهو أمر معتاد لشركة نما عدد موظفيها إلى 165 شخصاً في غضون عام تقريباً. تم تحسين واجهة مستخدم التتبع للتقييم والتجارب بدلاً من تصحيح أخطاء الإنتاج الخام، لذا فإن تحديد السبب الجذري في تشغيل وكيل يحتوي على 2,000 نطاق (span) يتطلب تنقلاً أكثر مما تتطلبه أداة تتبع مخصصة. لا توجد استضافة ذاتية دون مستوى باقة Enterprise، وهو ما يمثل عائقاً كبيراً للفرق المقيدة بالميزانية أو بمتطلبات إقامة البيانات، ولأن التقييم يحدث بعد وقوع الحدث، فإن Braintrust لا توفر حواجز حماية في الوقت الفعلي تمنع الاستجابة غير الآمنة قبل وصولها إلى المستخدم.
لمن صُممت Braintrust، ومن يجب عليه البحث عن بدائل
تعد Braintrust خياراً ممتازاً للفرق الهندسية التي ترغب في دمج التقييمات في CI/CD، وللمؤسسات التي تبني ثقافة تعتمد على التقييم أولاً بدلاً من إجراء اختبارات مطالبات مخصصة، وللفرق التي يناسبها مستوى 249 دولاراً شهرياً، ولأي شخص يبني على أي مزود للنماذج اللغوية الكبيرة (LLM) بدلاً من التقيد بإطار عمل واحد. حزم تطوير البرمجيات (SDKs) المستقلة عن إطار العمل وبوابات الجودة الأصلية في GitHub هي عوامل الجذب الرئيسية.
وهي خيار غير مناسب للفرق التي تحتاج بشكل أساسي إلى حواجز حماية في الوقت الفعلي أو تصفية المحتوى، نظراً لأن Braintrust تُقيّم بعد وقوع الحدث، وللفرق الخاضعة للتنظيم التي تتطلب استضافة ذاتية دون عقد Enterprise. المؤسسات التي تقوم بتشغيل نماذج تعلم الآلة التقليدية جنباً إلى جنب مع النماذج اللغوية الكبيرة (LLMs) وترغب في مراقبة موحدة ستجد ضالتها بشكل أفضل مع Arize أو Weights and Biases. المطورون المستقلون والفرق الصغيرة التي لا تستطيع تبرير دفع 249 دولاراً وستستنفد الباقة المجانية بسرعة على أعباء عمل الوكلاء يجب أن تبحث عن خيار مفتوح مثل Opik أو Langfuse بدلاً من ذلك.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Braintrust.

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)
