

AI21 Jamba هي عائلة نماذج هجينة تجمع بين Mamba وTransformer، مصممة لمهام المؤسسات ذات السياق الطويل. تعمل النماذج مفتوحة الأوزان مجانًا على أجهزتك الخاصة؛ وتبدأ تكلفة واجهة برمجة التطبيقات (API) من $0.20 لكل مليون رمز (token) مع نافذة سياق حقيقية تبلغ 256K.
AI21 Jamba هي عائلة من النماذج اللغوية الكبيرة التي طورتها AI21 Labs، وهي شركة أبحاث ذكاء اصطناعي إسرائيلية تأسست عام 2017. وعلى عكس أي نموذج لغوي كبير (LLM) رئيسي آخر مفتوح الأوزان، لا تستخدم Jamba بنية Transformer خالصة. بل تدمج طبقات نموذج مساحة الحالة (SSM) من نوع Mamba مع طبقات الانتباه التقليدية في Transformer بنسبة 1:7 تقريبًا، مع تطبيق توجيه مزيج الخبراء (MoE) كل كتلتين. النتيجة العملية لهذا التصميم: ذاكرة التخزين المؤقت KV عند 256K رمز أصغر بـ 8 مرات من Mixtral 8x7B وأصغر بـ 32 مرة من نموذج مشابه قائم على Llama، مما يتيح استدلالًا أسرع بـ 2.5 مرة في السياقات الطويلة دون التضحية بدقة الاسترجاع التي تفقدها نماذج SSM الخالصة عند التوسع.
يأتي جيل Jamba 1.5، الذي أُطلق في 22 أغسطس 2024، في نسختين مفتوحتي الأوزان: Jamba 1.5 Mini (بـ 12B معلمة نشطة، و52B معلمة إجمالية) وJamba 1.5 Large (بـ 94B معلمة نشطة، و398B معلمة إجمالية). يدعم كلا النموذجين نافذة سياق تبلغ 256K رمز، واستدعاء الوظائف، ومخرجات JSON المهيكلة، والتوليد المدعوم بالبيانات (grounded generation) لمسارات RAG عبر معلمة مستندات مدمجة. تتوفر واجهة برمجة التطبيقات (API) من خلال AI21 Studio ومنصات السحابة الرئيسية بما في ذلك AWS Bedrock وAzure AI وGoogle Cloud Vertex AI وNVIDIA NIM. تتوفر الأوزان المفتوحة على Hugging Face بموجب ترخيص Jamba Open Model License، والذي يسمح بالاستخدام البحثي والتجاري. تستمر أحدث نماذج API (وهي Jamba Mini 1.7 وJamba Large 1.7) في استخدام نفس البنية مع تحسينات في اتباع التعليمات ودقة التوليد المدعوم بالبيانات.
نظرة سريعة على Jamba، أغسطس 2024
كان إطلاق Jamba 1.5 في 22 أغسطس 2024 هو المرة الأولى التي تصل فيها بنية غير Transformer إلى جودة مستوى الإنتاج بهذا الحجم. أصدرت AI21 نموذجين في وقت واحد: Jamba 1.5 Mini وJamba 1.5 Large. يسجل نموذج Large درجة 65.4 على Arena Hard، والذي تجاوز عند إطلاقه كلاً من Llama 3.1 70B وLlama 3.1 405B في هذا المعيار. يُظهر معيار RULER للسياق الطويل عند 256K دقة تبلغ 93.9% لنموذج Large، مما يثبت أن نافذة السياق ليست مجرد حيلة تسويقية. كما أطلقت AI21 تقنية ExpertsInt8، وهي تقنية تكميم (quantization) خاصة تتيح لنموذج Jamba 1.5 Large (بإجمالي 398B معلمة) التوافق والعمل على عقدة واحدة تتكون من 8 وحدات معالجة رسومات H100 بسعة 80GB.
تتضمن قائمة النماذج الحالية اعتبارًا من أبريل 2026 كلاً من Jamba Mini 1.7 وJamba Large 1.7 (تم إصدارهما في يوليو وأغسطس 2025 على التوالي)، بالإضافة إلى Jamba Reasoning 3B للمهام التي تتم على الأجهزة، وعائلة Jamba 2 لاشتراكات المؤسسات. تحمل نماذج Jamba 1.5 الموجودة على Hugging Face تاريخ توقف معرفي (knowledge cutoff) في 5 مارس 2024. بينما تحتوي نماذج API على بيانات تدريب أحدث. تدعم جميع النماذج اللغات الإنجليزية والإسبانية والفرنسية والبرتغالية والإيطالية والهولندية والألمانية والعربية والعبرية.
فيما يبرع Jamba حقًا
تكمن قوة Jamba الحقيقية في إنتاجية السياق الطويل لسير عمل المؤسسات المليئة بالمستندات. عندما تتطلب المهمة معالجة عقد مكون من 200 صفحة، أو دليل فني من 400 صفحة، أو نص دعم عملاء متعدد الجلسات في تمريرة واحدة، فإن بنية Jamba توفر هذه الإمكانية بتكلفة رموز أقل وزمن انتقال استدلالي أقل مقارنة بنماذج Transformer المشابهة. تم تصميم ميزة التوليد المدعوم بالبيانات، حيث تقوم بتمرير قائمة مستندات مباشرة في قالب الدردشة، خصيصًا لـ RAG دون الحاجة إلى تقسيم البيانات (chunking). هذه هي حالة الاستخدام التي يتفوق فيها Jamba على Llama وMistral من حيث التكلفة لكل رمز.
بالنسبة لأعباء عمل API المجمعة (batch)، فإن تسعير Jamba Mini 1.7 عند $0.20/1M رمز إدخال يقل عن GPT-4o ($2.50/1M) وClaude Sonnet ($3.00/1M) بهامش كبير. بالنسبة للمؤسسات التي تدير معالجة مستندات بكميات كبيرة حيث يكون الإدخال طويلاً باستمرار، فإن الحسابات تميل بوضوح لصالح Jamba.
"يتمتع Jamba Large بسعر تنافسي يبلغ $2/M رمز إدخال مقارنة بـ Claude Sonnet 4.6 ($3/M) وGPT-4o ($2.50/M) لمعالجة السياق الطويل.". مراجعة AI Tools Atlas، 2026
يستهدف Jamba Reasoning 3B، الذي تم إصداره عام 2025، عمليات النشر على الأجهزة حيث يكون زمن الانتقال أمرًا بالغ الأهمية وتكون متطلبات أوزان Jamba 1.5 Large الكاملة باهظة. أبلغت AI21 عن مكاسب في الكفاءة تتراوح بين 2 إلى 5 أضعاف مقارنة بالنماذج المدمجة المشابهة في معاييرها الداخلية.
أين يخفق Jamba: أنماط الفشل التي يواجهها المستخدمون باستمرار
لا يُعد Jamba نموذجًا للاستدلال المنطقي. يسجل Jamba 1.5 Large درجة 36.9 في GPQA، مما يضعه بشكل ملحوظ أقل من GPT-4o وClaude في مهام الاستدلال على مستوى الدراسات العليا. أبلغ المستخدمون الذين ينشرون Jamba متوقعين نموذج تفكير للأغراض العامة عن نتائج مخيبة للآمال في المهام الوكيلة (agentic) متعددة الخطوات، وتوليد الأكواد البرمجية، وأي شيء يتطلب سلاسل منطقية مستدامة. المقايضة في البنية واضحة: طبقات Mamba فعالة للسياق ولكنها أقل دقة من الانتباه (attention) لاسترجاع المعلومات في النطاقات القصيرة.
"تتذكر نماذج SSM التفاصيل بشكل أقل جودة [من نماذج transformers].. يمكن أن تبرر وفورات الذاكرة هذه المقايضة للعديد من التطبيقات."، az226، Hacker News، أبريل 2024
تُعد الاستضافة الذاتية لنموذج Jamba 1.5 Large متطلبة للغاية. يتطلب النموذج 8 وحدات معالجة رسومات H100 بسعة 80GB مع تكميم ExpertsInt8 كحد أدنى للتكوين. أبلغ مستخدمو المجتمع الذين يحاولون تشغيله على إعدادات RTX 4090 المزدوجة عن فشل في تحميل نقاط الحفظ (checkpoint) عند حوالي 71% دون حل واضح للخطأ. لا يدعم Ollama، وهو أداة الاستدلال المحلي الأكثر استخدامًا، Jamba 1.5 بشكل أصلي (مشكلة GitHub رقم #6491، فُتحت في أغسطس 2024). وبالمثل، يفتقر نظام Apple Silicon MLX البيئي إلى دعم Jamba. هذا يحد فعليًا من الاستضافة الذاتية لـ Jamba إلى vLLM على أجهزة بمستوى المؤسسات.
تتسم بطاقة النموذج الخاصة بـ AI21 بصراحة غير معتادة بشأن اتساق المخرجات: "تكون الردود من Jamba أحيانًا غير متسقة أو متناقضة أو تحتوي على جمل وفقرات تبدو عشوائية" و"تميل المدخلات الجديدة إلى توليد تباين أعلى في مخرجاتها." هذا أكثر من مجرد نص قياسي. أبلغ المستخدمون الذين يقومون بتشغيل Jamba على مطالبات غير نمطية أو خاصة بمجال معين عن استقرار مخرجات أسوأ بشكل ملحوظ مقارنة بـ Llama أو Mistral بأحجام مماثلة.
يُعد التواجد المجتمعي والنظام البيئي محدودًا. لا توجد مجتمعات Reddit كبيرة مخصصة لـ Jamba، ولا توجد مجموعات بارزة للضبط الدقيق (fine-tune)، وهناك عدد أقل من متغيرات GGUF أو النماذج المكممة مقارنة بنظيراتها من Llama أو Mistral. كانت AI21 أكثر هدوءًا من Mistral أو Meta فيما يتعلق بالمشاركة في مجتمع المصادر المفتوحة. ينصب تركيز الشركة على عقود المؤسسات، وليس على جذب اهتمام المطورين.
Jamba مقابل Falcon Mamba مقابل Mistral 7B
يذهب Falcon Mamba 7B (معهد الابتكار التكنولوجي، الإمارات العربية المتحدة) إلى أبعد من Jamba في اتجاه SSM: فهو لا يستخدم أي طبقات انتباه (zero attention layers). البنية عبارة عن Mamba SSM خالص بـ 7.27B معلمة، جميعها نشطة (بدون MoE)، تم تدريبها على 5.8 تريليون رمز. يدعم Falcon Mamba أطوال تسلسل عشوائية نظريًا ولكنه يستهدف عمليًا سياق 8K. إن غياب أي طبقة انتباه يجعل Falcon Mamba أسرع من Jamba في الاستدلال الثابت للسياق القصير ويقضي تمامًا على مشكلة التوسع التربيعي للذاكرة. التكلفة: تواجه بنيات SSM الخالصة صعوبة في استرجاع المعلومات الدقيقة (needle-in-haystack) في السياقات الطويلة جدًا، حيث تُفتقد قدرة الانتباه على فهرسة رموز محددة مباشرة. يحافظ هجين Jamba بنسبة 1:7 على طبقة انتباه واحدة لكل ثماني طبقات لهذا السبب بالضبط. يُعد Falcon Mamba خيارًا أفضل لأعباء العمل ذات السياق الثابت والإنتاجية العالية؛ بينما يُعد Jamba الخيار الأفضل عندما تكون دقة الاستدعاء الحقيقية عند 256K أمرًا مهمًا.
يستخدم Mistral 7B (وMistral NeMo 12B) بنية Transformer خالصة مع انتباه الاستعلام المجمع (GQA) وانتباه النافذة المنزلقة. لا يوجد Mamba ولا MoE في الإصدار الأساسي 7B. نافذة السياق: 8.2K رمز لـ Mistral 7B، و128K لـ Mistral NeMo. في السياقات القصيرة، ينافس Mistral 7B نموذج Jamba Mini في المعايير من حيث الجودة الخام. تظهر المشكلة عند التوسع: يتطلب نموذج transformer الخالص عند سياق 256K ذاكرة تخزين مؤقت KV أكبر بكثير من Jamba عند نفس الطول. ميزة Mistral هي تبني المجتمع: نظام بيئي ضخم للضبط الدقيق، ودعم واسع لـ Ollama، وتوافر GGUF للأجهزة الاستهلاكية. ميزة Jamba هي المساحة المعمارية للتعامل مع المستندات الطويلة حقًا بكفاءة. بالنسبة لحالات استخدام المطورين النموذجية التي تقل عن 16K رمز، يُعد Mistral 7B أكثر عملية في النشر ويحظى بدعم أفضل. أما بالنسبة لمعالجة مستندات المؤسسات التي تتجاوز 100K رمز، فإن بنية Jamba تجعل المقارنة غير ذات صلة. لا يستطيع Mistral فعليًا القيام بذلك بتكلفة معقولة.
هل تستحق فئة API المدفوعة التكلفة؟
تُعد واجهة برمجة تطبيقات Jamba منطقية من الناحية المالية في سيناريو واحد محدد: المعالجة المجمعة للسياق الطويل بكميات كبيرة حيث يكون الإدخال باستمرار 50K رمز أو أكثر. عند هذه الأطوال، تتضاعف ميزة التكلفة مقارنة بـ GPT-4o وClaude بشكل كبير. يُعد Jamba Mini 1.7 بسعر $0.20/1M إدخال أرخص بـ 12.5 مرة من GPT-4o بسعر $2.50/1M. في عبء عمل إدخال شهري يبلغ مليار رمز من المستندات الطويلة، يمثل ذلك فرقًا سنويًا قدره $2.3M. بالنسبة لحالة الاستخدام الضيقة هذه، فإن واجهة برمجة التطبيقات تستحق التكلفة بوضوح.
بالنسبة لأي شيء آخر، يضعف عرض القيمة. إذا كان سياقك النموذجي أقل من 16K رمز، فإن Mistral أو Llama عبر مزود خدمات سحابية غالبًا ما يقدم جودة أفضل مقابل الدولار. إذا كنت بحاجة إلى برمجة أو استدلال قوي، فلا Jamba Mini ولا Jamba Large ينافسان GPT-4o أو Claude Sonnet أو Llama 3.1 405B في المهام الوكيلة المستندة إلى المعايير. يُعد الرصيد التجريبي البالغ $10 من AI21 Studio كافيًا لتقييم ما إذا كان أداء السياق الطويل يبرر الالتزام بالإنتاج.
بالنسبة لمضيفي المصادر المفتوحة ذاتيًا، فإن المتغيرات المصغرة (mini) مجانية فعليًا للتشغيل، وفقًا للترخيص، على أي أجهزة CUDA تلبي الحد الأدنى من VRAM (تتعامل وحدة معالجة رسومات واحدة بسعة 80GB مع Jamba 1.5 Mini عند سياق 140K). التكلفة تكمن في البنية التحتية، وليس في الترخيص.
أفضل حالات الاستخدام (ومتى يجب تجاوزه)
استخدم Jamba عندما: تقوم بمعالجة مستندات طويلة، 100K رمز أو أكثر، بكميات كبيرة. تُعد المراجعة القانونية، واستخراج التقارير المالية، وتحليل مستندات الامتثال، أو سجلات تفاعل العملاء الطويلة هي الاستخدامات الطبيعية. ستجد فرق المؤسسات التي تحتاج إلى نشر محلي معزول (air-gapped) بسياق 256K وبدون استدعاءات API خارجية أن Jamba 1.5 Large على vLLM هو الخيار العملي الأفضل المتاح مفتوح الأوزان. يظهر مقاولو الرعاية الصحية والدفاع بشكل بارز في قاعدة عملاء AI21 المعلنة لهذا السبب.
يُعد Jamba منطقيًا أيضًا عندما تقوم ببناء مسار RAG يرغب في تجنب تقسيم البيانات (chunking) تمامًا. إن تمرير مستند مكون من 150 صفحة كسياق واحد وطرح أسئلة حوله أقل صعوبة مع Jamba من أي نموذج pure-transformer بتكلفة مماثلة.
تجاوز Jamba عندما: تحتاج إلى مساعدة في البرمجة، أو استدلال متعدد الخطوات، أو تنفيذ مهام وكيلة. النموذج غير تنافسي مع GPT-4o أو Claude أو Llama 3.1 405B لهذه المهام. تجاوزه إذا كان سياقك أقل من 16K رمز باستمرار، حيث تختفي الميزة المعمارية وتُخدم بشكل أفضل من خلال نماذج أصغر وأكثر دعمًا. تجاوزه إذا كنت تريد أدوات على مستوى المستهلك: عدم وجود دعم لـ Ollama، وعدم وجود دعم لـ LM Studio، وعدم وجود متغيرات GGUF جاهزة يعني أن تجربة الاستضافة الذاتية مخصصة حصريًا للفرق التي تمتلك مجموعات GPU ووقتًا هندسيًا. تجاوزه إذا كنت تريد نظامًا بيئيًا مجتمعيًا غنيًا لوصفات الضبط الدقيق، أو LoRAs، أو أدلة هندسة المطالبات. مجتمع مطوري Jamba صغير مقارنة بـ Llama أو Mistral.
البدء مع Jamba
أسرع مسار هو AI21 Studio على studio.ai21.com، والذي يوفر $10 كأرصدة تجريبية. تستخدم استدعاءات API تنسيق إكمالات الدردشة القياسي مع معلمة نموذج تشير إلى jamba-mini-1.7 أو jamba-large-1.7. للتوليد المدعوم بالبيانات، قم بتمرير مصفوفة مستندات في نص الطلب. يتيح ذلك RAG بدون متجر متجهات للسياقات التي تتناسب مع 256K رمز.
للنشر المستضاف ذاتيًا، توصي AI21 بإصدارات vLLM من 0.6.5 إلى 0.8.5. يتطلب نموذج Jamba 1.5 Mini وحدة معالجة رسومات واحدة بسعة 80GB بتكميم 8-bit لنافذة سياق تبلغ 140K. يتطلب Jamba 1.5 Large 8 وحدات معالجة رسومات بسعة 80GB مع تكميم ExpertsInt8. قم بتثبيت mamba-ssm وcausal-conv1d قبل التحميل باستخدام Transformers. ملاحظة: تحتوي إصدارات Transformers 4.44.0 و4.44.1 على أخطاء موثقة مع Jamba؛ استخدم إصدارًا مجاورًا. يتوفر استدعاء الوظائف ووضع JSON عبر معلمة knobs في قالب الدردشة في النماذج مفتوحة الأوزان.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن AI21 Jamba.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ AI21 Jamba.

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?
