تخطَّ إلى المحتوى الرئيسي
Vantaige
Llama screenshot

Llama هي عائلة نماذج لغوية مفتوحة الأوزان من Meta، بدءاً من الإصدارات الأصلية لعام 2023 وصولاً إلى إصدارات Llama 4 متعددة الوسائط القائمة على بنية MoE. تتوفر هذه النماذج مجاناً للتنزيل والاستضافة الذاتية، وتعمل على تشغيل آلاف الأدوات المشتقة ومسارات عمل المؤسسات في جميع أنحاء العالم.

الميزات:APIOpen Source

Llama هي عائلة من النماذج اللغوية الكبيرة مفتوحة الأوزان التي طورتها وأصدرتها Meta Platforms. نُشرت العائلة لأول مرة في فبراير 2023، وتطورت عبر أربعة أجيال رئيسية لتصبح سلالة النماذج الأكثر تشعباً في تاريخ الذكاء الاصطناعي، حيث تشغل أكثر من 20,000 نموذج مشتق على منصة Hugging Face. وعلى عكس مزودي النماذج المغلقة، تصدر Meta أوزان النموذج الفعلية للتنزيل: مما يتيح للباحثين والمطورين والشركات تشغيل Llama محلياً على أجهزتهم الخاصة، وضبطه بدقة على مجموعات بيانات خاصة، وإعادة توزيع الإصدارات المعدلة دون دفع رسوم واجهة برمجة التطبيقات (API) لكل رمز مميز (token).

انتقل الجيل الرائد الحالي، Llama 4 (الصادر في 5 أبريل 2025)، من بنية المحولات الكثيفة (dense transformers) إلى بنية مزيج الخبراء المتناثرة (MoE) وأضاف قدرات أصلية متعددة الوسائط. يقدم Llama 4 Scout حوالي 17 مليار معلمة نشطة من إجمالي 109 مليار معلمة موزعة على 16 خبيراً، مع نافذة سياق معلنة تبلغ 10 ملايين رمز مميز وقدرة على العمل على وحدة معالجة رسومات (GPU) واحدة من فئة الخوادم. بينما يتوسع Llama 4 Maverick ليصل إلى 400 مليار معلمة إجمالية موزعة على 128 خبيراً مع 17 مليار معلمة نشطة وقت الاستدلال ونافذة سياق تبلغ مليون رمز مميز. يعالج كلا النموذجين النصوص والصور معاً عبر الدمج المبكر. الوصول مجاني للاستضافة الذاتية؛ ويقدم مزودو الطرف الثالث مثل Together AI و Fireworks و Groq النماذج عبر واجهة برمجة التطبيقات (API) بأسعار تبدأ من حوالي $0.08 لكل مليون رمز مميز للإدخال لنموذج Scout.

نظرة سريعة على Llama، أبريل 2025

أدى إصدار Llama 4 في 5 أبريل 2025 إلى تحويل العائلة من بنية المحولات الكثيفة إلى بنية مزيج الخبراء المتناثرة (MoE)، حيث ينشط كل رمز مميز مجموعة فرعية فقط من الشبكات الفرعية "الخبيرة" المتخصصة بدلاً من مجموعة المعلمات الكاملة. يتوفر نموذجان للجمهور:

  • Llama 4 Scout (17B/109B): 17 مليار معلمة نشطة، 109 مليار إجمالاً، 16 خبيراً، نافذة سياق 10 ملايين رمز مميز (مضبوطة بالتعليمات). يمكن تشغيله على وحدة معالجة رسومات H100 واحدة مع التكميم (quantization). تم تدريبه على ما يصل إلى 40 تريليون رمز مميز تغطي 200 لغة.

  • Llama 4 Maverick (17B/400B): 17 مليار معلمة نشطة، 400 مليار إجمالاً، 128 خبيراً، نافذة سياق مليون رمز مميز (مضبوطة بالتعليمات). متوفر بتنسيقات BF16 و FP8. يتطلب وحدات معالجة رسومات متعددة أو تقديم موزع بدقة كاملة.

  • Llama 4 Behemoth (~2 تريليون معلمة إجمالاً): أُعلن عنه في أبريل 2025 ولكنه لم يُطرح للجمهور حتى أبريل 2026. صُمم ليكون نموذج البحث الرائد من Meta مع حوالي 288 مليار معلمة نشطة وقدرة أصلية على فهم الفيديو.

لا يزال الجيل السابق Llama 3.x منتشراً على نطاق واسع. لا يزال العديد من المطورين يفضلون Llama 3.3 70B و Llama 3.1 8B لمسارات عمل البرمجة، ويرجع ذلك جزئياً إلى أن بنيتها الكثيفة تتمتع بسلوك تقديم أكثر قابلية للتنبؤ مقارنة ببنية MoE الخاصة بـ Llama 4.

ما يقدمه Llama فعلياً

بالنسبة للفرق التي لديها متطلبات صارمة لخصوصية البيانات، فإن قيمة Llama واضحة ومباشرة: بياناتك لا تغادر بنيتك التحتية أبداً. منصات الاكتشاف القانوني، والمستشفيات التي تعالج سجلات المرضى، ومقاولو الدفاع الذين يحللون المستندات الحساسة، والمؤسسات المالية التي لديها التزامات تنظيمية للتعامل مع البيانات، جميعهم ينشرون Llama لهذا السبب بالتحديد. يتم تنزيل الأوزان مرة واحدة؛ وتعمل عملية الاستدلال بالكامل داخل بيئتك الخاصة.

النظام البيئي الذي جذبه Llama هو ميزته الرئيسية الثانية. تدعم كل من Ollama و llama.cpp و vLLM و Text Generation Inference (TGI) نماذج Llama بشكل أصلي. كما تقدم AWS Bedrock و Google Vertex AI و Azure نقاط نهاية Llama مستضافة. وتستضيف Hugging Face أوزان النموذج مع تكامل أصلي لـ Transformers. إذا احتاج المطور إلى تشغيل نموذج محلياً، أو ضبطه بدقة على بيانات مجال معين، أو الاتصال بخلفية استدلال، فهناك دروس تعليمية معتمدة وأدوات تم اختبارها في بيئات الإنتاج لكل خطوة.

الضبط الدقيق هو الركيزة الثالثة. تتيح تقنيات LoRA و QLoRA عبر Hugging Face PEFT للفرق تكييف Llama مع مجالات ضيقة: مثل تحليل العقود، وتلخيص الملاحظات السريرية، والامتثال التنظيمي. وهو أمر لا يسمح به بائعو النماذج المغلقة.

"Ollama + Llama 3.1 8B. إذا لم يقم بما تحتاجه بعد أسبوع من الاستخدام الفعلي، فإنك تفهم الفجوة جيداً بما يكفي لاتخاذ خيار أفضل." -- موضوع في مجتمع r/LocalLLaMA، 2025

أين يتعثر Llama -- أنماط الفشل التي يواجهها المستخدمون باستمرار

كان استقبال مجتمع المطورين لجيل Llama 4 سلبياً بشدة بطرق تستحق تغطية صادقة.

تدهور السياق الطويل على نطاق واسع. لا يصمد ادعاء Llama 4 Scout بدعم سياق يبلغ 10 ملايين رمز مميز في الممارسة العملية بعد 256 ألف رمز مميز. تم تدريب النماذج مسبقاً على تسلسلات تصل إلى 256 ألف رمز مميز؛ وينطبق رقم 10 ملايين على الضبط الدقيق الموجه بالتعليمات والذي يوسع التشفير الموضعي ولكنه لا يضمن جودة الاستدلال بالطول الكامل. وجدت المعايير المستقلة أن الدقة انخفضت إلى 15.6% في مهام الاسترجاع المعقدة بأطوال ممتدة. بينما احتفظ Gemini بأداء يزيد عن 90% بأطوال مكافئة في نفس الاختبارات. تسببت الأخطاء على مستوى التنفيذ في وضع التوازي لخطوط الأنابيب في vLLM في مخرجات غير مفهومة على Llama 4 عند 64 ألف رمز مميز فما فوق، وهو ما تم توثيقه في العديد من مشكلات GitHub.

"يبدو Llama Scout و Llama Maverick مخيبين للآمال بشدة -- مخيبين للآمال لدرجة أن 'الناس يعتقدون أنه لا بد من وجود خطأ في تكوينهم ليكونوا بهذا السوء.'" -- موضوع نقاش على Hacker News، أبريل 2025

أداء برمجي دون التوقعات. سجل Llama 4 Maverick نسبة 16% في معيار البرمجة Aider Polyglot، متخلفاً عن Qwen 2.5 Coder على الرغم من كونه أكبر بـ 10 مرات من حيث المعلمات النشطة. وفي معايير البرمجة التي تركز على هندسة موثوقية الموقع (SRE)، جاء في المركز الأخير بدقة 69.5%، أي أقل بنسبة 6% من DeepSeek V3 و 18% خلف GPT-4o. لاحظ المطورون أن الجيل السابق، Llama 3.3 70B، تفوق على Llama 4 Maverick في بعض مهام البرمجة. لم تجد الفرق التي تعتمد على أعباء عمل برمجية في المقام الأول سبباً مقنعاً للترقية.

لا توجد نماذج استهلاكية صغيرة في Llama 4. تضمن جيل Llama 3.2 نماذج بحجم 1B و 3B تعمل على الأجهزة الاستهلاكية والأجهزة المحمولة. بينما تم إطلاق Llama 4 بنموذجي Scout (109 مليار إجمالاً) و Maverick (400 مليار إجمالاً) فقط. يتطلب أصغر نموذج Llama 4 متاح للجمهور أجهزة من فئة الخوادم، مما أدى فعلياً إلى إقصاء الهواة ومطوري أجهزة MacBook الذين قادوا الكثير من تبني Llama 3. هذه فجوة هيكلية، وليست مشكلة في التكوين.

جودة المخرجات توصف بأنها باهتة. لاحظت تحليلات متعددة للمطورين أن مخرجات Llama 4 كانت مطولة وعامة مقارنة بالمنافسين. إحدى الملاحظات المتسقة: تنتج النماذج ردوداً طويلة ومليئة بالرموز التعبيرية بدلاً من الإجابات الدقيقة والمباشرة. بالنسبة لحالات الاستخدام في بيئة الإنتاج التي تتطلب اتباعاً دقيقاً للتعليمات، وجدت بعض الفرق أن نماذج Llama 3.1 أكثر قابلية للتنبؤ.

مقارنة بين Llama و Mistral و Qwen

جميعها عائلات نماذج مفتوحة الأوزان. تكمن الاختلافات في البنية، والترخيص، ومستوى المعايير.

Mistral (من Mistral AI، فرنسا): يستخدم Mistral Small 4 (مارس 2026) بنية MoE بإجمالي 119 مليار معلمة ولكن مع 4 خبراء نشطين فقط لكل رمز مميز، مما ينتج عنه حوالي 6 مليارات معلمة نشطة لكل استدلال -- أي أقل من نصف المعلمات النشطة في Llama 4 Scout البالغة 17 ملياراً. البصمة النشطة الأصغر تعني تكلفة استدلال أقل لكل رمز مميز على أجهزة مكافئة. الترخيص هو Apache 2.0: متساهل بالكامل، بدون حد أقصى للمستخدمين النشطين شهرياً (MAU)، بدون قيود على الاستخدامات اللاحقة، وبدون متطلبات إسناد. تبلغ نافذة سياق Mistral حوالي 256 ألف رمز مميز (أصغر من ادعاء Scout، ولكنها أقرب إلى ما تقدمه الأجهزة فعلياً بشكل موثوق). لا يمتلك Mistral نفس الحجم من النماذج المجتمعية المشتقة، لكن ترخيصه الأكثر وضوحاً جعله الخيار الافتراضي للشركات الناشئة القلقة بشأن بند 700 مليون مستخدم نشط شهرياً الخاص بـ Llama.

Qwen (من Alibaba، الصين): يستخدم Qwen 3.5/3.6 أيضاً بنية MoE بإجمالي معلمات يبلغ حوالي 397 ملياراً مع 17 مليار معلمة نشطة، مما يجعله قابلاً للمقارنة مباشرة مع Llama 4 Scout في الحوسبة النشطة. الترخيص هو Apache 2.0 بدون قيود. يتصدر Qwen معايير البرمجة اعتباراً من 2025-2026: تصدر Qwen 2.5-Coder-32B لوحات صدارة البرمجة، وسجل Qwen 3.6 Plus نسبة 78.8% على SWE-bench مقابل حوالي 70% لـ Llama 4 Maverick. بحلول أوائل عام 2026، تفوق Qwen على Llama في إجمالي التنزيلات على Hugging Face بما يقرب من مليار تنزيل تراكمي. وصلت حصة النماذج المشتقة على Hugging Face إلى 69% لـ Qwen مقابل 11% لـ Llama بحلول فبراير 2026. الشاغل الرئيسي مع Qwen هو أنه مطور من قبل Alibaba، مما يثير أسئلة حول نسب البيانات والامتثال الجيوسياسي لبعض مشتري المؤسسات والتي لا تنطبق على Llama.

الخلاصة: يتجاوز عدد المعلمات النشطة في Llama 4 نظيره في Mistral عند نطاق إجمالي مماثل، والنظام البيئي أكبر من كلا المنافسين. لكن كلاً من Mistral و Qwen يستخدمان ترخيص Apache 2.0 بدون قيود تجارية، ويتصدر Qwen في البرمجة عند حوسبة نشطة قابلة للمقارنة.

عقبة الترخيص -- ماذا يعني 700 مليون مستخدم نشط شهرياً (MAU) فعلياً

تمنح اتفاقية Llama 4 Community License Agreement من Meta حقوقاً خالية من حقوق الملكية لاستخدام وتعديل وتوزيع الأوزان في المنتجات التجارية، مع حد صارم واحد: إذا كان منتجك أو خدمتك يضم أكثر من 700 مليون مستخدم نشط شهرياً، فسيتم إنهاء ترخيصك تلقائياً ويجب عليك الاتصال بـ Meta للتفاوض على اتفاقية منفصلة. لا تلتزم Meta بمنح تلك الاتفاقية، ويمكنها فرض أي شروط، ويمكنها الرفض دون إبداء الأسباب.

يبدو هذا الحد هائلاً حتى تدرك أنه ينطبق على المنتج ككل، وليس على ميزة الذكاء الاصطناعي على وجه التحديد. فالشركة التي لديها 800 مليون مستخدم وترغب في إضافة روبوت دردشة للدعم مدعوم من Llama إلى زاوية من منصتها تعتبر تقنياً خارج نطاق الترخيص. كما يجمع البند بين الشركات التابعة: فما يهم هو إجمالي عدد مستخدمي مجموعة الشركات، وليس فقط شركة تابعة واحدة.

أشار المحللون القانونيون إلى أن قيد 700 مليون مستخدم نشط شهرياً والتعريف الرسمي للمصدر المفتوح الخاص بـ OSI غير متوافقين: يوصف Llama بشكل أكثر دقة بأنه "متاح المصدر" بدلاً من مفتوح المصدر، على الرغم من لغة التسويق الخاصة بـ Meta. هذا الأمر مهم لفرق المشتريات التي تتطلب تراخيص معتمدة من OSI للبرامج المستخدمة في أنظمة الإنتاج.

على النقيض من ذلك، يتم إصدار Mistral و Qwen بموجب ترخيص Apache 2.0. لا يوجد حد أقصى للمستخدمين، ولا متطلبات إسناد، ولا حاجة للتفاوض.

أفضل حالات الاستخدام ومتى يجب تخطي Llama

أين يثبت Llama جدارته:

  • مسارات خصوصية بيانات المؤسسات: الفرق القانونية، والرعاية الصحية، والمالية، والدفاعية التي تنشر تقنية RAG على المستندات الداخلية حيث تكون سيادة البيانات أمراً غير قابل للتفاوض. الأوزان المفتوحة تعني أن الاستدلال يعمل بالكامل داخل بنيتك التحتية.

  • الضبط الدقيق للمجالات الضيقة: الفرق التي تحتاج إلى نموذج يفهم المصطلحات الخاصة، أو اللغة التنظيمية المحددة، أو الاستدلال الخاص بمجال معين. الضبط الدقيق باستخدام LoRA/QLoRA على Llama موثق جيداً ومدعوم من قبل سلسلة أدوات Hugging Face بأكملها.

  • التطبيقات ذات الحجم الكبير مع متطلبات تكلفة منخفضة لكل رمز مميز: تكلف الاستضافة الذاتية لـ Llama على مجموعة وحدات معالجة الرسومات الخاصة بك أقل بكثير على نطاق واسع من دفع أسعار واجهة برمجة التطبيقات (API) الخاصة. بالنسبة للتطبيقات التي تولد مئات الملايين من الرموز المميزة شهرياً، فإن الجانب الاقتصادي يفضل الأوزان المفتوحة.

  • البحث والتجريب: باحثو قابلية التفسير، وفرق المواءمة، وفرق الاختبار الأمني (red-teamers) الذين يحتاجون إلى وصول الصندوق الأبيض إلى أوزان النموذج لاستكشاف التمثيلات الداخلية.

متى يجب تخطي Llama:

  • حاجتك الأساسية هي المساعدة في البرمجة: يتفوق Qwen 2.5-Coder و DeepSeek Coder على Llama 4 في معايير البرمجة عند أعداد معلمات نشطة قابلة للمقارنة. إذا كانت البرمجة هي حالة الاستخدام الرئيسية، فالخيار واضح.

  • تحتاج إلى نافذة سياق موثوقة تزيد عن مليون رمز مميز: لا تصمد ادعاءات سياق 10 ملايين لـ Scout ومليون لـ Maverick في معايير الاسترجاع الحقيقية بعد 256 ألف رمز مميز. يعد Gemini 1.5/2.5 الأداة الصحيحة لمهام البحث عن إبرة في كومة قش الحقيقية في سياق طويل جداً.

  • تريد واجهة دردشة بدون هندسة: يوفر Llama الأوزان، وليس تطبيقاً. يتطلب الحصول على واجهة دردشة تعمل استخدام Ollama أو llama.cpp أو نقطة نهاية مستضافة من طرف ثالث. يجب على المستخدمين غير التقنيين استخدام Claude أو Gemini أو ChatGPT مباشرة.

  • شركتك لديها أو تتوقع أكثر من 700 مليون مستخدم نشط شهرياً: يتطلب هيكل الترخيص التفاوض مع Meta فوق هذا الحد. يعد Mistral أو Qwen بموجب ترخيص Apache 2.0 أبسط هيكلياً للمنصات الكبيرة.

البدء مع Llama

أسرع مسار محلي هو Ollama: قم بتثبيته، وقم بتشغيل ollama pull llama3.2 للحصول على نموذج 3B على الأجهزة الاستهلاكية، والوصول إليه عبر ollama run llama3.2 أو واجهة برمجة تطبيقات محلية على localhost:11434. يتطلب Llama 4 Scout وحدة معالجة رسومات من فئة الخوادم؛ تعمل الإصدارات المكممة عبر llama.cpp على الأجهزة الاستهلاكية ذات ذاكرة الوصول العشوائي للفيديو (VRAM) العالية. للوصول إلى واجهة برمجة تطبيقات سحابية بدون استضافة ذاتية، يقدم Together AI و Fireworks نموذج Scout بسعر ~$0.08 لكل مليون رمز مميز و Maverick بسعر ~$0.15-$0.30 لكل مليون رمز مميز. تستضيف Hugging Face الأوزان تحت منظمة meta-llama؛ ويدعم Transformers v4.51.0+ نموذج Llama 4 بشكل أصلي بما في ذلك المدخلات متعددة الوسائط.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن Llama.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Llama.