

MLX هو إطار عمل مفتوح المصدر للمصفوفات من Apple ML Research لتشغيل وضبط نماذج التعلم الآلي على شرائح Apple Silicon. مجاني، ومرخص بموجب MIT، ومصمم لاستخراج أقصى أداء من شرائح M1 إلى M5 باستخدام الذاكرة الموحدة.
MLX هو إطار عمل مفتوح المصدر للمصفوفات مخصص للتعلم الآلي، أصدرته Apple ML Research في ديسمبر 2023 بموجب ترخيص MIT. تم تصميمه خصيصاً لشرائح Apple Silicon (M1 و M2 و M3 و M4 و M5) ويتمحور حول ميزة معمارية أساسية: الذاكرة الموحدة من Apple، حيث تتشارك وحدة المعالجة المركزية (CPU) ووحدة معالجة الرسومات (GPU) في نفس التجمع الفعلي لذاكرة الوصول العشوائي (RAM). يقضي هذا التصميم على عنق الزجاجة المتمثل في نسخ البيانات والذي يبطئ أطر العمل مثل PyTorch عند نقل الموترات (tensors) بين أنواع المعالجات. والنتيجة هي أن MLX يمكنه تشغيل النماذج اللغوية الكبيرة بشكل أسرع على أجهزة MacBook مقارنة بمعظم البدائل الأخرى، دون الحاجة إلى أي اشتراك سحابي مدفوع أو واجهة برمجة تطبيقات (API) خارجية.
يوفر إطار العمل واجهات برمجة تطبيقات (APIs) للغات Python و C++ و C و Swift. تعكس واجهة Python اصطلاحات NumPy؛ بينما تتبع طبقات الشبكات العصبية والمُحسِّنات (optimizers) عالية المستوى أساليب PyTorch، مما يتيح للباحثين المعتادين على أي منهما تعلمه بسرعة. تتولى حزمة MLX-LM المرافقة، والمخصصة للاستدلال وضبط النماذج اللغوية الكبيرة (LLM)، مهام تنزيل النماذج من Hugging Face، والتكميم (quantization) (4-bit و 8-bit و bf16)، والتخزين المؤقت للمطالبات (prompt caching)، والتخزين المؤقت الدوار للقيم والمفاتيح (rotating key-value cache) لرفع كفاءة الذاكرة، بالإضافة إلى الضبط الدقيق باستخدام LoRA و QLoRA، والاستدلال الموزع عبر أجهزة Mac متعددة. يتم التثبيت بأمر pip واحد. يستضيف مجتمع MLX Community على Hugging Face آلاف النماذج المكممة مسبقاً والجاهزة للتشغيل. اعتباراً من أبريل 2026، وصل MLX إلى الإصدار 0.31.2 مع 73 إصداراً وصيانة نشطة من قبل مهندسي Apple.
ما يفعله MLX فعلياً في مايو 2026
يُعد MLX محرك الاستدلال والتدريب لأعباء عمل التعلم الآلي المحلية على أجهزة Mac. على جانب الاستدلال، يتيح لك MLX-LM سحب أي نموذج من Hugging Face، وتكميمه أثناء التشغيل، وتشغيل واجهة دردشة مباشرة من الجهاز الطرفي (terminal). لا توجد خوادم لتهيئتها، ولا حاويات Docker، ولا حزمة برامج تشغيل لوحدة معالجة الرسومات (GPU). على شريحة M3 Max بذاكرة موحدة سعة 96GB، يمكنك تحميل نموذج Llama 70B بتنسيق 4-bit وإنشاء 10-15 رمزاً (tokens) في الثانية. وعلى شريحة M4 Max التي تُشغل نموذج Mixture-of-Experts بحجم 35B، تُظهر المعايير الواقعية حوالي 130 رمزاً في الثانية. دفعت شريحة M5 وقت الوصول إلى الرمز الأول (time-to-first-token) إلى أقل من 10 ثوانٍ للبنى الكثيفة بحجم 14B، وأقل من 3 ثوانٍ لنماذج MoE بحجم 30B، مع توفير مسرعات الشبكات العصبية الجديدة لوحدة معالجة الرسومات (GPU Neural Accelerators) من Apple لدوائر مخصصة لضرب المصفوفات والتي يتعامل معها MLX مباشرة عبر Metal 4.
على جانب التدريب، يدعم MLX الضبط الدقيق باستخدام LoRA و QLoRA عبر أمر واحد. ما عليك سوى تحديد نموذجك، ومجموعة بياناتك بتنسيق JSONL، ومدة التدريب. يستغرق تدريب نموذج Mistral-7B على 5,000 مثال حوالي 45-90 دقيقة على شريحة M2 Max، مع بلوغ ذروة استهلاك الذاكرة حوالي 7GB بالدقة الكاملة. يؤدي التدريب على نموذج مكمم بتنسيق 4-bit إلى تقليل استهلاك الذاكرة بحوالي 3.5x مع فقدان ضئيل جداً في الدقة. يمكن بعد ذلك تحميل المحولات (adapters) إلى Hugging Face ومشاركتها. يتوفر التدريب الموزع عبر mx.distributed للفرق التي تمتلك أجهزة Apple Silicon متعددة.
تعني الحوسبة الكسولة (Lazy computation) أن المصفوفات لا يتم تقييمها إلا عند الحاجة إلى النتائج. يُعاد بناء الرسوم البيانية للحوسبة الديناميكية عندما تتغير أشكال الإدخال، مما يتجنب إعادة التجميع البطيئة أثناء تكرار الأبحاث. تُعد واجهة برمجة تطبيقات Swift مستقرة بما يكفي لدرجة أن مطوري تطبيقات iOS و macOS يقومون بتضمين النماذج مباشرة في التطبيقات دون الاعتماد على السحابة. في مؤتمر WWDC 2025، خصصت Apple ثلاث جلسات كاملة لـ MLX، مما يضعه كإطار العمل المفضل لاستدلال النماذج اللغوية الكبيرة (LLM) على Apple Silicon. كما أن إعلان مارس 2026 عن انتقال Ollama إلى MLX كمحرك استدلال خاص به، مما يوفر توليد استجابة أسرع بمقدار 2x في نسخته التجريبية، أثبت أن إطار العمل يمثل بنية تحتية جاهزة للإنتاج.
موقع MLX مقارنة بـ llama.cpp و PyTorch MPS
MLX مقابل llama.cpp: يستخدم llama.cpp تنسيق GGUF ويعمل على وحدات المعالجة المركزية (CPU) و Metal و Vulkan و CUDA وخلفيات أخرى. إنه حقاً متعدد المنصات: Windows و Linux و macOS و Android. بينما يعمل MLX فقط على macOS. من حيث الإنتاجية الخام للنماذج التي تقل عن 14B معلمة، يتفوق MLX بوضوح: تحقق شريحة M2 Ultra مع نموذج Qwen-2.5 7B حوالي 230 tok/s في MLX مقابل 150 tok/s في llama.cpp، أي بميزة تصل إلى 53%. وعلى شريحة M4 Max مع نموذج بحجم 0.6B، يسجل MLX سرعة 525 tok/s مقابل 281 tok/s لـ llama.cpp. أما عند 27B+ معلمة حيث يصبح عرض النطاق الترددي للذاكرة هو عنق الزجاجة، يتقارب كلا الإطارين ويصبح الأداء متساوياً تقريباً.
الفرق المعماري الجوهري يكمن في التعامل مع الذاكرة. يستخدم MLX ذاكرة موحدة حقيقية خالية من النسخ (zero-copy) من خلال التقييم الكسول. بينما يستخدم llama.cpp تقسيم الطبقات بين وحدة المعالجة المركزية ووحدة معالجة الرسومات (CPU+GPU) عبر علامة -ngl، مما يعني أنه يمكنك تحميل نموذج أكبر من ذاكرة وحدة معالجة الرسومات الخاصة بك عن طريق نقل الطبقات الزائدة إلى ذاكرة الوصول العشوائي (RAM) لوحدة المعالجة المركزية. لا يمتلك MLX قدرة مماثلة: إذا كان النموذج لا يتسع في الذاكرة الموحدة، فلن يعمل. يدعم llama.cpp أيضاً أكثر من 10 تنسيقات تكميم (Q2_K و Q4_0 و Q8_0 ومتغيرات IQ) مقابل أربعة فقط في MLX. كما أن llama.cpp مخصص للاستدلال فقط؛ بينما يتضمن MLX الضبط الدقيق باستخدام LoRA على الجهاز بشكل أصلي. بالنسبة للمستخدمين على أنظمة Windows أو Linux، أو أولئك الذين يحتاجون إلى تحميل نماذج قريبة من سقف الذاكرة لديهم أو تتجاوزه، يُعد llama.cpp الخيار العملي. أما بالنسبة للاستدلال المخصص لأجهزة Mac حيث تهم الإنتاجية وتتناسب النماذج بشكل مريح مع الذاكرة، فإن MLX هو الفائز.
MLX مقابل خلفية PyTorch MPS: تتيح خلفية Metal Performance Shaders في PyTorch لمستخدمي Mac تشغيل كود PyTorch الحالي على وحدة معالجة الرسومات من Apple. بالنسبة لتوليد رموز النماذج اللغوية، الفجوة كبيرة: يحقق MLX حوالي 230 tok/s على شريحة M2 Ultra لاستدلال النماذج اللغوية الكبيرة (LLM)؛ بينما يحقق PyTorch MPS حوالي 7-9 tok/s. هذا ليس خطأ مطبعياً. ينبع الاختلاف من بنية الذاكرة الموحدة: لا يزال PyTorch ينسخ الموترات (tensors) بين وحدة المعالجة المركزية ووحدة معالجة الرسومات بالطريقة التقليدية، مما يتسبب في عبء إضافي يتجنبه MLX تماماً. وجد أحد المعايير على شريحة M3 Pro أن PyTorch MPS أسرع بمقدار 5.5x من MLX في ضرب المصفوفات الخام (128x128، 10K تكرار)، مما يوضح أن ميزة MLX مُحسّنة خصيصاً لأعباء عمل النماذج اللغوية الكبيرة (LLM) الشاملة، وليس لكل عملية أساسية. إذا كان لديك مسار تدريب PyTorch كبير وحالي وترغب في تشغيله على Mac دون إعادة كتابته، فإن PyTorch MPS هو مسار التوافق الأنسب. أما إذا كنت تبدأ من الصفر وتريد أفضل أداء للنماذج اللغوية الكبيرة على Mac، فإن MLX هو الأساس الصحيح.
"هذا مثير للإعجاب للغاية، حجم التطور التقني هنا يغير تماماً طريقة تفكيري بشأن تطبيقي القادم." - ناثان تاربرت، مطور، سلسلة نقاشات جلسة WWDC 2025 على dev.to، يونيو 2025
"عندما قمت بتشغيل هذا الكود لأول مرة ورأيت النص يظهر على شاشتي، والذي تم إنشاؤه بالكامل على حاسوبي المحمول دون أي استدعاءات لواجهة برمجة التطبيقات (API)، شعرت وكأنها ثورة صغيرة. أصبح جهاز MacBook الخاص بي فجأة قوة ذكاء اصطناعي قائمة بذاتها." - شهادة مطور، willitrunai.com، 2025
كيف يبدو واقع التطوير اليومي
البدء سريع حقاً. قم بتثبيت MLX-LM باستخدام pip في بيئة افتراضية، ثم قم بتشغيل أمر واحد لبدء جلسة دردشة توجه إلى أي مسار نموذج على Hugging Face. يتم تنزيل النموذج وتكميمه تلقائياً. يمكنك التبديل من Mistral-7B إلى Llama-3-70B عن طريق تغيير علامة (flag). يعني التخزين المؤقت للمطالبات (Prompt caching) أن الجلسات المتكررة ذات السياق الطويل لا تعيد معالجة السياق الكامل في كل دور، وهو أمر مهم لوكلاء البرمجة الذين يحتفظون بمطالبات نظام طويلة.
يتبع الضبط الدقيق نمطاً مشابهاً. قم بإعداد بياناتك بتنسيق JSONL، وقم بتشغيل mlx_lm.lora مع النموذج ومسار البيانات وعدد التكرارات. لا حاجة لتثبيت برامج تشغيل CUDA، ولا تكوين متغيرات البيئة، ولا مصفوفة توافق للتنقل فيها. وصف أحد المطورين عملية الضبط الدقيق لنموذج Mistral-7B لإنشاء وثائق واجهة برمجة التطبيقات (API) بتنسيق معين، حيث استغرقت العملية بأكملها 45 دقيقة على جهاز MacBook Pro مع ذروة استهلاك للذاكرة بلغت حوالي 6.8GB. يؤدي التدريب على نموذج أساسي مكمم بتنسيق 4-bit إلى تقليل الذاكرة بحوالي 3.5x، مما يجعل من الممكن ضبط نماذج بحجم 13B على أنظمة بذاكرة 24GB.
يستمر التكامل مع الأدوات الأخرى في التحسن. يدعم LM Studio الآن MLX كخلفية، مما يمنح المستخدمين واجهة رسومية فوق استدلال MLX. أعلنت Ollama في مارس 2026 أنها انتقلت إلى MLX كمحرك استدلال خاص بها على Apple Silicon، مما يمنح مستخدمي Ollama توليداً أسرع بمقدار 2x دون أي تغيير في سير العمل. يستضيف مجتمع MLX على Hugging Face آلاف النماذج المكممة مسبقاً بتنسيق safetensors، والتي تغطي معظم البنى التي كانت ستظهر بخلاف ذلك أولاً في GGUF. غالباً ما يقوم المستخدمون الذين يرغبون في تشغيل النماذج في واجهة مستخدم رسومية (GUI) جنباً إلى جنب مع البحث في الويب أو مسارات عمل المستندات بإقران استدلال MLX مع طبقة REST API الخاصة بـ Ollama، متقبلين عبئاً إضافياً متواضعاً في الإنتاجية مقابل راحة نقاط النهاية الموحدة.
كان الإطلاق العام في ديسمبر 2023 بارزاً بالنسبة لشركة Apple. أصدرت الشركة MLX على GitHub دون مؤتمر صحفي في 5 ديسمبر 2023، في نفس الأسبوع الذي أطلقت فيه Google نموذج Gemini. ذهبت التغطية الصحفية التقنية بالكامل تقريباً إلى Gemini. في غضون أيام، اكتشف مجتمع التعلم الآلي MLX وأظهرت المعايير الأولية أداءً أسرع بنسبة 30% من PyTorch لبعض أعباء العمل على أجهزة Apple. تم قراءة ترخيص MIT كإشارة قوية: لم تكن Apple تحاول السيطرة على النظام البيئي بالطريقة التي ربطت بها CUDA عالم وحدات معالجة الرسومات (GPU) بشركة NVIDIA. أدى هذا الإطار إلى تسريع التبني بين الباحثين الذين كانوا متشككين في جدية Apple في مجال الذكاء الاصطناعي.
لمن تم بناء MLX
يُعد MLX الخيار الصحيح لباحثي ومطوري التعلم الآلي المعتمدين على أجهزة Mac والذين يرغبون في تشغيل أو ضبط النماذج اللغوية الكبيرة دون تكاليف سحابية أو إرسال البيانات خارج الجهاز. سيجد علماء البيانات المحبطون من سرعات استدلال PyTorch MPS أن MLX يمثل ترقية جوهرية. يمتلك المحترفون الذين يركزون على الخصوصية والذين لا يمكنهم إرسال البيانات إلى واجهات برمجة تطبيقات (APIs) خارجية سبباً واضحاً لتبنيه: يبقى كل الاستدلال والتدريب على الجهاز المحلي. يمكن لمطوري Swift الذين يبنون تطبيقات iOS أو macOS بنماذج مضمنة استخدام واجهة برمجة تطبيقات Swift الخاصة بـ MLX دون الحاجة إلى طبقة مترجم Python. يجب على الفرق التي تبني على نظام Apple البيئي على المدى الطويل أن تتعامل مع MLX كتبعية استراتيجية، نظراً لتحسين أجهزة M5 المتعمد من Apple لأعباء عمل MLX.
يجب على المستخدمين الذين يرغبون في استكشاف مجموعة واسعة من النماذج مفتوحة الأوزان عبر منصات متعددة التحقق أيضاً من llama.cpp و Llama مباشرة، نظراً لأن نظام GGUF البيئي الخاص بـ llama.cpp يوفر توفراً أوسع للنماذج للبنى التي تم إصدارها حديثاً. تكمل الأداتان بعضهما البعض اعتماداً على المهمة.
ما لا يمثله MLX
MLX ليس إطار عمل متعدد المنصات. إذا كان فريقك يضم مطوري Windows أو Linux، أو إذا كنت تنشر نماذج على خوادم Linux، فلن يتمكن MLX من مرافقتك هناك. يعمل llama.cpp على جميع المنصات الثلاث بنفس ملفات النماذج. لن يتم نقل نماذج safetensors الخاصة بـ MLX.
لا يتعامل MLX مع النماذج التي تتجاوز الذاكرة الموحدة. لا يوجد نقل للطبقات الزائدة إلى وحدة المعالجة المركزية (CPU) بأسلوب -ngl. إذا كان جهاز Mac الخاص بك يحتوي على ذاكرة موحدة سعة 24GB وأردت تحميل نموذج بحجم 32B بدقة 8-bit، فسيرفض MLX ذلك. بينما يمكن لـ llama.cpp تقسيم هذا النموذج بين وحدة المعالجة المركزية ووحدة معالجة الرسومات. يهم هذا الأمر المستخدمين الذين يمتلكون نماذج M1 أو M2 الأساسية (8-16GB) والذين يرغبون في تشغيل أي شيء أكبر من 7B بجودة لائقة.
يُعد أداء التعبئة المسبقة (Prefill) نقطة ضعف حقيقية. بالنسبة لتبادلات الدردشة القصيرة، يمكن أن تتفوق المعالجة الأبطأ للمطالبات على ميزة التوليد في MLX. أبلغت مطالبة مكونة من 650 رمزاً على شريحة M1 Max عن قضاء 94% من الوقت في التعبئة المسبقة، مما أدى إلى انهيار الإنتاجية الفعالة إلى ما دون llama.cpp. تفتقر شرائح M1 و M2 إلى الدعم الأصلي لـ bf16، مما يضاعف المشكلة على الأجهزة القديمة.
MLX ليس منصة لخدمة النماذج اللغوية الكبيرة (LLM) في بيئة الإنتاج. لا يوجد تجميع مدمج للطلبات (request batching)، أو تحديد للمعدل (rate limiting)، أو إدارة لجلسات المستخدمين المتعددين. لا يزال النظام البيئي للخوادم المستندة إلى MLX (مثل mlx-lm server و Rapid-MLX و vLLM-MLX و oMLX) مجزأً. بالنسبة لمطور واحد على جهازه الخاص، هذا جيد. أما بالنسبة للفرق التي تنشر نقطة نهاية داخلية مشتركة، فإن الأدوات لم تنضج بعد.
أخيراً، MLX ليس أداة للمبتدئين. لا توجد واجهة رسومية من Apple مباشرة. نقطة الدخول الأساسية هي جهاز طرفي (terminal) لـ Python. يجب على المستخدمين الذين يرغبون في تجربة واجهة مستخدم رسومية (GUI) مصقولة البدء باستخدام LM Studio أو Ollama مع واجهة أمامية رسومية، والتي تستخدم الآن MLX في الخلفية على أي حال على أجهزة Apple Silicon دون مطالبتك بالتفاعل مع إطار العمل مباشرة.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن MLX.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ MLX.

Run Open Source AI Models Locally: Battle-Tested Guide

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
