
DeepSpeed هي مكتبة تحسين التعلم العميق مفتوحة المصدر من Microsoft لتدريب وتشغيل النماذج اللغوية الكبيرة عبر وحدات معالجة رسومات (GPUs) متعددة. وهي تشغل BLOOM 176B و Megatron-Turing 530B وعددًا لا يحصى من مسارات الضبط الدقيق عبر مُحسِّن الذاكرة ZeRO الخاص بها.
DeepSpeed هي مكتبة لتحسين التعلم العميق مبنية على PyTorch، طورتها Microsoft وأصدرتها للجمهور في عام 2020 بموجب ترخيص Apache 2.0. إنها تحل مشكلة واحدة محددة وصعبة: إتاحة إمكانية تدريب وتشغيل النماذج اللغوية الكبيرة جدًا التي لا يمكن استيعابها في وحدة معالجة رسومات (GPU) واحدة، أو عقدة واحدة، دون مطالبة الفرق ببناء أنظمة موزعة مخصصة من الصفر. مع أكثر من 42,000 نجمة على GitHub وتاريخ إصدارات يمتد إلى الإصدار v0.18.9 (مارس 2026)، فهي إطار عمل التدريب الموزع للأغراض العامة الأكثر اعتمادًا في مجال تعلم الآلة مفتوح المصدر.
التقنية الرائدة في DeepSpeed هي مُحسِّن ZeRO (Zero Redundancy Optimizer)، والذي يقضي على تكرار الذاكرة الذي يحدث عادةً عند تكرار حالات النموذج عبر وحدات معالجة الرسومات المتوازية البيانات. تقوم المرحلة الأولى (ZeRO Stage 1) بتجزئة حالات المُحسِّن عبر وحدات معالجة الرسومات، وتضيف المرحلة الثانية (Stage 2) تجزئة التدرج (gradient sharding)، بينما تقوم المرحلة الثالثة (Stage 3) بتجزئة معلمات النموذج نفسها. يوسع ZeRO-Infinity ذلك من خلال تفريغ البيانات (offloading) إلى ذاكرة الوصول العشوائي لوحدة المعالجة المركزية (CPU RAM) ومحركات أقراص NVMe SSD، مما يتيح الضبط الدقيق للنماذج التي تحتوي على تريليون معلمة على أجهزة كانت لتعجز عن ذلك لولا هذه التقنية. وبعيدًا عن ZeRO، توفر DeepSpeed التوازي في خطوط الأنابيب (pipeline parallelism)، والتوازي التلقائي للموترات (AutoTP، الذي تم إطلاقه في مارس 2025)، وتدريب Mixture of Experts، وتوازي التسلسل لسياقات الرموز التي تصل إلى عدة ملايين، ومحرك استدلال مع دمج النواة (kernel fusion) والتكميم (quantization). وتتكامل بشكل أصلي مع Hugging Face Transformers و Accelerate، و PyTorch Lightning، وحزمة EleutherAI GPT-NeoX.
ما الذي تفعله DeepSpeed فعليًا في مايو 2026
DeepSpeed هي مكتبة Python تقوم بتثبيتها جنبًا إلى جنب مع PyTorch. تمرر إليها ملف تكوين JSON (ds_config.json) يحدد مرحلة ZeRO التي يجب استخدامها، وما إذا كان يجب تفريغ حالات المُحسِّن أو المعلمات إلى وحدة المعالجة المركزية (CPU)، وما إذا كان يجب استخدام الدقة المختلطة، وعشرات من معلمات الضبط الأخرى. ثم تقوم بتغليف حلقة التدريب الخاصة بك بمحرك DeepSpeed. في تلك المرحلة، تتولى DeepSpeed تجزئة المعلمات عبر وحدات معالجة الرسومات، واتصال التدرج، وإدارة الذاكرة، وحفظ نقاط الفحص تلقائيًا.
مُحسِّن ZeRO هو قلب النظام. قبل ZeRO، كان تدريب نموذج بحجم 13B بتنسيق float16 يتطلب حوالي 26GB لكل وحدة معالجة رسومات لأوزان النموذج فقط، بالإضافة إلى حالات المُحسِّن (تضيف تقديرات العزم لـ Adam ما يقرب من 3 أضعاف حجم النموذج) والتدرجات، مما يدفع إجمالي متطلبات الذاكرة لكل وحدة معالجة رسومات إلى 80GB أو أكثر لنسخة واحدة. تقوم ZeRO Stage 3 بتجزئة كل هذا عبر N من وحدات معالجة الرسومات، لذا فإن نموذج 13B عبر 8 وحدات A100s بسعة 40GB يحتاج إلى حوالي 5GB لكل وحدة معالجة رسومات للمعلمات، مما يوفر مساحة لحجم الدفعة (batch size) والتنشيطات (activations). هذه هي الآلية التي مكنت الفرق ذات الميزانيات المتواضعة لوحدات معالجة الرسومات من تشغيل مهام التدريب المسبق والضبط الدقيق التي كانت تتطلب سابقًا بنية تحتية متخصصة.
أثبت ZeRO-Infinity، الذي تم الإعلان عنه في مايو 2021، إمكانية تدريب نموذج يحتوي على 32 تريليون معلمة على 32 وحدة معالجة رسومات عن طريق تفريغ البيانات إلى NVMe. يظل هذا هو الحد الأقصى النظري لما يمكن للنظام تنسيقه. من الناحية العملية، يقوم معظم مستخدمي الإنتاج بتشغيل ZeRO-2 أو ZeRO-3 مع تفريغ وحدة المعالجة المركزية (CPU offloading) على مجموعات تتراوح من 8 إلى 256 وحدة معالجة رسومات للنماذج في نطاق 7B-70B.
تشمل الإضافات الحديثة DeepCompile (أبريل 2025)، والذي يطبق تحسينات على مستوى المترجم (compiler-level) لرسوم التدريب الموزعة؛ و Arctic Long Sequence Training (يونيو 2025) لدعم تسلسل الرموز الذي يصل إلى عدة ملايين؛ و AutoTP للتوازي التلقائي للموترات مع نماذج Hugging Face (مارس 2025)؛ ومحرك التفريغ الخالي من التوقف ZenFlow (أغسطس 2025). حصل عمل SuperOffload على إشادة شرفية في ASPLOS 2026، وهو المؤتمر الرائد في مجال الأنظمة.
كان DeepSpeed-Chat، الذي تم إصداره في 12 أبريل 2023، علامة فارقة: مسار RLHF شامل يغطي الضبط الدقيق الخاضع للإشراف، وتدريب نموذج المكافأة، و PPO، كل ذلك في برنامج نصي واحد. قام النظام بتدريب نموذج 13B في 1.25 ساعة على وحدة معالجة رسومات A6000 واحدة ونموذج 175B في يوم واحد على 64 وحدة معالجة رسومات، مدعيًا إنتاجية تبلغ 15 ضعفًا مقارنة بـ trlX و trl. جذب موضوع الإطلاق على Hacker News في أبريل 2023 مئات التعليقات التي تناقش ما إذا كان بإمكان RLHF مفتوح المصدر الوصول بشكل واقعي إلى جودة GPT-4:
"لن يصل الضبط الدقيق إلى جودة GPT-4 بدون نماذج أساسية أكبر وتحسينات مكثفة." -- valine، Hacker News، 12 أبريل 2023
كان هذا النقاش استشرافيًا. فقد خفض DeepSpeed-Chat حاجز تدريب RLHF بدرجة كافية بحيث تمكنت الفرق التي كانت مستبعدة سابقًا بسبب التكلفة من إجراء التجارب. لقد ضاقت الفجوة مع النماذج الرائدة بشكل كبير منذ عام 2023، ويرجع ذلك جزئيًا إلى أدوات البنية التحتية مثل هذه.
موقع DeepSpeed مقارنة بـ PyTorch FSDP و Megatron-LM
لا تعمل DeepSpeed في فراغ. يتنافس إطاران للعمل على نفس أعباء عمل التدريب، وتعتمد الإجابة الصادقة حول أيهما يجب استخدامه بشكل كبير على حجم النموذج، والأجهزة، ومدى إلمام الفريق.
تم دمج PyTorch FSDP (Fully Sharded Data Parallel) في نواة PyTorch بدءًا من الإصدار 1.12 وهو ينفذ تجزئة المعلمات بأسلوب ZeRO بشكل أصلي داخل وقت التشغيل (runtime). تتمثل ميزة FSDP في البساطة والإنتاجية الخام على النطاق المتوسط. تُظهر المعايير المستقلة أن FSDP يعمل بشكل أسرع بما يصل إلى 5 أضعاف لكل تكرار مقارنة بـ DeepSpeed ZeRO-3 للنماذج في نطاق 100M-1B، لأن تكامل PyTorch الأصلي يتجنب العبء الإضافي على مستوى Python ويستخدم مسارات reduce-scatter المدمجة والمحسنة. يعيش تكوين FSDP في كود Python بدون ملف JSON خارجي. المقايضة العملية: لا يمكن لـ FSDP تفريغ البيانات إلى NVMe، لذا فهو مقيد بإجمالي ذاكرة الوصول العشوائي لوحدة معالجة الرسومات ووحدة المعالجة المركزية (GPU+CPU RAM). بالنسبة للنماذج التي تتناسب مع هذا النطاق (أقل من 30B تقريبًا بتنسيق float16 على عقدة مجهزة جيدًا)، أصبح FSDP بشكل متزايد الخيار الافتراضي في Hugging Face Trainer و TorchTitan. تتفوق DeepSpeed عندما تكون هناك حاجة إلى تفريغ NVMe أو ذاكرة من فئة ZeRO-Infinity، وعند المعلمات التي تزيد عن 10B حيث يصبح تنفيذ ZeRO-3 الناضج والتوازي في خطوط الأنابيب تنافسيًا مرة أخرى.
Megatron-LM هو إطار عمل بحثي من NVIDIA لتدريب نماذج المحولات (transformer models) على نطاق واسع للغاية باستخدام أنوية توازي الموترات (tensor parallelism kernels) المضبوطة يدويًا. يعد تنفيذ توازي الموترات (TP) في Megatron-LM هو الأكثر تحسينًا لأجهزة NVIDIA A100/H100 المزودة بـ NVLink. تم بناء بنيات النماذج الخاصة به (GPT، BERT، T5) خصيصًا لـ TP؛ حيث يتم تقسيم كل رأس انتباه (attention head) ومصفوفة أوزان MLP عبر وحدات معالجة الرسومات باستخدام أنوية CUDA مخصصة. يتمثل القيد في الارتباط الوثيق بالبنية: يتطلب تشغيل بنية نموذج جديدة من خلال Megatron جهدًا هندسيًا كبيرًا. على النقيض من ذلك، يتعامل AutoTP من DeepSpeed مع توازي الموترات بشكل أكثر تلقائية لنماذج Hugging Face. والأهم من ذلك، أن Megatron-LM و DeepSpeed ليسا منافسين صارمين: فقد استخدم نموذج Megatron-Turing NLG 530B (أكبر عملية تدريب لنموذج كثيف موثقة علنًا) Megatron-LM لتوازي الموترات داخل العقد و DeepSpeed ZeRO لتوازي البيانات عبر العقد. غالبًا ما يجمع المستخدمون الذين يحتاجون إلى الحد الأقصى المطلق للإنتاجية الخاصة بـ NVIDIA بين كليهما.
إذا كنت تستخدم Anyscale أو Ray Train لأعباء العمل الموزعة، فإن DeepSpeed تتكامل عبر واجهة Ray-DeepSpeed، والتي عرضتها الفرق في لقاء مشترك في أكتوبر 2025. لتتبع التجارب وإصدارات النماذج جنبًا إلى جنب مع التدريب، تقوم الفرق بإقران DeepSpeed مع MLflow. لخدمة الاستدلال للنماذج المدربة، يعد vLLM هو الخيار السائد، على الرغم من أن محرك الاستدلال الخاص بـ DeepSpeed يظل تنافسيًا لمعالجة الدفعات دون اتصال بالإنترنت (offline batch processing). تعد نماذج سلسلة LLaMA المضبوطة بدقة واحدة من أكثر أعباء عمل DeepSpeed شيوعًا في المجتمع مفتوح المصدر.
كيف يبدو واقع سير عمل التدريب
الفجوة بين الوثائق والتجربة اليومية لتشغيل DeepSpeed حقيقية، وأي شخص يكتب عن هذه الأداة بصدق يجب أن يتطرق إليها.
يتضمن إعداد عملية تدريب ZeRO-3 من الصفر كتابة ملف ds_config.json يحتوي على عشرات المعلمات: مرحلة ZeRO، وجهاز التفريغ (CPU أو NVMe)، و allgather bucket size، و reduce bucket size، و stage3_gather_16bit_weights_on_model_save، و overlap_comm، وما إلى ذلك. أسماء المعلمات ليست بديهية دائمًا. فاصلة في غير محلها، أو حقل مكتوب بشكل خاطئ، أو عدم تطابق بين نوع المُحسِّن في التكوين والمُحسِّن الذي تم إنشاؤه في Python سيمنع بدء التدريب بصمت أو، الأسوأ من ذلك، سيبدأ التدريب ثم يتعطل في منتصف الحقبة (mid-epoch). هذه هي الفئة الأكثر شيوعًا لطلبات الدعم في مشكلات DeepSpeed على GitHub.
يعد تراجع الأداء عبر إصدارات المكتبة مصدر قلق موثق. تسجل المشكلة رقم 7499 على GitHub تراجعًا بنسبة 10% في إنتاجية التدريب في ZeRO-3 بين الإصدار v0.13.1 والإصدار v0.15.4 وصولاً إلى v0.16.9 على إعدادات 8x A100، مع عدم تأثر تكوينات ZeRO-1 و ZeRO-2:
"بعد ترقية DeepSpeed، عند استخدام تكوين DeepSpeed Zero3، تدهور أداء التدريب بنحو 10% مقارنة بالإصدار 0.13.1." -- frozenleaves، مشكلة GitHub deepspeedai/DeepSpeed رقم 7499، 2024
هذا النوع من التراجع يمثل مشكلة خطيرة لمسارات الإنتاج التي تعتمد على إنتاجية مستقرة. التخفيف الذي تستخدمه معظم الفرق هو تثبيت التبعيات (dependency pinning)، ولكن هذا يخلق عبء صيانة خاص به.
يتطلب التوازي في خطوط الأنابيب (PP) في DeepSpeed تعديل كود بنية النموذج لتحديد حدود الطبقة بشكل صريح. هذا ليس بالأمر الهين لأي شيء لا يمثل محولًا قياسيًا بأسلوب GPT. على النقيض من ذلك، فإن ZeRO-3 غير مقيد بالبنية (architecture-agnostic)، ولهذا السبب تلجأ معظم الفرق إلى ZeRO-3 + توازي البيانات قبل التفكير في PP.
يمكن أن يكون استخدام وحدة معالجة الرسومات مع ZeRO-3 على النماذج الصغيرة أو المجموعات الصغيرة ضعيفًا. توثق مناقشة GitHub رقم 5488 فشل عمليات all-gathers المجزأة في التداخل مع الحوسبة في عمليات التشغيل متعددة العقد مع النماذج الأصغر. يتمثل العلاج عادةً في استخدام ZeRO-2 أو التبديل إلى FSDP لهذا النطاق، ولكن تشخيص مشكلة الاستخدام في المقام الأول يتطلب أدوات التنميط (profiling tools) مثل Nsight و PyTorch Profiler التي لها منحنيات تعلم خاصة بها.
عندما تعمل بشكل جيد، فهي تحويلية حقًا. يعد تشغيل نموذج يحتوي على 70B معلمة على 8 وحدات معالجة رسومات A100-80GB باستخدام ZeRO-3 قدرة مختلفة نوعيًا عن أي شيء كان متاحًا للباحثين قبل خمس سنوات. الاحتكاك موجود، لكنه يتناسب مع حجم ما تتيحه الأداة.
لمن تم بناء DeepSpeed
تم بناء DeepSpeed لمهندسي وباحثي تعلم الآلة الذين يحتاجون إلى تدريب أو ضبط دقيق للنماذج اللغوية الكبيرة (7B+) على بنية تحتية متعددة وحدات معالجة الرسومات. يتمتع المستخدم النموذجي بمعرفة عملية بـ PyTorch، وقد وصل إلى حدود ذاكرة وحدة معالجة الرسومات من خلال التدريب المتوازي للبيانات البسيط، وهو على استعداد لاستثمار يوم أو يومين في التكوين وتصحيح الأخطاء لفتح إمكانية التدريب على نطاق كان مستحيلاً لولا ذلك.
الفرق في المؤسسات البحثية (استخدمتها EleutherAI لـ GPT-NeoX، و BigScience لـ BLOOM)، وشركات التكنولوجيا الكبيرة (وثقت LinkedIn استخدام ZeRO++ لتقطير النماذج اللغوية الكبيرة (LLM distillation) لأنظمة التوصية في نوفمبر 2025)، والشركات الناشئة الممولة جيدًا التي تقوم بضبط التعليمات، أو RLHF، أو التدريب المسبق، كلها تندرج في هذه الفئة. يعني تكامل Hugging Face Accelerate أنه يمكنك إضافة DeepSpeed إلى العديد من نصوص التدريب الحالية بأقل قدر من التغييرات في الكود، مما يوسع نطاق إمكانية الوصول إلى حد ما.
ما لا تمثله DeepSpeed
لا تعد DeepSpeed خيارًا جيدًا للنماذج التي تقل عن 1B معلمة. في هذا النطاق، يكون FSDP أسهل في التكوين، وأسرع من الناحية العملية، ومدمجًا في PyTorch. إن العبء الإضافي لإعداد ds_config.json وخطر التراجعات المرتبطة بالإصدار غير مبرر عندما يتناسب النموذج بالفعل مع وحدتين أو ثلاث وحدات معالجة رسومات قياسية.
إنها ليست خدمة مستضافة أو منصة سحابية. لا يوجد DeepSpeed SaaS. أنت من يحضر قوة الحوسبة الخاصة بك. تعمل مجموعات Azure أو AWS أو GCP أو المجموعات المحلية (on-premise) جميعها، ولكن المسؤولية التشغيلية تقع على عاتقك بالكامل.
إنها ليست نظام خدمة استدلال لحركة مرور API المباشرة. تم تصميم محرك الاستدلال الخاص بـ DeepSpeed لاستدلال الدفعات المحسن للإنتاجية، وليس لخدمة الطلبات ذات زمن الوصول المنخفض. بالنسبة لواجهات برمجة تطبيقات الاستدلال في الإنتاج، يعد vLLM هو الخيار السائد. يعد DeepSpeed Inference مفيدًا لمهام الدفعات دون اتصال بالإنترنت حيث لا تكون تكلفة البنية التحتية للتجميع المستمر مبررة.
إنها ليست أداة صديقة للمبتدئين. الوثائق شاملة ولكنها تفترض الإلمام بمفاهيم الأنظمة الموزعة (NCCL، والعمليات الجماعية، والتسلسلات الهرمية للذاكرة). من الأفضل للباحثين الجدد في مجال التدريب الموزع البدء بواجهة Hugging Face Accelerate الأبسط، ثم إضافة تكوين DeepSpeed بمجرد فهمهم لمعنى المعلمات.
كما أنها ليست بديلاً مباشرًا لـ Megatron-LM على أجهزة NVIDIA على نطاق واسع للغاية. بالنسبة للنماذج الكثيفة التي تزيد عن 500B حيث تكون إنتاجية FLOP هي القيد الملزم، يصعب التغلب على أنوية توازي الموترات الخاصة بـ Megatron-LM. تتفوق DeepSpeed عندما تكون مرونة الذاكرة وقابلية النقل عبر الأجهزة أكثر أهمية من ذروة الإنتاجية.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن DeepSpeed.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ DeepSpeed.

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Run Open Source AI Models Locally: Battle-Tested Guide

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
