تخطَّ إلى المحتوى الرئيسي
Vantaige

دليل اختيار وشراء العتاد

الدليل الشامل لاختيار GPU للنماذج اللغوية المحلية

تجاهل مقاييس الألعاب التقليدية. اكتشف لماذا يحدد النطاق الترددي للذاكرة سرعة توليد الكلمات، وما هي سعة VRAM المناسبة لكل نموذج، وكيف تقارن أجهزة Apple Silicon بحواسيب Nvidia.

1. القاعدة الذهبية لعتاد الذكاء الاصطناعي: النطاق الترددي قبل المعالجة

في استدلال نماذج اللغة التوليدية، نادرًا ما يكون عنق الزجاجة هو قوة المعالجة الخام (TFLOPS). بل هو دائمًا النطاق الترددي للذاكرة: السرعة التي يمكن بها نقل أوزان النموذج من ذاكرة VRAM إلى أنوية الحساب.

أثناء التوليد، يجب قراءة كافة أوزان النموذج من الذاكرة إلى أنوية كرت الشاشة لكل رمز (Token) يتم إنتاجه. البطاقة التي تمتلك معالجة هائلة ولكن نطاق تردد ضيق ستبقى معطلة في انتظار وصول البيانات.

السرعة القصوى (رمز/ثانية) = النطاق الترددي للذاكرة (GB/s) / حجم النموذج في VRAM (GB)

مثال: نموذج 70B بتكميم Q4 يحتاج حوالي 40 جيجابايت VRAM. على كرت RTX 3090 بنطاق 936 GB/s، تكون السرعة النظرية القصوى 936 / 40 = 23.4 رمزًا في الثانية. أما على ذاكرة النظام DDR5 بنطاق 60 GB/s، فإن نفس النموذج يولد بسرعة 60 / 40 = 1.5 رمز فقط في الثانية.

2. المستويات الـ 4 لسعة VRAM: ما الذي يمكنك تشغيله فعليًا؟

المستوى الأساسي8-12 جيجابايت ذاكرة
فئة 8GB إلى 12GB VRAM

نماذج 7B إلى 8B بتكميم Q4_K_M (Llama 3 8B، Mistral 7B، Qwen 2.5 7B) مع سياق قصير حتى 8k رمز.

RTX 3060 12GB (الخيار الاقتصادي الأفضل)، RTX 4060 Ti 16GB، أو RTX 5060 Ti 16GB.

الأفضل لـ: المبتدئين، والطلاب، ومساعدي البرمجة الخفيفين، والتجارب المحلية بميزانية محدودة.
الفئة المثالية16-24 جيجابايت ذاكرة
فئة 16GB إلى 24GB VRAM

نماذج 14B إلى 32B بتكميم Q4_K_M (Qwen 2.5 32B، Command-R)، أو نماذج 70B بتكميم مكثف (IQ2/Q3).

RTX 3090 24GB (مستعملة، قيمة لا تقبل المنافسة)، RTX 4090 24GB، أو RTX 5090 32GB.

الأفضل لـ: المطورين المحترفين، والتدريب الخفيف LoRA/QLoRA، ونماذج الأكواد الدقيقة 32B.
معيار الهواة المتقدم32-48 جيجابايت ذاكرة
فئة 32GB إلى 48GB (كرتين GPU / Mac)

تشغيل نماذج 70B إلى 72B كاملة بتكميم Q4_K_M مع نوافذ سياق رحبة 32k وتكميم FP8 لذاكرة KV.

كرتين RTX 3090 (إجمالي 48GB)، كرتين RTX 4090، أو Apple Mac Studio M2/M3/M4 Max (48GB إلى 64GB).

الأفضل لـ: النماذج الأولية للشركات، وتحليل الوثائق الطويلة، والاستدلال على نماذج 70B بلا تنازلات.
جنة نماذج 70B+64-128+ جيجابايت ذاكرة
فئة 64GB إلى 128GB+ (Mac Studio / منظومات احترافية)

Llama 3.3 70B بتكميم Q8_0، وQwen 2.5 72B بدقة FP16، ونماذج DeepSeek R1/V3 المقطرة، وLlama 405B بتكميم Q2/Q3.

Apple Mac Studio M2/M3 Ultra (ذاكرة موحدة 128GB إلى 192GB) أو حواسيب متعددة الكروت الاحترافية.

الأفضل لـ: فرق الشركات، وباحثي الذكاء الاصطناعي، والمستخدمين الباحثين عن أحدث النماذج دون اتصال بالإنترنت.

3. أجهزة Apple Silicon Mac مقابل حواسيب Nvidia: ماذا تشتري؟

Apple Silicon (الذاكرة الموحدة)
  • سعة VRAM هائلة: ذاكرة موحدة تصل إلى 128GB أو 192GB في جهاز مكتبي هادئ وصغير.
  • هدوء تام واستهلاك طاقة منخفض: يستهلك 80W إلى 120W تحت أقصى ضغط مقارنة بـ 850W+ للحواسيب متعددة الكروت.
  • نطاق ترددي متوسط: 300 إلى 800 GB/s يوفر سرعات عملية بين 15 و25 رمزًا في الثانية لنماذج 70B.
  • البيئة البرمجية: دعم ممتاز عبر مكتبة MLX وllama.cpp Metal؛ بينما vLLM وCUDA غير مدعومين.
محطات عمل Nvidia (منظومة CUDA)
  • أقصى سرعة توليد: نطاق ترددي 1008 GB/s في RTX 4090 يحقق سرعات استثنائية بين 30 و60 رمزًا في الثانية.
  • المعيار الصناعي المعتمد: توافق 100% مع CUDA وPyTorch وvLLM وTensorRT-LLM وFlashAttention-2.
  • حاجز سعة VRAM: حد أقصى 24GB للكرت الاستهلاكي الواحد. تشغيل نماذج 70B يتطلب بناء منصة متعددة الكروت.
  • استهلاك الطاقة والحرارة: يتطلب مزود طاقة 1000W+، وصندوق حاسوب بتدفق هواء قوي، وتبريدًا خاصًا.

4. بناء محطة عمل ببطاقتي GPU لنماذج 70B

إذا كان هدفك هو تشغيل نماذج 70B بكامل سرعتها على حاسوبك، فإن تكوين كرتين هو الخيار الأكثر جدوى اقتصادية:

1. مسارات PCIe في اللوحة الأم

تأكد من أن اللوحة الأم تدعم تجزئة x8 / x8 على مسارات المعالج، مع مسافة 3 إلى 4 شقوق بين البطاقتين لضمان التبريد.

2. مزود الطاقة (PSU)

اختر مزود طاقة باستطاعة لا تقل عن 1200W أو 1500W بشهادة Platinum أو Titanium لتحمل الارتفاعات اللحظية في الطاقة.

3. محرك الاستدلال

استخدم vLLM مع خاصية Tensor Parallelism (--tensor-parallel-size 2) أو تقسيم الطبقات في llama.cpp لتوزيع النموذج بين الكرتين.

الأسئلة الشائعة

لأن سعة VRAM هي الأساس في نماذج اللغة. كرت RTX 3090 بسعة 24GB يمكنه استيعاب نماذج 32B بتكميم Q4 أو نماذج 14B الكاملة مع سياق 32k بالكامل في الذاكرة. بينما كرت 16GB يعجز عن ذلك ويضطر لترحيل الطبقات إلى رام الحاسوب البطيء. بالإضافة إلى ذلك، يمتلك RTX 3090 نطاقًا تردديًا يصل إلى 936 GB/s مقارنة بـ 717 GB/s لكرت 4080.

8GB كافية لتجربة نماذج 7B أو 8B بتكميم Q4_K_M مع سياق قصير (حتى 4k أو 8k رمز). لكنها محدودة للغاية لمساعدي البرمجة الحديثين أو الوثائق الطويلة أو تشغيل شاشات العرض بجانبها. عند الشراء اليوم، نوصي بأن تكون 12GB أو 16GB هي الحد الأدنى.

نعم. تتيح معمارية الذاكرة الموحدة في أبل لأنوية GPU الوصول إلى كامل الرام دون قيود PCIe. جهاز Mac Studio بسعة 64GB يشغل Llama 3.3 70B بتكميم Q4_K_M بسلاسة (~45 جيجابايت إجمالي) بسرعة 15 إلى 22 رمزًا/ثانية. وسعة 128GB أو 192GB تشغل 70B بدقة FP16 كاملة أو نماذج MoE الضخمة التي تتطلب عتاد حاسوب يتجاوز 10,000 دولار.

عندما يستقر النموذج بالكامل في VRAM، تنتقل البيانات بسرعة 500 إلى 1000 GB/s. وعند ترحيل طبقات إلى رام النظام، تنتقل عبر منفذ PCIe (أقصى سرعة لـ PCIe 4.0 x16 هي ~31.5 GB/s ورام DDR5 بسرعة 60-90 GB/s). ولأن التوليد مقيد بالباندويث، فإن ترحيل حتى بضع طبقات يهبط بالسرعة من 45 رمزًا/ثانية إلى 3-6 رموز فقط.

لنماذج 70B، نعم بكل تأكيد. كرت RTX 4090 يمتلك 24GB فقط ولا يمكنه استيعاب 70B مكمم بالكامل. بينما كرتين RTX 3090 يوفران 48GB مجمعة (عبر Tensor Parallelism في vLLM أو llama.cpp)، مما يسمح بتشغيل 70B Q4_K_M بالكامل في الذاكرة بسرعة 25+ رمزًا/ثانية بتكلفة مماثلة أو أقل من كرت 4090 واحد.

هل تحتاج VRAM أكبر مما يوفره كرتك الحالي؟

استأجر سيرفرات GPU بنظام الساعة (RTX 4090 أو H100) عبر RunPod وVast.ai بأسعار تبدأ من 0.34 $/ساعة.

عرض أسعار السيرفرات السحابية

Knowledge & Deep Dives

مركز المعرفة حول VRAM والنماذج اللغوية المحلية

أدلة تقنية شاملة، وتحليلات معمارية، وإرشادات لاختيار العتاد لمساعدتك على تشغيل نماذج الذكاء الاصطناعي محليًا بدقة وثقة مطلقة.

50+ مصطلح8 دقائق مرجعية
أتقن المصطلحات التقنية الأساسية: GGUF مقابل Safetensors، والتكميم، وذاكرة KV، وGQA، والذاكرة الموحدة في Apple.
بحث وتصفية تفاعلية حسب التصنيفات
إرشادات عملية حول العتاد لكل مصطلح
تعريفات دقيقة خالية من التعقيدات اللغوية
فهرس أبجدي سريع للوصول المباشر
قراءة الدليل
أداة تفاعلية6 دقائق للقراءة
افهم لماذا يتسبب طول السياق في استنزاف الذاكرة وأخطاء CUDA OOM، واكتشف المعادلة الرياضية وكيفية تقليل الاستهلاك بنسبة 50% إلى 75%.
حاسبة تفاعلية لذاكرة السياق
مقارنة معماريات MHA وGQA وDeepSeek MLA
توفير الذاكرة عبر تكميم FP8 وINT4 لذاكرة KV
استهلاك الذاكرة في المحادثات متعددة الجولات
قراءة الدليل
مفكك التكوين7 دقائق للقراءة
افحص مستودعات النماذج كمهندس تعلم آلي: فك شفرة config.json، وحدد حدود السياق الحقيقية، وتجنب فخ معمارية MoE.
أداة تفاعلية لفحص معاملات config.json
شرح قواعد تسميات تكميم GGUF
قواعد الذاكرة لمعاملات MoE النشطة مقابل الإجمالية
نافذة السياق ومعاملات توسيع RoPE
قراءة الدليل
مصفوفة التراخيص5 دقائق للقراءة
الفروق القانونية والعملية بين المصدر المفتوح الحقيقي المعتمد من OSI ونماذج الأوزان المفتوحة مثل Llama 3 وDeepSeek وQwen وGemma.
مصفوفة مقارنة تراخيص النماذج التفاعلية
حدود الاستخدام التجاري وسقوف عدد المستخدمين
قيود تقطير البيانات الاصطناعية لتدريب النماذج
قائمة التحقق للامتثال المؤسسي للشركات
قراءة الدليل