Apple 512 GB
Apple Silicon 512 GB unified memory
اختر نموذجًا مفتوح الأوزان حقيقيًا، وليس مجرد عدد معلمات تقديري، واحصل على حساب شفاف للذاكرة، والعتاد المحلي المتوافق، وخيارات استئجار GPU السحابي المناسبة.
إعداد
إشعار الاستخدام التجاري: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
اختر أي بطاقة لمقارنة ملاءمة ذاكرة VRAM والهامش المتبقي والسرعة التقديرية للنموذج أعلاه.
Qwen3 8B · Q4_K_M · 8K tokens
RTX 4060
8 GiB · هامش 1.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 5060
8 GiB · هامش 1.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 3060
12 GiB · هامش 5.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 4070 Super
12 GiB · هامش 5.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 5070
12 GiB · هامش 5.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 4060 Ti
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 4070 Ti Super
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 4080 Super
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 5070 Ti
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 5080
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RTX 5060 Ti
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
RX 7800 XT
16 GiB · هامش 9.3 GiB
رابط تابع · قد تحصل Vantaige على عمولة.
تتضمن نتائج الملاءمة الآمنة احتياطيًا للنظام أو المسرّع؛ ولا تُعد السعة الإجمالية وحدها كافية.
هناك 46 من الخيارات المحلية تتسع لـ Qwen3 8B بهذه الإعدادات. ابدأ خطوة بخطوة وتوسّع عند الحاجة.
Apple Silicon 512 GB unified memory
Apple Silicon 256 GB unified memory
Apple Silicon 192 GB unified memory
NVIDIA H200 141 GB
Apple Silicon 128 GB unified memory
NVIDIA RTX PRO 6000 Blackwell 96 GB
Apple Silicon 96 GB unified memory
NVIDIA H100 NVL 94 GB
NVIDIA A100 80 GB
NVIDIA H100 80 GB
AMD Ryzen Mini PC 64 GB unified memory
Apple Silicon 64 GB unified memory
NVIDIA RTX 6000 Ada 48 GB
NVIDIA RTX A6000 48 GB
NVIDIA A40 48 GB
NVIDIA L40S 48 GB
Apple Silicon 48 GB unified memory
NVIDIA A100 40 GB
Apple Silicon 36 GB unified memory
NVIDIA RTX 5090 32 GB
NVIDIA RTX 5000 Ada 32 GB
AMD Ryzen Mini PC 32 GB unified memory
NVIDIA RTX 3090 24 GB
NVIDIA RTX 4090 24 GB
AMD Radeon RX 7900 XTX 24 GB
NVIDIA L4 24 GB
NVIDIA A10 24 GB
NVIDIA A30 24 GB
Apple Silicon 24 GB unified memory
AMD Radeon RX 7900 XT 20 GB
NVIDIA RTX 4060 Ti 16 GB
NVIDIA RTX 4070 Ti Super 16 GB
NVIDIA RTX 4080 Super 16 GB
NVIDIA RTX 5070 Ti 16 GB
NVIDIA RTX 5080 16 GB
NVIDIA RTX 5060 Ti 16 GB
AMD Radeon RX 7800 XT 16 GB
AMD Radeon RX 9060 XT 16 GB
AMD Radeon RX 9070 16 GB
AMD Radeon RX 9070 XT 16 GB
Apple Silicon 16 GB unified memory
NVIDIA RTX 3060 12 GB
NVIDIA RTX 4070 Super 12 GB
NVIDIA RTX 5070 12 GB
NVIDIA RTX 4060 8 GB
NVIDIA RTX 5060 8 GB
NVIDIA RTX 2060 6 GB
أسعار مرجعية بالدولار الأمريكي وليست عروضًا حية. تحقق من أسعار البائعين وتوفرهم. قد نحصل على عمولة من بعض الروابط.
ابدأ بالتكميم الافتراضي لـ Ollama. تأكد من الذاكرة الفعلية باستخدام ollama ps.
السرعة تعني معدل توليد الرموز التقديري وليس معالجة المدخلات. يعتمد التقدير على عرض نطاق الذاكرة وحجم الأوزان النشطة مع فرضية كفاءة معينة، وليس اختبار أداء. قد يكون التفريغ إلى المعالج أبطأ بكثير. يختلف دعم AMD؛ تحقق من التوافق قبل الشراء.
لنموذجك الأول، وترقيتك القادمة، وكل ما بينهما.
افهم ذاكرة بطاقة الرسومات وذاكرة Apple الموحدة وما يستحق الشراء.
اقرأ الدليل افهم الأرقامتعرف على سبب احتياج المحادثات الأطول لذاكرة أكبر حتى مع نفس النموذج.
اقرأ الدليل اعرف رخصتكتعرف على ما يمكنك تنزيله وتعديله واستخدامه تجارياً قبل البدء في البناء.
اقرأ الدليلالمعرفة والأدلة المعمقة
أدلة تقنية شاملة، وتحليلات معمارية، وإرشادات لاختيار العتاد لمساعدتك على تشغيل نماذج الذكاء الاصطناعي محليًا بدقة وثقة مطلقة.
التقديرات مفيدة، ولكن معرفة حدودها أفضل بكثير.
احسب أوزان النموذج + ذاكرة KV للسياق + هامش نحو 1 إلى 2 جيجابايت. عند Q4 تقريبًا: 7–8B نحو 6–8 جيجابايت، 13–14B نحو 10–12، 32B نحو 20–24، و70B الكثيف نحو 42–50 ثم أضف السياق. استخدم الحاسبة أعلاه بالنموذج والتكميم والسياق، لا بحجم الملف وحده.
الأوزان وحدها نحو 140 جيجابايت عند FP16 ونحو 40–43 عند Q4_K_M. مع سياق قصير وهامش خطّط لنحو 45–50 جيجابايت على GPU. بطاقة 24 جيجابايت واحدة لا تناسب Q4 المريح دون تفريغ ثقيل.
ليس بالكامل على الـ GPU بجودة Q4 عملية. توقّع تفريغًا هجينًا وسرعة منخفضة (آحاد tok/s)، أو انتقل إلى بطاقتين 24 جيجابايت / 48+ / ذاكرة Mac موحدة كبيرة / استئجار GPU سحابي.
FP16 نحو 2 بايت لكل معلمة، وQ4_K_M نحو 0.5–0.6. نموذج 8B ينزل من نحو 16 جيجابايت (FP16) إلى نحو 5 عند Q4. تكميم الأوزان لا يصغّر ذاكرة KV إلا إذا كمّمتها أيضًا.
اختر النموذج والتكميم وطول السياق في الحاسبة: أوزان + KV + عبء التشغيل. حجم ملف GGUF أرضية فقط. بعد التحميل قِس بـ nvidia-smi أو ollama ps.
نعم. ذاكرة KV تنمو مع طول السياق والمحادثات المتزامنة. عند 32K أو 128K قد تضاهي الأوزان. نموذج يسع عند 4K قد يخرج CUDA out of memory عند 32K. اضبط num_ctx على ما تستخدمه فعلًا، أو كمّم KV.
نعم لنماذج نحو 7–8B بتكميم Q4 وسياق معتدل. نماذج 13B+ تحتاج تفريغًا أو تكميمًا أعنف. عند شراء كرت جديد فضّل 12 جيجابايت فأكثر.
فضّل 12 جيجابايت. للاستدلال المحلي سعة VRAM تفوز على القوة الخام. الـ 3070 أسرع نظريًا لكن 8 جيجابايت سقف قاسٍ لنماذج 13–14B.
macOS والتطبيقات تشارك الحوض نفسه. تقريبًا: 16 جيجابايت للنماذج الصغيرة، 32 جيجابايت وسط مريح، و64 جيجابايت+ قبل أن يصبح 70B عمليًا. لا تعامل الذاكرة الموحدة كـ VRAM مخصصة بنسبة 100%.
اشترِ إذا كنت تشغّل ساعات كثيرة أسبوعيًا وتريد الخصوصية. استأجر (RunPod / Vast.ai) للتجارب والذروات أو للتحقق من 70B قبل بناء بطاقتين. هجين شائع: بطاقة محلية لـ 8B–32B اليومي، والسحابة عند الحاجة لمزيد من VRAM.
نعم عبر GGUF/llama.cpp إذا غطّت VRAM مع RAM النموذج. السرعة غالبًا تهبط إلى آحاد tok/s: مناسبة للتجربة لا للدردشة السريعة. إن همّتك السرعة فاختر تكميمًا أصغر أو نموذجًا يسع بالكامل على GPU.
طبّق حسب طبقة VRAM لا حسب TFLOPS: نحو 8 جيجابايت لـ 7–8B Q4، نحو 12 لـ 13–14B، 16–24 لنحو 20–32B، ونحو 48 للمجموع لـ 70B كثيف Q4. أدخل دائمًا KV cache في الحساب ثم أكّد في الحاسبة.
حجم الملف هو الأوزان فقط. KV والتنشيطات وسطح المكتب والتفتيت والـ prompt الطويل تُضاف فوقها. اترك هامشًا، خفّض السياق، كمّم KV، أو اختر تكميمًا أصغر. أن يسع الملف لا يعني أن تسع المحادثة.
اختر أعلى تكميم لا يزال يسع مع هامش للسياق. Q4_K_M التوازن الافتراضي للدردشة والبرمجة. ارفع إلى Q5/Q6/Q8 إن بقي VRAM واضح. تجنّب Q2/Q3 إلا للضرورة القصوى.
السعة سعة: بطاقة AMD بسعة 24 جيجابايت تحمل أوزانًا مشابهة. البرمجيات أضيق (ROCm أو Vulkan، ولينكس أوضح من ويندوز). NVIDIA يبقى المسار الأسهل لـ CUDA وvLLM.
بدقة Q4_K_M، تستهلك الأوزان نحو 5.5 جيجابايت. مع سياق 8k ومتطلبات تشغيل CUDA، ستحتاج إلى 7 إلى 8 جيجابايت VRAM كحد أدنى. كرت شاشة بسعة 8 جيجابايت (مثل RTX 4060) أو 12 جيجابايت (RTX 3060) يكفي لتشغيلها بالكامل على كرت الشاشة بسلاسة دون اللجوء لرام النظام.
الفارق يتجاوز 10 أضعاف. توليد النصوص في نماذج اللغة مقيد بالنطاق الترددي للذاكرة. كرت RTX 3090 يوفر سرعة نقل 936 GB/s، بينما رام DDR5 توفر 60 إلى 80 GB/s فقط. ترحيل الطبقات إلى المعالج يخفض السرعة من 30 توكن/ثانية إلى توكن أو توكنين فقط.
ملف الأوزان يزن نحو 42 جيجابايت. ومع سياق بطول 32 ألف توكن ومعمارية GQA، تستهلك ذاكرة KV نحو 4.5 جيجابايت بالإضافة إلى 1 جيجابايت لهامش تشغيل CUDA، ليصل المجموع الفعلي إلى نحو 48 جيجابايت VRAM، وهو ما يناسب تمامًا حاسوبًا ببطاقتي RTX 3090 أو جهاز Mac Studio بسعة 64 جيجابايت.
لأن ملف GGUF يحتوي على الأوزان الثابتة فقط. عند الإقلاع، يقوم Ollama بحجز بيئة CUDA التشغيلية ويخصص مسبقًا مساحة ذاكرة KV Cache بناءً على إعداد num_ctx (مثل 8k أو 32k). هذه الذاكرة الإضافية تضمن استقرار النموذج وعدم انهياره أثناء معالجة المحادثات الطويلة.
للمبتدئين وأصحاب الميزانيات المحدودة، كرت RTX 3060 12GB الجديد هو الخيار الأفضل لتشغيل نماذج 7B إلى 14B. وللمطورين والمحترفين، كرت RTX 3090 24GB مستعمل يقدم أفضل قيمة على الإطلاق بنطاق 936 GB/s وسعة 24GB بسعر أقل بكثير من كروت الجيل الأحدث.
تشغيل نموذج لغوي كبير محليًا يعني احتواء شيئين في ذاكرة بطاقة الرسومات في الوقت نفسه: أوزان النموذج، وذاكرة KV المؤقتة التي تنمو مع مقدار السياق النشط. حجم الأوزان واضح: عدد المعاملات مضروبًا في عدد البايتات لكل معامل، لذا فإن تكميم نموذج من FP16 إلى Q4 يقلّص حجمه تقريبًا إلى الربع. أما ذاكرة KV المؤقتة فيسهل إغفالها: قد يستنفد نموذج يناسب بالكاد سياق 4K ذاكرته عند 32K، لأن هذه الذاكرة المؤقتة تتوسع مع طول السياق. تقدّر هذه الحاسبة كليهما وتضيف هامش تشغيل إضافيًا صغيرًا لذاكرة إطار العمل والتنشيطات، ثم تقارن المجموع ببطاقات رسومات شائعة تتراوح من RTX 3060 بسعة 12 جيجابايت إلى H100 بسعة 80 جيجابايت.
تحقق مما إذا كان دورك أو نشاطك التجاري أو سير عملك يتطابق مع الطريقة التي يستخدمها الناس فعليًا لهذه الأداة.
Local LLM hobbyist / self-hoster
You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.
PC builder shopping for an AI GPU
You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.
ML engineer / data scientist sizing a deployment
You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.
Indie developer running a local AI coding assistant
You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.
المزيد من الأدوات المجانية
هل تبني موجّهًا (prompt) بدلًا من تحديد حجم العتاد؟ جرّب أداة بناء موجّهات الذكاء الاصطناعي أو تصفح مركز أدوات الذكاء الاصطناعي المجانية بالكامل.