تخطَّ إلى المحتوى الرئيسي
رائد · مجانيحاسبة VRAM، أي GPU يشغّل أي نموذج؟ →
مميز حزمة نماذج الذكاء الاصطناعي والأزياء →
Vantaige
عتاد مدمج. إمكانيات هائلة.

أفكار كبيرة.
واستهلاك ذاكرة محدود.حاسبة VRAM للذكاء الاصطناعي: ما النماذج التي يمكن لكرت الشاشة تشغيلها؟

اختر نموذجًا مفتوح الأوزان حقيقيًا، وليس مجرد عدد معلمات تقديري، واحصل على حساب شفاف للذاكرة، والعتاد المحلي المتوافق، وخيارات استئجار GPU السحابي المناسبة.

إعداد الذكاء الاصطناعي القادم
قد يكون بالفعل على مكتبك.

اكتشف الآن
64 نموذجًا جاهزًا · ابحث في الكتالوج اليومي المخزن مؤقتًا
01

إعداد

اختر ما تريد تشغيله

تقدير مباشر
نماذج شائعة واقتصادية
Apache-2.0 · مفتوح المصدر: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
Apache-2.0 · مفتوح المصدر: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
Apache-2.0 · مفتوح المصدر: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
Apache-2.0 · مفتوح المصدر: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
Apache-2.0 · مفتوح المصدر: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
MIT · مفتوح المصدر: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.
8.2B معاملGQAحتى 128K من السياقمفتوح المصدربطاقة النموذج كيفية فحص المواصفات

إشعار الاستخدام التجاري: ترخيص مفتوح المصدر مرن (مثل Apache-2.0 أو MIT). يسمح عموماً بالاستخدام التجاري والتعديل والاستضافة الذاتية وفق شروط حقوق النشر.

مسرد مصطلحات التكميم

اختر أي بطاقة لمقارنة ملاءمة ذاكرة VRAM والهامش المتبقي والسرعة التقديرية للنموذج أعلاه.

8K tokens
افتراضات متقدمة
دليل ذاكرة KV
تقدير ذاكرتك
متوافقحجم ملف دقيق

نعم، ينبغي أن يعمل Qwen3 8B على RTX 4090 مع هامش تشغيل 17.3 GiB.

6.7 GiB

Qwen3 8B · Q4_K_M · 8K tokens

تقدير ذاكرة المسرّع المطلوبةRTX 4090 · سعة 24 GiB
الأوزان
4.7 GiB
ذاكرة KV المؤقتة
1.1 GiB
بيئة التشغيل
0.9 GiB
السرعة التقديرية:
~140 توكن/ثانية(نطاق ترددي 1008 جيجابايت/ثانية - تقديري)

RTX 4060

8 GiB · هامش 1.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 5060

8 GiB · هامش 1.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 3060

12 GiB · هامش 5.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 4070 Super

12 GiB · هامش 5.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 5070

12 GiB · هامش 5.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 4060 Ti

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 4070 Ti Super

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 4080 Super

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 5070 Ti

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 5080

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RTX 5060 Ti

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

RX 7800 XT

16 GiB · هامش 9.3 GiB

رابط تابع · قد تحصل Vantaige على عمولة.

تتضمن نتائج الملاءمة الآمنة احتياطيًا للنظام أو المسرّع؛ ولا تُعد السعة الإجمالية وحدها كافية.

الخيار الملائم تماماً، دون مبالغة

المستقر الأنسب لنموذجك.

هناك 46 من الخيارات المحلية تتسع لـ Qwen3 8B بهذه الإعدادات. ابدأ خطوة بخطوة وتوسّع عند الحاجة.

تم التحقق من سعة الذاكرة وفقاً لإعداداتك
مساحة أوسع للتجربةS

Apple 512 GB

Apple Silicon 512 GB unified memory

يتسع بكل أريحية+505 GiB
~111 tok/sتقدير فك التشفير512 GiB435 GiB GiB متاحة للاستخدام
تحقق من السعرحاسوب كامل · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 256 GB

Apple Silicon 256 GB unified memory

يتسع بكل أريحية+249 GiB
~111 tok/sتقدير فك التشفير256 GiB218 GiB GiB متاحة للاستخدام
تحقق من السعرحاسوب كامل · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 192 GB

Apple Silicon 192 GB unified memory

يتسع بكل أريحية+185 GiB
~111 tok/sتقدير فك التشفير192 GiB163 GiB GiB متاحة للاستخدام
تحقق من السعرحاسوب كامل · مرجعي
تحقق من السعر
احترافي / سحابيS

H200

NVIDIA H200 141 GB

يتسع بكل أريحية+134 GiB
~666 tok/sتقدير فك التشفير141 GiB134 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 128 GB

Apple Silicon 128 GB unified memory

يتسع بكل أريحية+121 GiB
~111 tok/sتقدير فك التشفير128 GiB109 GiB GiB متاحة للاستخدام
Amazon · Apple MacBook Pro 16 M4 Max 128GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX PRO 6000

NVIDIA RTX PRO 6000 Blackwell 96 GB

يتسع بكل أريحية+89.3 GiB
~250 tok/sتقدير فك التشفير96 GiB90.2 GiB GiB متاحة للاستخدام
Newegg · PNY RTX PRO 6000 Blackwell 96GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 96 GB

Apple Silicon 96 GB unified memory

يتسع بكل أريحية+89.3 GiB
~56 tok/sتقدير فك التشفير96 GiB81.6 GiB GiB متاحة للاستخدام
Amazon · Apple Mac Studio M3 Ultra 96GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
احترافي / سحابيS

H100 NVL

NVIDIA H100 NVL 94 GB

يتسع بكل أريحية+87.3 GiB
~541 tok/sتقدير فك التشفير94 GiB89.3 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

A100 80 GB

NVIDIA A100 80 GB

يتسع بكل أريحية+73.3 GiB
~283 tok/sتقدير فك التشفير80 GiB76.0 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

H100 80 GB

NVIDIA H100 80 GB

يتسع بكل أريحية+73.3 GiB
~465 tok/sتقدير فك التشفير80 GiB76.0 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Ryzen Mini 64 GB

AMD Ryzen Mini PC 64 GB unified memory

يتسع بكل أريحية+57.3 GiB
~12 tok/sتقدير فك التشفير64 GiB54.4 GiB GiB متاحة للاستخدام
Amazon · Minisforum UM890 Pro Mini PC 64GB DDR5 OCuLinkحاسوب كامل · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 64 GB

Apple Silicon 64 GB unified memory

يتسع بكل أريحية+57.3 GiB
~56 tok/sتقدير فك التشفير64 GiB54.4 GiB GiB متاحة للاستخدام
Amazon · Apple MacBook Pro 16 M4 Max 64GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 6000 Ada

NVIDIA RTX 6000 Ada 48 GB

يتسع بكل أريحية+41.3 GiB
~133 tok/sتقدير فك التشفير48 GiB45.1 GiB GiB متاحة للاستخدام
Newegg · PNY RTX 6000 Ada Generation 48GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX A6000

NVIDIA RTX A6000 48 GB

يتسع بكل أريحية+41.3 GiB
~107 tok/sتقدير فك التشفير48 GiB45.1 GiB GiB متاحة للاستخدام
Amazon · PNY RTX A6000 48GB GDDR6بطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

A40

NVIDIA A40 48 GB

يتسع بكل أريحية+41.3 GiB
~97 tok/sتقدير فك التشفير48 GiB45.6 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

L40S

NVIDIA L40S 48 GB

يتسع بكل أريحية+41.3 GiB
~120 tok/sتقدير فك التشفير48 GiB45.6 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 48 GB

Apple Silicon 48 GB unified memory

يتسع بكل أريحية+41.3 GiB
~42 tok/sتقدير فك التشفير48 GiB40.8 GiB GiB متاحة للاستخدام
Amazon · Apple Mac mini M4 Pro 48GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
احترافي / سحابيS

A100 40 GB

NVIDIA A100 40 GB

يتسع بكل أريحية+33.3 GiB
~216 tok/sتقدير فك التشفير40 GiB38.0 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 36 GB

Apple Silicon 36 GB unified memory

يتسع بكل أريحية+29.3 GiB
~21 tok/sتقدير فك التشفير36 GiB30.6 GiB GiB متاحة للاستخدام
Amazon · Apple MacBook Pro 16 M4 36GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 5090

NVIDIA RTX 5090 32 GB

يتسع بكل أريحية+25.3 GiB
~249 tok/sتقدير فك التشفير32 GiB29.4 GiB GiB متاحة للاستخدام
Amazon · ASUS TUF Gaming RTX 5090 32GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 5000 Ada

NVIDIA RTX 5000 Ada 32 GB

يتسع بكل أريحية+25.3 GiB
~80 tok/sتقدير فك التشفير32 GiB30.1 GiB GiB متاحة للاستخدام
Amazon · PNY RTX 5000 Ada Generation 32GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Ryzen Mini 32 GB

AMD Ryzen Mini PC 32 GB unified memory

يتسع بكل أريحية+25.3 GiB
~12 tok/sتقدير فك التشفير32 GiB27.2 GiB GiB متاحة للاستخدام
Amazon · Beelink SER8 Mini PC AMD Ryzen 7 32GB DDR5حاسوب كامل · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 3090

NVIDIA RTX 3090 24 GB

يتسع بكل أريحية+17.3 GiB
~130 tok/sتقدير فك التشفير24 GiB22.1 GiB GiB متاحة للاستخدام
Amazon · ASUS TUF Gaming OC RTX 3090 24GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 4090

NVIDIA RTX 4090 24 GB

يتسع بكل أريحية+17.3 GiB
~140 tok/sتقدير فك التشفير24 GiB22.1 GiB GiB متاحة للاستخدام
Amazon · ASUS ROG Strix LC RTX 4090 24GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

RX 7900 XTX

AMD Radeon RX 7900 XTX 24 GB

يتسع بكل أريحية+17.3 GiB
~133 tok/sتقدير فك التشفير24 GiB22.1 GiB GiB متاحة للاستخدام
Amazon · PowerColor Red Devil RX 7900 XTX 24GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

L4

NVIDIA L4 24 GB

يتسع بكل أريحية+17.3 GiB
~42 tok/sتقدير فك التشفير24 GiB22.8 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

A10

NVIDIA A10 24 GB

يتسع بكل أريحية+17.3 GiB
~83 tok/sتقدير فك التشفير24 GiB22.8 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
احترافي / سحابيS

A30

NVIDIA A30 24 GB

يتسع بكل أريحية+17.3 GiB
~130 tok/sتقدير فك التشفير24 GiB22.8 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

Apple 24 GB

Apple Silicon 24 GB unified memory

يتسع بكل أريحية+17.3 GiB
~21 tok/sتقدير فك التشفير24 GiB20.0 GiB GiB متاحة للاستخدام
Amazon · Apple Mac mini M4 24GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

RX 7900 XT

AMD Radeon RX 7900 XT 20 GB

يتسع بكل أريحية+13.3 GiB
~111 tok/sتقدير فك التشفير20 GiB18.4 GiB GiB متاحة للاستخدام
Amazon · Sapphire Pulse RX 7900 XT 20GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 4060 Ti

NVIDIA RTX 4060 Ti 16 GB

يتسع بكل أريحية+9.3 GiB
~40 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · GIGABYTE Gaming OC RTX 4060 Ti 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 4070 Ti Super

NVIDIA RTX 4070 Ti Super 16 GB

يتسع بكل أريحية+9.3 GiB
~93 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · GIGABYTE Gaming OC RTX 4070 Ti Super 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 4080 Super

NVIDIA RTX 4080 Super 16 GB

يتسع بكل أريحية+9.3 GiB
~102 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · GIGABYTE Windforce OC RTX 4080 Super 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 5070 Ti

NVIDIA RTX 5070 Ti 16 GB

يتسع بكل أريحية+9.3 GiB
~124 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · ASUS Prime RTX 5070 Ti 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 5080

NVIDIA RTX 5080 16 GB

يتسع بكل أريحية+9.3 GiB
~139 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · ASUS Prime RTX 5080 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 5060 Ti

NVIDIA RTX 5060 Ti 16 GB

يتسع بكل أريحية+9.3 GiB
~62 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · ASUS Prime RTX 5060 Ti 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

RX 7800 XT

AMD Radeon RX 7800 XT 16 GB

يتسع بكل أريحية+9.3 GiB
~87 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · ASRock Steel Legend RX 7800 XT 16GB OCبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

RX 9060 XT

AMD Radeon RX 9060 XT 16 GB

يتسع بكل أريحية+9.3 GiB
~67 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · ASUS Dual RX 9060 XT 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

RX 9070

AMD Radeon RX 9070 16 GB

يتسع بكل أريحية+9.3 GiB
~89 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · ASRock Challenger RX 9070 16GB OCبطاقة رسومات فقط · مرجعي
تحقق من السعر
مساحة أوسع للتجربةS

RX 9070 XT

AMD Radeon RX 9070 XT 16 GB

يتسع بكل أريحية+9.3 GiB
~107 tok/sتقدير فك التشفير16 GiB14.7 GiB GiB متاحة للاستخدام
Amazon · PowerColor Red Devil RX 9070 XT 16GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
الخيار اليومي المفضلS

Apple 16 GB

Apple Silicon 16 GB unified memory

يتسع بكل أريحية+9.3 GiB
~17 tok/sتقدير فك التشفير16 GiB12.0 GiB GiB متاحة للاستخدام
Amazon · Apple Mac mini M4 16GB unified memoryحاسوب كامل · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 3060

NVIDIA RTX 3060 12 GB

يتسع بكل أريحية+5.3 GiB
~50 tok/sتقدير فك التشفير12 GiB11.0 GiB GiB متاحة للاستخدام
Amazon · MSI Gaming GeForce RTX 3060 12GB Ventus 2X OCبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 4070 Super

NVIDIA RTX 4070 Super 12 GB

يتسع بكل أريحية+5.3 GiB
~70 tok/sتقدير فك التشفير12 GiB11.0 GiB GiB متاحة للاستخدام
Amazon · GIGABYTE Windforce OC RTX 4070 Super 12GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAS

RTX 5070

NVIDIA RTX 5070 12 GB

يتسع بكل أريحية+5.3 GiB
~93 tok/sتقدير فك التشفير12 GiB11.0 GiB GiB متاحة للاستخدام
Amazon · GIGABYTE Windforce OC RTX 5070 12GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAC

RTX 4060

NVIDIA RTX 4060 8 GB

يتسع · بهامش ضيق+1.3 GiB
~38 tok/sتقدير فك التشفير8 GiB7.0 GiB GiB متاحة للاستخدام
Amazon · MSI Ventus 2X Black RTX 4060 8GB OCبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAC

RTX 5060

NVIDIA RTX 5060 8 GB

يتسع · بهامش ضيق+1.3 GiB
~40 tok/sتقدير فك التشفير8 GiB7.0 GiB GiB متاحة للاستخدام
Amazon · GIGABYTE AERO OC RTX 5060 8GBبطاقة رسومات فقط · مرجعي
تحقق من السعر
جاهز لـ CUDAF

RTX 2060

NVIDIA RTX 2060 6 GB

يتجاوز الميزانية الآمنة-0.7 GiB
يتطلب تفريغاً إلى المعالجالسرعة غير متوقعة6 GiB5.0 GiB GiB متاحة للاستخدام
تحقق من السعربطاقة رسومات فقط · مرجعي
تحقق من السعر

أسعار مرجعية بالدولار الأمريكي وليست عروضًا حية. تحقق من أسعار البائعين وتوفرهم. قد نحصل على عمولة من بعض الروابط.

من “هل سيتسع؟” إلى أول أمر نصي.

ابدأ بالتكميم الافتراضي لـ Ollama. تأكد من الذاكرة الفعلية باستخدام ollama ps.

السرعة تعني معدل توليد الرموز التقديري وليس معالجة المدخلات. يعتمد التقدير على عرض نطاق الذاكرة وحجم الأوزان النشطة مع فرضية كفاءة معينة، وليس اختبار أداء. قد يكون التفريغ إلى المعالج أبطأ بكثير. يختلف دعم AMD؛ تحقق من التوافق قبل الشراء.

القليل من المعرفة يختصر الكثير

فهم الذكاء الاصطناعي المحلي.

لنموذجك الأول، وترقيتك القادمة، وكل ما بينهما.

المعرفة والأدلة المعمقة

مركز المعرفة حول VRAM والنماذج اللغوية المحلية

أدلة تقنية شاملة، وتحليلات معمارية، وإرشادات لاختيار العتاد لمساعدتك على تشغيل نماذج الذكاء الاصطناعي محليًا بدقة وثقة مطلقة.

50+ مصطلح8 دقائق مرجعية
أتقن المصطلحات التقنية الأساسية: GGUF مقابل Safetensors، والتكميم، وذاكرة KV، وGQA، والذاكرة الموحدة في Apple.
بحث وتصفية تفاعلية حسب التصنيفات
إرشادات عملية حول العتاد لكل مصطلح
تعريفات دقيقة خالية من التعقيدات اللغوية
فهرس أبجدي سريع للوصول المباشر
قراءة الدليل
أداة تفاعلية6 دقائق للقراءة
افهم لماذا يتسبب طول السياق في استنزاف الذاكرة وأخطاء CUDA OOM، واكتشف المعادلة الرياضية وكيفية تقليل الاستهلاك بنسبة 50% إلى 75%.
حاسبة تفاعلية لذاكرة السياق
مقارنة معماريات MHA وGQA وDeepSeek MLA
توفير الذاكرة عبر تكميم FP8 وINT4 لذاكرة KV
استهلاك الذاكرة في المحادثات متعددة الجولات
قراءة الدليل
مفكك التكوين7 دقائق للقراءة
افحص مستودعات النماذج كمهندس تعلم آلي: فك شفرة config.json، وحدد حدود السياق الحقيقية، وتجنب فخ معمارية MoE.
أداة تفاعلية لفحص معاملات config.json
شرح قواعد تسميات تكميم GGUF
قواعد الذاكرة لمعاملات MoE النشطة مقابل الإجمالية
نافذة السياق ومعاملات توسيع RoPE
قراءة الدليل
مصفوفة التراخيص5 دقائق للقراءة
الفروق القانونية والعملية بين المصدر المفتوح الحقيقي المعتمد من OSI ونماذج الأوزان المفتوحة مثل Llama 3 وDeepSeek وQwen وGemma.
مصفوفة مقارنة تراخيص النماذج التفاعلية
حدود الاستخدام التجاري وسقوف عدد المستخدمين
قيود تقطير البيانات الاصطناعية لتدريب النماذج
قائمة التحقق للامتثال المؤسسي للشركات
قراءة الدليل
دليل العتاد8 دقائق للقراءة
تعرف على سبب تفوق النطاق الترددي على قوة المعالجة، والمقارنة بين أجهزة Mac وNvidia، وسعة VRAM المطلوبة للنماذج من 8B إلى 70B.
مستويات سعة VRAM (من 8GB إلى 128GB+)
معادلة النطاق الترددي للذاكرة مقابل المعالجة
مقارنة أجهزة Apple Silicon Mac مقابل حواسيب Nvidia
مخططات بناء محطة عمل ببطاقتي GPU لنماذج 70B
قراءة الدليل

أسئلة مهمة.

التقديرات مفيدة، ولكن معرفة حدودها أفضل بكثير.

احسب أوزان النموذج + ذاكرة KV للسياق + هامش نحو 1 إلى 2 جيجابايت. عند Q4 تقريبًا: 7–8B نحو 6–8 جيجابايت، 13–14B نحو 10–12، 32B نحو 20–24، و70B الكثيف نحو 42–50 ثم أضف السياق. استخدم الحاسبة أعلاه بالنموذج والتكميم والسياق، لا بحجم الملف وحده.

الأوزان وحدها نحو 140 جيجابايت عند FP16 ونحو 40–43 عند Q4_K_M. مع سياق قصير وهامش خطّط لنحو 45–50 جيجابايت على GPU. بطاقة 24 جيجابايت واحدة لا تناسب Q4 المريح دون تفريغ ثقيل.

ليس بالكامل على الـ GPU بجودة Q4 عملية. توقّع تفريغًا هجينًا وسرعة منخفضة (آحاد tok/s)، أو انتقل إلى بطاقتين 24 جيجابايت / 48+ / ذاكرة Mac موحدة كبيرة / استئجار GPU سحابي.

FP16 نحو 2 بايت لكل معلمة، وQ4_K_M نحو 0.5–0.6. نموذج 8B ينزل من نحو 16 جيجابايت (FP16) إلى نحو 5 عند Q4. تكميم الأوزان لا يصغّر ذاكرة KV إلا إذا كمّمتها أيضًا.

اختر النموذج والتكميم وطول السياق في الحاسبة: أوزان + KV + عبء التشغيل. حجم ملف GGUF أرضية فقط. بعد التحميل قِس بـ nvidia-smi أو ollama ps.

نعم. ذاكرة KV تنمو مع طول السياق والمحادثات المتزامنة. عند 32K أو 128K قد تضاهي الأوزان. نموذج يسع عند 4K قد يخرج CUDA out of memory عند 32K. اضبط num_ctx على ما تستخدمه فعلًا، أو كمّم KV.

نعم لنماذج نحو 7–8B بتكميم Q4 وسياق معتدل. نماذج 13B+ تحتاج تفريغًا أو تكميمًا أعنف. عند شراء كرت جديد فضّل 12 جيجابايت فأكثر.

فضّل 12 جيجابايت. للاستدلال المحلي سعة VRAM تفوز على القوة الخام. الـ 3070 أسرع نظريًا لكن 8 جيجابايت سقف قاسٍ لنماذج 13–14B.

macOS والتطبيقات تشارك الحوض نفسه. تقريبًا: 16 جيجابايت للنماذج الصغيرة، 32 جيجابايت وسط مريح، و64 جيجابايت+ قبل أن يصبح 70B عمليًا. لا تعامل الذاكرة الموحدة كـ VRAM مخصصة بنسبة 100%.

اشترِ إذا كنت تشغّل ساعات كثيرة أسبوعيًا وتريد الخصوصية. استأجر (RunPod / Vast.ai) للتجارب والذروات أو للتحقق من 70B قبل بناء بطاقتين. هجين شائع: بطاقة محلية لـ 8B–32B اليومي، والسحابة عند الحاجة لمزيد من VRAM.

نعم عبر GGUF/llama.cpp إذا غطّت VRAM مع RAM النموذج. السرعة غالبًا تهبط إلى آحاد tok/s: مناسبة للتجربة لا للدردشة السريعة. إن همّتك السرعة فاختر تكميمًا أصغر أو نموذجًا يسع بالكامل على GPU.

طبّق حسب طبقة VRAM لا حسب TFLOPS: نحو 8 جيجابايت لـ 7–8B Q4، نحو 12 لـ 13–14B، 16–24 لنحو 20–32B، ونحو 48 للمجموع لـ 70B كثيف Q4. أدخل دائمًا KV cache في الحساب ثم أكّد في الحاسبة.

حجم الملف هو الأوزان فقط. KV والتنشيطات وسطح المكتب والتفتيت والـ prompt الطويل تُضاف فوقها. اترك هامشًا، خفّض السياق، كمّم KV، أو اختر تكميمًا أصغر. أن يسع الملف لا يعني أن تسع المحادثة.

اختر أعلى تكميم لا يزال يسع مع هامش للسياق. Q4_K_M التوازن الافتراضي للدردشة والبرمجة. ارفع إلى Q5/Q6/Q8 إن بقي VRAM واضح. تجنّب Q2/Q3 إلا للضرورة القصوى.

السعة سعة: بطاقة AMD بسعة 24 جيجابايت تحمل أوزانًا مشابهة. البرمجيات أضيق (ROCm أو Vulkan، ولينكس أوضح من ويندوز). NVIDIA يبقى المسار الأسهل لـ CUDA وvLLM.

بدقة Q4_K_M، تستهلك الأوزان نحو 5.5 جيجابايت. مع سياق 8k ومتطلبات تشغيل CUDA، ستحتاج إلى 7 إلى 8 جيجابايت VRAM كحد أدنى. كرت شاشة بسعة 8 جيجابايت (مثل RTX 4060) أو 12 جيجابايت (RTX 3060) يكفي لتشغيلها بالكامل على كرت الشاشة بسلاسة دون اللجوء لرام النظام.

الفارق يتجاوز 10 أضعاف. توليد النصوص في نماذج اللغة مقيد بالنطاق الترددي للذاكرة. كرت RTX 3090 يوفر سرعة نقل 936 GB/s، بينما رام DDR5 توفر 60 إلى 80 GB/s فقط. ترحيل الطبقات إلى المعالج يخفض السرعة من 30 توكن/ثانية إلى توكن أو توكنين فقط.

ملف الأوزان يزن نحو 42 جيجابايت. ومع سياق بطول 32 ألف توكن ومعمارية GQA، تستهلك ذاكرة KV نحو 4.5 جيجابايت بالإضافة إلى 1 جيجابايت لهامش تشغيل CUDA، ليصل المجموع الفعلي إلى نحو 48 جيجابايت VRAM، وهو ما يناسب تمامًا حاسوبًا ببطاقتي RTX 3090 أو جهاز Mac Studio بسعة 64 جيجابايت.

لأن ملف GGUF يحتوي على الأوزان الثابتة فقط. عند الإقلاع، يقوم Ollama بحجز بيئة CUDA التشغيلية ويخصص مسبقًا مساحة ذاكرة KV Cache بناءً على إعداد num_ctx (مثل 8k أو 32k). هذه الذاكرة الإضافية تضمن استقرار النموذج وعدم انهياره أثناء معالجة المحادثات الطويلة.

للمبتدئين وأصحاب الميزانيات المحدودة، كرت RTX 3060 12GB الجديد هو الخيار الأفضل لتشغيل نماذج 7B إلى 14B. وللمطورين والمحترفين، كرت RTX 3090 24GB مستعمل يقدم أفضل قيمة على الإطلاق بنطاق 936 GB/s وسعة 24GB بسعر أقل بكثير من كروت الجيل الأحدث.

كيف تحدد حجم بطاقة الرسومات المناسب لنموذج لغوي كبير محلي

تشغيل نموذج لغوي كبير محليًا يعني احتواء شيئين في ذاكرة بطاقة الرسومات في الوقت نفسه: أوزان النموذج، وذاكرة KV المؤقتة التي تنمو مع مقدار السياق النشط. حجم الأوزان واضح: عدد المعاملات مضروبًا في عدد البايتات لكل معامل، لذا فإن تكميم نموذج من FP16 إلى Q4 يقلّص حجمه تقريبًا إلى الربع. أما ذاكرة KV المؤقتة فيسهل إغفالها: قد يستنفد نموذج يناسب بالكاد سياق 4K ذاكرته عند 32K، لأن هذه الذاكرة المؤقتة تتوسع مع طول السياق. تقدّر هذه الحاسبة كليهما وتضيف هامش تشغيل إضافيًا صغيرًا لذاكرة إطار العمل والتنشيطات، ثم تقارن المجموع ببطاقات رسومات شائعة تتراوح من RTX 3060 بسعة 12 جيجابايت إلى H100 بسعة 80 جيجابايت.

لمن هذه الأداة؟

تحقق مما إذا كان دورك أو نشاطك التجاري أو سير عملك يتطابق مع الطريقة التي يستخدمها الناس فعليًا لهذه الأداة.

Local LLM hobbyist / self-hoster

You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.

PC builder shopping for an AI GPU

You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.

ML engineer / data scientist sizing a deployment

You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.

Indie developer running a local AI coding assistant

You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.

المزيد من الأدوات المجانية

هل تبني موجّهًا (prompt) بدلًا من تحديد حجم العتاد؟ جرّب أداة بناء موجّهات الذكاء الاصطناعي أو تصفح مركز أدوات الذكاء الاصطناعي المجانية بالكامل.