تخطَّ إلى المحتوى الرئيسي
Vantaige

معمارية النماذج وتحليل الذاكرة

ما هي ذاكرة KV المؤقتة؟ الحسابات، المعادلات وتقدير VRAM

افهم كيف يسرع التخزين المؤقت للمفاتيح والقيم التوليد التتابعي، ولماذا يسبب امتلاء VRAM في السياقات الطويلة، وكيف تخفض استهلاكه بنسبة 50% إلى 75%.

Interactive KV Cache Calculator

See how architecture, context tokens, and precision dictate real GPU memory consumption.

Architecture: gqa

32 layers · 32 query heads · 8 KV heads (4:1 GQA group)

32,768 tokens
1 sequence

Multi-user servers (like vLLM) multiply the KV cache by active parallel requests.

Calculated Memory Demand
4.00 GiBKV Cache only

Formula: 2 (Keys + Values) × 32 layers × 8 KV heads × 128 head dim × 32,768 tokens × 2 bytes

Model Weights (Q4_K_M):4.9 GiB
KV Cache (32k tokens):+4.00 GiB
Estimated Runtime Overhead:+1.0 GiB
Total Minimum VRAM Required:~9.9 GiB
Architectural Impact

Because this model uses GQA (8:1 ratio), this KV cache is 4x smaller than it would be with legacy MHA (which would have required 16.0 GiB).

Open Full VRAM Calculator for this Model

1. لماذا يتطلب التوليد التتابعي ذاكرة KV مؤقتة

في استدلال نماذج المحولات (Transformers)، يتم توليد الكلمات رمزًا تلو الآخر. لتوليد الرمز N، يجب على النموذج حساب الانتباه عبر كافة الرموز السابقة. بدون ذاكرة KV، سيتعين إعادة حساب متجهات المفاتيح والقيم لجميع الرموز السابقة في كل خطوة، مما يسبب تعقيدًا حسابيًا تربيعيًا O(N²).

عبر تخزين متجهات المفاتيح (Key) والقيم (Value) المحسوبة في VRAM، يظل الحساب خطيًا O(N) لكل رمز. لكن هذا يستبدل المعالجة بالذاكرة: كل رمز جديد تضيفه يوسع حجم ذاكرة KV حتى انتهاء التوليد.

2. المعادلة الرياضية الدقيقة

VRAM_KV (بايت) = 2 x عدد_الطبقات x رؤوس_kv x بعد_الرأس x طول_السياق x حجم_الدفعة x بايت_لكل_عنصر

المعامل 2 يمثل كلاً من المفاتيح والقيم. عدد_الطبقات هو عمق المحول، ورؤوس_kv عدد رؤوس المفاتيح والقيم، وبعد_الرأس أبعاد الرأس، وطول_السياق هو إجمالي الرموز النشطة.

مثال: نموذج Llama 3 8B بمعمارية GQA (8 رؤوس KV وبعد 128 و32 طبقة) بسياق 16k بدقة FP16 (2 بايت): 2 x 32 x 8 x 128 x 16,384 x 1 x 2 = 2.15 جيجابايت VRAM لتسلسل محادثة مستخدم واحد.

3. تطور المعماريات: MHA مقابل GQA مقابل MLA

Legacy
الانتباه متعدد الرؤوس (MHA)
كل رأس استعلام يمتلك رأس مفتاح وقيمة خاص به (مثل Llama 1 وGPT-3). دقة تعبيرية قصوى، ولكن ذاكرة KV تتضخم بسرعة هائلة في السياقات الطويلة.
Standard
انتباه الاستعلامات المجمعة (GQA)
تشترك عدة رؤوس استعلام في رأس مفتاح وقيمة واحد (Llama 3 وMistral وQwen 2.5). يقلص حجم ذاكرة KV بنسبة 75% إلى 87.5% دون فقدان ملحوظ للجودة.
Frontier
الانتباه الكامن متعدد الرؤوس (MLA)
يضغط متجهات المفاتيح والقيم في فضاء كامن منخفض الأبعاد (DeepSeek V2/V3/R1). يقلل استهلاك VRAM إلى كسر ضئيل مقارنة بـ GQA، مما يتيح سياقات ضخمة على عتاد منزلي.

4. كيفية تكميم ذاكرة KV (توفير 50% إلى 75% من الذاكرة)

بشكل افتراضي، تخزن محركات الاستدلال ذاكرة KV بدقة FP16 (2 بايت لكل عنصر). وبتكميم الذاكرة إلى FP8 (1 بايت) أو INT4 (0.5 بايت)، يمكنك تقليل استهلاك الذاكرة فورًا بنسبة 50% أو 75% دون المساس بأوزان النموذج الأصلية.

في محرك vLLM، أضف المعامل --kv-cache-dtype fp8. وفي llama.cpp، استخدم -ctk q8_0 -ctv q8_0 أو -ctk q4_0 -ctv q4_0 لتوفير عدة جيجابايت في محادثات 32k فما فوق.

الأسئلة الشائعة

يتوقف محرك الاستدلال فجأة بخطأ نفاد الذاكرة CUDA Out of Memory (OOM)، أو يتم حذف الرموز الأولى إذا تم تفعيل السياق المتدحرج. ترك هامش أمان كافٍ في VRAM أمر حاسم لتجنب الانهيار المفاجئ أثناء الإجابة.

يعتمد على إجمالي طول التسلسل (رموز المدخلات زائد رموز المخرجات). سؤال بطول 20 ألف رمز مع إجابة 2 ألف رمز يستهلك نفس ذاكرة سؤال بطول 2 ألف مع إجابة 20 ألف.

نعم. تؤكد الاختبارات المعيارية الموسعة أن تكميم ذاكرة KV بدقة FP8 يسبب تدهورًا لا يكاد يذكر في مهام التفكير والمنطق، مع توفير جيجابايتات قيّمة من VRAM لتوسيع السياق.

يتوسع بشكل خطي تام. إذا استخدم 4 مستخدمين النموذج بالتزامن بسياق 8k لكل منهم، يتضاعف استهلاك ذاكرة KV بمقدار 4 مرات. تستخدم محركات مثل vLLM تقنية PagedAttention لمنع هدر المساحات الفارغة.

تضغط MLA متجهات المفاتيح والقيم إلى متجه كامن مضغوط قبل تخزينه في الذاكرة المؤقتة، مما يخفض البصمة الذاكرية بنسبة تصل إلى 93% مقارنة بـ MHA التقليدي، مما يتيح تشغيل 128k رمز بسلاسة خارقة.

احسب متطلبات ذاكرة KV المؤقتة بدقة

استخدم حاسبة VRAM التفاعلية لتجربة أطوال سياق وأحجام دفعات مختلفة عبر مئات النماذج.

فتح حاسبة VRAM

Knowledge & Deep Dives

مركز المعرفة حول VRAM والنماذج اللغوية المحلية

أدلة تقنية شاملة، وتحليلات معمارية، وإرشادات لاختيار العتاد لمساعدتك على تشغيل نماذج الذكاء الاصطناعي محليًا بدقة وثقة مطلقة.

50+ مصطلح8 دقائق مرجعية
أتقن المصطلحات التقنية الأساسية: GGUF مقابل Safetensors، والتكميم، وذاكرة KV، وGQA، والذاكرة الموحدة في Apple.
بحث وتصفية تفاعلية حسب التصنيفات
إرشادات عملية حول العتاد لكل مصطلح
تعريفات دقيقة خالية من التعقيدات اللغوية
فهرس أبجدي سريع للوصول المباشر
قراءة الدليل
مفكك التكوين7 دقائق للقراءة
افحص مستودعات النماذج كمهندس تعلم آلي: فك شفرة config.json، وحدد حدود السياق الحقيقية، وتجنب فخ معمارية MoE.
أداة تفاعلية لفحص معاملات config.json
شرح قواعد تسميات تكميم GGUF
قواعد الذاكرة لمعاملات MoE النشطة مقابل الإجمالية
نافذة السياق ومعاملات توسيع RoPE
قراءة الدليل
مصفوفة التراخيص5 دقائق للقراءة
الفروق القانونية والعملية بين المصدر المفتوح الحقيقي المعتمد من OSI ونماذج الأوزان المفتوحة مثل Llama 3 وDeepSeek وQwen وGemma.
مصفوفة مقارنة تراخيص النماذج التفاعلية
حدود الاستخدام التجاري وسقوف عدد المستخدمين
قيود تقطير البيانات الاصطناعية لتدريب النماذج
قائمة التحقق للامتثال المؤسسي للشركات
قراءة الدليل
دليل العتاد8 دقائق للقراءة
تعرف على سبب تفوق النطاق الترددي على قوة المعالجة، والمقارنة بين أجهزة Mac وNvidia، وسعة VRAM المطلوبة للنماذج من 8B إلى 70B.
مستويات سعة VRAM (من 8GB إلى 128GB+)
معادلة النطاق الترددي للذاكرة مقابل المعالجة
مقارنة أجهزة Apple Silicon Mac مقابل حواسيب Nvidia
مخططات بناء محطة عمل ببطاقتي GPU لنماذج 70B
قراءة الدليل