دليل Hugging Face
كيف تقرأ أي بطاقة نموذج وملف تهيئة في Hugging Face
تعلم كيف تفحص مستودعات النماذج المفتوحة كمهندس تعلم آلي لتقدير متطلبات VRAM الحقيقية قبل تنزيل عشرات الجيجابايتات من الملفات.
Interactive Hugging Face config.json Inspector
Click any line in the code block to see what it means, how it impacts your GPU, and the traps to avoid.
{
"model_type": "\"llama\"",weights "max_position_embeddings": 131072,context "num_hidden_layers": 32,attention "num_attention_heads": 32,attention "num_key_value_heads": 8,attention "head_dim": 128,attention "sliding_window": 4096,context "num_local_experts": 8,moe "num_experts_per_tok": 2,moe "torch_dtype": "\"bfloat16\"",weights}"num_key_value_heads": 8
Key-Value Heads (GQA Indicator)
The number of KV heads stored in the KV cache. When this value is smaller than num_attention_heads (here: 8 vs 32), the model uses Grouped-Query Attention (GQA).
In this example (8 KV heads vs 32 query heads), KV cache VRAM is slashed by 75%.
If num_key_value_heads equals num_attention_heads, the model uses legacy MHA and will consume 4x to 8x more VRAM for context!
1. فك شفرة config.json: المصدر الموثوق الوحيد
لا تعتمد على وصف ملف README فقط لمعرفة متطلبات العتاد. افتح دائمًا ملف config.json من تبويب 'Files and versions'. الحقول الأساسية هي: num_hidden_layers (عدد الطبقات)، hidden_size (عرض الطبقة)، num_attention_heads، و num_key_value_heads.
2. معرفة حد السياق الحقيقي (max_position_embeddings وتوسيع RoPE)
يحدد المعامل max_position_embeddings سياق التدريب الأصلي للنموذج. وإذا وجد قسم rope_scaling، فهذا يعني أن النموذج يستخدم تقنيات قياس التردد (مثل YaRN) لتوسيع السياق إلى أبعاد تتجاوز الحدود الأصلية.
3. فخ نماذج MoE: المعاملات النشطة مقابل المعاملات الإجمالية
في معماريات مزيج الخبراء (MoE) مثل Mixtral 8x7B وQwen 2.5 57B وDeepSeek V3 (إجمالي 671B، ونشط 37B)، يتم تنشيط جزء من المعاملات فقط لكل رمز أثناء الحساب. ولكن انتبه: يجب أن تستقر كامل الأوزان داخل VRAM. لا يمكنك تشغيل نموذج MoE بحجم 671B على كرت 48GB حتى لو كان الحساب الفعلي خفيفًا.
4. فهم لواحق تكميم GGUF (مثل Q4_K_M وIQ4_XS وFP8)
في مستودعات ملفات GGUF، تشير اللواحق إلى طريقة التكميم. الرمز Q4_K_M يدل على تكميم 4 بت متوسط (التوازن المثالي بين الجودة والذاكرة). واللواحق التي تبدأ بـ IQ (مثل IQ3_M أو IQ4_XS) تعتمد على مصفوفة الأهمية لتقديم أداء ممتاز بأقل حجم.
الأسئلة الشائعة
حجم الملف يمثل أوزان النموذج الساكنة فقط. أثناء التشغيل، تتطلب بطاقة GPU ذاكرة إضافية لمكتبات CUDA (~500MB إلى 1GB)، ومساحات التنشيط (Activations)، وتوسع ذاكرة KV المؤقتة مع طول المحادثة.
صيغة GGUF مصممة لـ llama.cpp وOllama وتدعم المشاركة بين المعالج والكرت. صيغتا AWQ وGPTQ مخصصتان لكروت الشاشة مع محركات vLLM وTensorRT-LLM. وصيغة EXL2 متخصصة لمحرك ExLlamaV2 على كروت Nvidia بتكميم دقيق.
راجع وسم الترخيص في أعلى المستودع واقرأ ملف LICENSE. تراخيص MIT وApache 2.0 وBSD تسمح بالاستخدام التجاري غير المقيد. بينما تضع تراخيص Llama 3 Community حدودًا لعدد المستخدمين وقيودًا على الاستخدام.
يوضح نوع معمارية الانتباه. إذا تساوى مع num_attention_heads فالنموذج يستخدم MHA. وإذا كان أصغر بكثير (مثل 8 مقابل 32)، فالنموذج يستخدم GQA مما يوفر مساحة ضخمة من VRAM.
في حقل architectures داخل config.json (مثل LlamaForCausalLM أو Qwen2ForCausalLM أو DeepseekV3ForCausalLM)، وهو ما يحدد توافقه مع محركات التشغيل المختلفة.
تحقق من أي نموذج على Hugging Face في حاسبتنا
أدخل معاملات النموذج أو اختر من كتالوجنا المعتمد لاحتساب متطلبات VRAM الفعلية على الفور.
Knowledge & Deep Dives
مركز المعرفة حول VRAM والنماذج اللغوية المحلية
أدلة تقنية شاملة، وتحليلات معمارية، وإرشادات لاختيار العتاد لمساعدتك على تشغيل نماذج الذكاء الاصطناعي محليًا بدقة وثقة مطلقة.