تخطَّ إلى المحتوى الرئيسي
Vantaige

دليل Hugging Face

كيف تقرأ أي بطاقة نموذج وملف تهيئة في Hugging Face

تعلم كيف تفحص مستودعات النماذج المفتوحة كمهندس تعلم آلي لتقدير متطلبات VRAM الحقيقية قبل تنزيل عشرات الجيجابايتات من الملفات.

Interactive Hugging Face config.json Inspector

Click any line in the code block to see what it means, how it impacts your GPU, and the traps to avoid.

Interactive Code Walkthrough
config.json (Sample Architecture)Click a key to inspect
{
"model_type": "\"llama\"",weights
"max_position_embeddings": 131072,context
"num_hidden_layers": 32,attention
"num_attention_heads": 32,attention
"num_key_value_heads": 8,attention
"head_dim": 128,attention
"sliding_window": 4096,context
"num_local_experts": 8,moe
"num_experts_per_tok": 2,moe
"torch_dtype": "\"bfloat16\"",weights
}
Selected Parameterattention

"num_key_value_heads": 8

Key-Value Heads (GQA Indicator)

The number of KV heads stored in the KV cache. When this value is smaller than num_attention_heads (here: 8 vs 32), the model uses Grouped-Query Attention (GQA).

VRAM & Hardware Impact

In this example (8 KV heads vs 32 query heads), KV cache VRAM is slashed by 75%.

Common Pitfall / Confusion

If num_key_value_heads equals num_attention_heads, the model uses legacy MHA and will consume 4x to 8x more VRAM for context!

1. فك شفرة config.json: المصدر الموثوق الوحيد

لا تعتمد على وصف ملف README فقط لمعرفة متطلبات العتاد. افتح دائمًا ملف config.json من تبويب 'Files and versions'. الحقول الأساسية هي: num_hidden_layers (عدد الطبقات)، hidden_size (عرض الطبقة)، num_attention_heads، و num_key_value_heads.

2. معرفة حد السياق الحقيقي (max_position_embeddings وتوسيع RoPE)

يحدد المعامل max_position_embeddings سياق التدريب الأصلي للنموذج. وإذا وجد قسم rope_scaling، فهذا يعني أن النموذج يستخدم تقنيات قياس التردد (مثل YaRN) لتوسيع السياق إلى أبعاد تتجاوز الحدود الأصلية.

3. فخ نماذج MoE: المعاملات النشطة مقابل المعاملات الإجمالية

في معماريات مزيج الخبراء (MoE) مثل Mixtral 8x7B وQwen 2.5 57B وDeepSeek V3 (إجمالي 671B، ونشط 37B)، يتم تنشيط جزء من المعاملات فقط لكل رمز أثناء الحساب. ولكن انتبه: يجب أن تستقر كامل الأوزان داخل VRAM. لا يمكنك تشغيل نموذج MoE بحجم 671B على كرت 48GB حتى لو كان الحساب الفعلي خفيفًا.

4. فهم لواحق تكميم GGUF (مثل Q4_K_M وIQ4_XS وFP8)

في مستودعات ملفات GGUF، تشير اللواحق إلى طريقة التكميم. الرمز Q4_K_M يدل على تكميم 4 بت متوسط (التوازن المثالي بين الجودة والذاكرة). واللواحق التي تبدأ بـ IQ (مثل IQ3_M أو IQ4_XS) تعتمد على مصفوفة الأهمية لتقديم أداء ممتاز بأقل حجم.

الأسئلة الشائعة

حجم الملف يمثل أوزان النموذج الساكنة فقط. أثناء التشغيل، تتطلب بطاقة GPU ذاكرة إضافية لمكتبات CUDA (~500MB إلى 1GB)، ومساحات التنشيط (Activations)، وتوسع ذاكرة KV المؤقتة مع طول المحادثة.

صيغة GGUF مصممة لـ llama.cpp وOllama وتدعم المشاركة بين المعالج والكرت. صيغتا AWQ وGPTQ مخصصتان لكروت الشاشة مع محركات vLLM وTensorRT-LLM. وصيغة EXL2 متخصصة لمحرك ExLlamaV2 على كروت Nvidia بتكميم دقيق.

راجع وسم الترخيص في أعلى المستودع واقرأ ملف LICENSE. تراخيص MIT وApache 2.0 وBSD تسمح بالاستخدام التجاري غير المقيد. بينما تضع تراخيص Llama 3 Community حدودًا لعدد المستخدمين وقيودًا على الاستخدام.

يوضح نوع معمارية الانتباه. إذا تساوى مع num_attention_heads فالنموذج يستخدم MHA. وإذا كان أصغر بكثير (مثل 8 مقابل 32)، فالنموذج يستخدم GQA مما يوفر مساحة ضخمة من VRAM.

في حقل architectures داخل config.json (مثل LlamaForCausalLM أو Qwen2ForCausalLM أو DeepseekV3ForCausalLM)، وهو ما يحدد توافقه مع محركات التشغيل المختلفة.

تحقق من أي نموذج على Hugging Face في حاسبتنا

أدخل معاملات النموذج أو اختر من كتالوجنا المعتمد لاحتساب متطلبات VRAM الفعلية على الفور.

فتح حاسبة VRAM

Knowledge & Deep Dives

مركز المعرفة حول VRAM والنماذج اللغوية المحلية

أدلة تقنية شاملة، وتحليلات معمارية، وإرشادات لاختيار العتاد لمساعدتك على تشغيل نماذج الذكاء الاصطناعي محليًا بدقة وثقة مطلقة.

50+ مصطلح8 دقائق مرجعية
أتقن المصطلحات التقنية الأساسية: GGUF مقابل Safetensors، والتكميم، وذاكرة KV، وGQA، والذاكرة الموحدة في Apple.
بحث وتصفية تفاعلية حسب التصنيفات
إرشادات عملية حول العتاد لكل مصطلح
تعريفات دقيقة خالية من التعقيدات اللغوية
فهرس أبجدي سريع للوصول المباشر
قراءة الدليل
أداة تفاعلية6 دقائق للقراءة
افهم لماذا يتسبب طول السياق في استنزاف الذاكرة وأخطاء CUDA OOM، واكتشف المعادلة الرياضية وكيفية تقليل الاستهلاك بنسبة 50% إلى 75%.
حاسبة تفاعلية لذاكرة السياق
مقارنة معماريات MHA وGQA وDeepSeek MLA
توفير الذاكرة عبر تكميم FP8 وINT4 لذاكرة KV
استهلاك الذاكرة في المحادثات متعددة الجولات
قراءة الدليل
مصفوفة التراخيص5 دقائق للقراءة
الفروق القانونية والعملية بين المصدر المفتوح الحقيقي المعتمد من OSI ونماذج الأوزان المفتوحة مثل Llama 3 وDeepSeek وQwen وGemma.
مصفوفة مقارنة تراخيص النماذج التفاعلية
حدود الاستخدام التجاري وسقوف عدد المستخدمين
قيود تقطير البيانات الاصطناعية لتدريب النماذج
قائمة التحقق للامتثال المؤسسي للشركات
قراءة الدليل
دليل العتاد8 دقائق للقراءة
تعرف على سبب تفوق النطاق الترددي على قوة المعالجة، والمقارنة بين أجهزة Mac وNvidia، وسعة VRAM المطلوبة للنماذج من 8B إلى 70B.
مستويات سعة VRAM (من 8GB إلى 128GB+)
معادلة النطاق الترددي للذاكرة مقابل المعالجة
مقارنة أجهزة Apple Silicon Mac مقابل حواسيب Nvidia
مخططات بناء محطة عمل ببطاقتي GPU لنماذج 70B
قراءة الدليل