硬件选配与采购指南
本地大模型终极GPU选购指南
抛开游戏显卡测试帧率。深入理解为什么显存带宽决定了模型生成速度、不同参数级别大模型究竟需要多少显存,以及苹果Mac与英伟达PC的真实优劣势。
1. 本地大模型硬件黄金法则:带宽重于算力
在自回归大模型推理过程中,计算瓶颈极少出现在算力峰值(TFLOPS)上,而绝大多数时候都卡在显存带宽上:即模型权重从显存载入到计算核心的速度。
模型在生成每一个Token时,都必须将所有参数从显存完整遍历读取一遍。如果一张显卡算力很强但显存位宽极小,计算核心就会大部分时间处于空闲等待状态。
示例:一个70B模型在Q4量化下大约占用40GB显存。在一张显存带宽为936 GB/s的RTX 3090上,理论生成速度上限为 936 / 40 = 23.4 tokens/秒。如果将其放在带宽仅有60 GB/s的DDR5电脑内存中运行,速度将骤降至 60 / 40 = 1.5 tokens/秒。
2. 4个显存容量分级:你的硬件到底能跑多大模型?
7B至8B参数模型在Q4_K_M量化下运行(Llama 3 8B、Mistral 7B、Qwen 2.5 7B),支持8k以内短上下文。
RTX 3060 12G(预算首选)、RTX 4060 Ti 16G、RTX 5060 Ti 16G。
14B至32B参数模型在Q4_K_M量化下运行(Qwen 2.5 32B、Command-R),或通过极限量化(IQ2/Q3)运行70B模型。
RTX 3090 24G(二手高性价比毕业卡)、RTX 4090 24G、RTX 5090 32G。
在Q4_K_M高精度下流畅运行70B至72B大模型,支持32k超长上下文并开启FP8 KV缓存。
双路 RTX 3090(合计48GB)、双路 RTX 4090,或苹果 Mac Studio M2/M3/M4 Max(48GB至64GB)。
以Q8_0运行完整Llama 3.3 70B、以FP16运行Qwen 2.5 72B、全尺寸DeepSeek R1/V3蒸馏版,以及低比特Q2/Q3运行Llama 405B。
苹果 Mac Studio M2/M3 Ultra(128GB至192GB统一内存)或专业级4路显卡工作站。
3. 苹果Mac对比英伟达PC:大模型部署怎么选?
- 超大显存容量上限:单台安静的小主机即可获得128GB甚至192GB的大容量统一内存。
- 安静且低功耗:满载运行功耗仅为80W至120W,而多卡PC工作站动辄超过850W。
- 带宽相对有限:300至800 GB/s的带宽使得70B模型的生成速度维持在实用的15至25 tokens/秒。
- 软件生态现状:原生MLX和llama.cpp Metal表现出色,但无法使用基于CUDA的vLLM等生产级服务端优化库。
- 极致生成速度:RTX 4090高达1008 GB/s的显存带宽可提供30至60 tokens/秒的超高爆发速度。
- 绝对的行业标准:对CUDA、PyTorch、vLLM、TensorRT-LLM和FlashAttention-2提供100%原生支持。
- 消费级显存上限:单张消费级显卡最大仅24GB,跑70B模型必须组建复杂的多卡平台。
- 高功耗与发热:需要1000W以上的高品质电源、大风道机箱及强劲的散热环境支持。
4. 双卡搭建本地 70B 大模型工作站方案
如果你希望在PC上以满速运行70B密集模型,双卡方案是性价比最高的组装路线:
务必选购支持CPU通道 x8 / x8 拆分的主板,且两条PCIe槽之间至少预留3到4个槽位间距以保证进风散热。
电源预算建议选择 1200W 至 1500W 白金牌或钛金牌,以从容应对两张 RTX 3090 或 4090 的瞬时峰值功耗。
推荐使用 vLLM 开启张量并行(--tensor-parallel-size 2)或使用 llama.cpp 多卡模式将模型层平分到两张卡上。
常见问题解答
因为在本地大模型领域,显存容量才是硬道理。一张24GB的RTX 3090可以无压力将32B模型以Q4加载,或将14B密集模型以FP16配合32k上下文完整运行在显存中。而16GB的显卡无法完全容纳32B模型,被迫将部分层卸载到极其缓慢的系统内存。此外,RTX 3090拥有384-bit显存位宽及936 GB/s的显存带宽,显著优于RTX 4080的717 GB/s。
8GB显存足够用来入门体验7B或8B参数的Q4_K_M量化模型(上下文限制在4k至8k)。但如果用于严肃编程助手、长文档处理或同时带动高分屏显示,显存会极度捉襟见肘。若购买新卡,12GB至16GB是目前强烈推荐的起步底线。
完全可以。苹果统一内存架构允许GPU核心直接访问整个内存池,不存在PCIe传输损耗。64GB版本即可在Q4_K_M量化下流畅运行Llama 3.3 70B(占用约45GB),速度在15至22 tokens/秒左右。128GB或192GB版本更可运行FP16全精度70B模型或大型MoE架构,成本远低于等效PC多卡集群。
当模型100%装载在显存中时,数据流动速度在500至1000 GB/s之间。一旦部分层被卸载到系统内存,数据就必须通过PCIe接口传输(PCIe 4.0 x16速度极限仅约31.5 GB/s,DDR5内存速度约60至90 GB/s)。由于大模型推理受限于带宽,哪怕只卸载几层,速度也会从45 tokens/秒瞬间跌落至3到6 tokens/秒。
如果是为了运行70B大模型,答案是毫无疑问的肯定。单张RTX 4090只有24GB显存,无法完全装下量化版70B。双路3090可提供48GB大显存池(通过vLLM张量并行或llama.cpp分层),能以25+ tokens/秒的满速在全显存状态下运行70B,而二手总造价甚至低于一张全新的4090。
本地显卡显存不够用?
可在 AutoDL 或海外算力平台(RunPod / Vast.ai)按小时灵活租用 RTX 4090 或 H100 实例,低至每小时 ¥1.5 起。
Knowledge & Deep Dives
本地LLM与显存知识中心
深度技术指南、架构拆解与硬件选配手册,帮助开发者毫无压力地在本地部署、运行和扩展大语言模型。