跳到主要内容
Vantaige

硬件选配与采购指南

本地大模型终极GPU选购指南

抛开游戏显卡测试帧率。深入理解为什么显存带宽决定了模型生成速度、不同参数级别大模型究竟需要多少显存,以及苹果Mac与英伟达PC的真实优劣势。

1. 本地大模型硬件黄金法则:带宽重于算力

在自回归大模型推理过程中,计算瓶颈极少出现在算力峰值(TFLOPS)上,而绝大多数时候都卡在显存带宽上:即模型权重从显存载入到计算核心的速度。

模型在生成每一个Token时,都必须将所有参数从显存完整遍历读取一遍。如果一张显卡算力很强但显存位宽极小,计算核心就会大部分时间处于空闲等待状态。

理论最大速度(Tokens/秒)= 显存带宽(GB/s) / 模型显存占用(GB)

示例:一个70B模型在Q4量化下大约占用40GB显存。在一张显存带宽为936 GB/s的RTX 3090上,理论生成速度上限为 936 / 40 = 23.4 tokens/秒。如果将其放在带宽仅有60 GB/s的DDR5电脑内存中运行,速度将骤降至 60 / 40 = 1.5 tokens/秒。

2. 4个显存容量分级:你的硬件到底能跑多大模型?

入门级8-12 GiB 显存
8GB 至 12GB 显存档位

7B至8B参数模型在Q4_K_M量化下运行(Llama 3 8B、Mistral 7B、Qwen 2.5 7B),支持8k以内短上下文。

RTX 3060 12G(预算首选)、RTX 4060 Ti 16G、RTX 5060 Ti 16G。

适合人群:AI初学者、个人开发者、轻量级代码补全及预算有限的本地助手搭建者。
黄金甜点级16-24 GiB 显存
16GB 至 24GB 显存档位

14B至32B参数模型在Q4_K_M量化下运行(Qwen 2.5 32B、Command-R),或通过极限量化(IQ2/Q3)运行70B模型。

RTX 3090 24G(二手高性价比毕业卡)、RTX 4090 24G、RTX 5090 32G。

适合人群:高强度开发者、本地LoRA微调玩家、对推理精度要求极高的高智商32B代码模型使用者。
发烧进阶级32-48 GiB 内存/显存
32GB 至 48GB 档位(双卡 / Mac)

在Q4_K_M高精度下流畅运行70B至72B大模型,支持32k超长上下文并开启FP8 KV缓存。

双路 RTX 3090(合计48GB)、双路 RTX 4090,或苹果 Mac Studio M2/M3/M4 Max(48GB至64GB)。

适合人群:企业业务原型开发、海量文档总结提取、追求无妥协70B顶尖推理能力的专业玩家。
70B终极乐园64-128+ GiB 内存/显存
64GB 至 128GB+ 档位(Mac Studio / 专业多卡)

以Q8_0运行完整Llama 3.3 70B、以FP16运行Qwen 2.5 72B、全尺寸DeepSeek R1/V3蒸馏版,以及低比特Q2/Q3运行Llama 405B。

苹果 Mac Studio M2/M3 Ultra(128GB至192GB统一内存)或专业级4路显卡工作站。

适合人群:企业研发团队、前沿科研人员、追求完全离线且拥有顶尖推理大模型体验的核心用户。

3. 苹果Mac对比英伟达PC:大模型部署怎么选?

Apple Silicon(统一内存架构)
  • 超大显存容量上限:单台安静的小主机即可获得128GB甚至192GB的大容量统一内存。
  • 安静且低功耗:满载运行功耗仅为80W至120W,而多卡PC工作站动辄超过850W。
  • 带宽相对有限:300至800 GB/s的带宽使得70B模型的生成速度维持在实用的15至25 tokens/秒。
  • 软件生态现状:原生MLX和llama.cpp Metal表现出色,但无法使用基于CUDA的vLLM等生产级服务端优化库。
Nvidia PC工作站(CUDA生产级生态)
  • 极致生成速度:RTX 4090高达1008 GB/s的显存带宽可提供30至60 tokens/秒的超高爆发速度。
  • 绝对的行业标准:对CUDA、PyTorch、vLLM、TensorRT-LLM和FlashAttention-2提供100%原生支持。
  • 消费级显存上限:单张消费级显卡最大仅24GB,跑70B模型必须组建复杂的多卡平台。
  • 高功耗与发热:需要1000W以上的高品质电源、大风道机箱及强劲的散热环境支持。

4. 双卡搭建本地 70B 大模型工作站方案

如果你希望在PC上以满速运行70B密集模型,双卡方案是性价比最高的组装路线:

1. 主板PCIe通道支持

务必选购支持CPU通道 x8 / x8 拆分的主板,且两条PCIe槽之间至少预留3到4个槽位间距以保证进风散热。

2. 电源功率储备(PSU)

电源预算建议选择 1200W 至 1500W 白金牌或钛金牌,以从容应对两张 RTX 3090 或 4090 的瞬时峰值功耗。

3. 推理框架选择

推荐使用 vLLM 开启张量并行(--tensor-parallel-size 2)或使用 llama.cpp 多卡模式将模型层平分到两张卡上。

常见问题解答

因为在本地大模型领域,显存容量才是硬道理。一张24GB的RTX 3090可以无压力将32B模型以Q4加载,或将14B密集模型以FP16配合32k上下文完整运行在显存中。而16GB的显卡无法完全容纳32B模型,被迫将部分层卸载到极其缓慢的系统内存。此外,RTX 3090拥有384-bit显存位宽及936 GB/s的显存带宽,显著优于RTX 4080的717 GB/s。

8GB显存足够用来入门体验7B或8B参数的Q4_K_M量化模型(上下文限制在4k至8k)。但如果用于严肃编程助手、长文档处理或同时带动高分屏显示,显存会极度捉襟见肘。若购买新卡,12GB至16GB是目前强烈推荐的起步底线。

完全可以。苹果统一内存架构允许GPU核心直接访问整个内存池,不存在PCIe传输损耗。64GB版本即可在Q4_K_M量化下流畅运行Llama 3.3 70B(占用约45GB),速度在15至22 tokens/秒左右。128GB或192GB版本更可运行FP16全精度70B模型或大型MoE架构,成本远低于等效PC多卡集群。

当模型100%装载在显存中时,数据流动速度在500至1000 GB/s之间。一旦部分层被卸载到系统内存,数据就必须通过PCIe接口传输(PCIe 4.0 x16速度极限仅约31.5 GB/s,DDR5内存速度约60至90 GB/s)。由于大模型推理受限于带宽,哪怕只卸载几层,速度也会从45 tokens/秒瞬间跌落至3到6 tokens/秒。

如果是为了运行70B大模型,答案是毫无疑问的肯定。单张RTX 4090只有24GB显存,无法完全装下量化版70B。双路3090可提供48GB大显存池(通过vLLM张量并行或llama.cpp分层),能以25+ tokens/秒的满速在全显存状态下运行70B,而二手总造价甚至低于一张全新的4090。

本地显卡显存不够用?

可在 AutoDL 或海外算力平台(RunPod / Vast.ai)按小时灵活租用 RTX 4090 或 H100 实例,低至每小时 ¥1.5 起。

查看算力租赁价格

Knowledge & Deep Dives

本地LLM与显存知识中心

深度技术指南、架构拆解与硬件选配手册,帮助开发者毫无压力地在本地部署、运行和扩展大语言模型。

50+ 词条8 分钟参考
掌握高频技术词汇:GGUF与Safetensors对比、K-quants量化、KV缓存、GQA、MoE激活参数及苹果统一内存。
交互式搜索与分类筛选功能
每个词条配备实用硬件选购建议
通俗直白的专业定义,拒绝无用黑话
首字母快速检索索引
阅读指南
交互式工具6 分钟阅读
搞懂为什么长上下文会导致显存溢出(OOM)、精确数学计算公式,以及如何将KV缓存占用降低50%至75%。
交互式上下文显存计算器
MHA vs GQA vs DeepSeek MLA架构对比
FP8与INT4量化缓存带来的显存节省
多轮对话上下文显存开销拆解
阅读指南
配置解码器7 分钟阅读
像算法工程师一样审视Hugging Face仓库:解析config.json、识别真实上下文极限,避开MoE参数陷阱。
交互式config.json参数解析器
GGUF量化命名规则彻底拆解
MoE总参数与激活参数显存规则
上下文窗口与RoPE扩展参数详解
阅读指南
许可证矩阵5 分钟阅读
厘清真正符合OSI标准的开源AI与Llama 3、DeepSeek、Qwen 2.5等开放权重模型之间的商业法律差异。
热门模型许可证对比矩阵
商用限制与用户量门槛分析
合成数据蒸馏限制条款解读
企业出海与商业合规检查清单
阅读指南