Apple 512 GB
Apple Silicon 512 GB unified memory
选择真实的开放模型,而不只是参数量,即可获得透明的显存估算、兼容的本地硬件以及匹配的 GPU 租用方案。
配置
商用注意事项: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
选择任意显卡,对比上方模型的显存占用、余量与预估速度。
Qwen3 8B · Q4_K_M · 8K tokens
RTX 4060
8 GiB · 1.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 5060
8 GiB · 1.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 3060
12 GiB · 5.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 4070 Super
12 GiB · 5.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 5070
12 GiB · 5.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 4060 Ti
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 4070 Ti Super
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 4080 Super
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 5070 Ti
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 5080
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RTX 5060 Ti
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
RX 7800 XT
16 GiB · 9.3 GiB 显存裕量
联盟链接 · Vantaige 可能获得佣金。
安全匹配结果包含操作系统或加速器预留空间;仅凭原始物理容量不足以保证安全运行。
当前配置下有 46 个 本地方案 适配 Qwen3 8B。从小起步,按需扩展。
Apple Silicon 512 GB unified memory
Apple Silicon 256 GB unified memory
Apple Silicon 192 GB unified memory
NVIDIA H200 141 GB
Apple Silicon 128 GB unified memory
NVIDIA RTX PRO 6000 Blackwell 96 GB
Apple Silicon 96 GB unified memory
NVIDIA H100 NVL 94 GB
NVIDIA A100 80 GB
NVIDIA H100 80 GB
AMD Ryzen Mini PC 64 GB unified memory
Apple Silicon 64 GB unified memory
NVIDIA RTX 6000 Ada 48 GB
NVIDIA RTX A6000 48 GB
NVIDIA A40 48 GB
NVIDIA L40S 48 GB
Apple Silicon 48 GB unified memory
NVIDIA A100 40 GB
Apple Silicon 36 GB unified memory
NVIDIA RTX 5090 32 GB
NVIDIA RTX 5000 Ada 32 GB
AMD Ryzen Mini PC 32 GB unified memory
NVIDIA RTX 3090 24 GB
NVIDIA RTX 4090 24 GB
AMD Radeon RX 7900 XTX 24 GB
NVIDIA L4 24 GB
NVIDIA A10 24 GB
NVIDIA A30 24 GB
Apple Silicon 24 GB unified memory
AMD Radeon RX 7900 XT 20 GB
NVIDIA RTX 4060 Ti 16 GB
NVIDIA RTX 4070 Ti Super 16 GB
NVIDIA RTX 4080 Super 16 GB
NVIDIA RTX 5070 Ti 16 GB
NVIDIA RTX 5080 16 GB
NVIDIA RTX 5060 Ti 16 GB
AMD Radeon RX 7800 XT 16 GB
AMD Radeon RX 9060 XT 16 GB
AMD Radeon RX 9070 16 GB
AMD Radeon RX 9070 XT 16 GB
Apple Silicon 16 GB unified memory
NVIDIA RTX 3060 12 GB
NVIDIA RTX 4070 Super 12 GB
NVIDIA RTX 5070 12 GB
NVIDIA RTX 4060 8 GB
NVIDIA RTX 5060 8 GB
NVIDIA RTX 2060 6 GB
参考价格以美元计,非实时报价。请向零售商核实最终价格与供货情况。部分购买链接可能会为我们带来佣金。
从 Ollama 默认量化开始。通过 ollama ps 确认实际显存占用。
速度指预估的解码(生成 token)速度,而非 prompt 处理速度。基于内存带宽、活跃权重大小及效率假设推算,非跑分基准。CPU 卸载可能显著变慢。AMD 运行时支持存在差异,购买前请务必确认兼容性。
无论你的第一个模型、下一次升级,还是探索更多可能性。
搞懂显卡显存、Apple 统一内存以及哪些配置才物有所值。
阅读指南 看懂数据弄清为何同一个模型在更长对话中会消耗更多显存。
阅读指南 理清许可在动手构建前,清楚了解哪些可以下载、修改及商业使用。
阅读指南知识与深度指南
深度技术指南、架构拆解与硬件选配手册,帮助开发者毫无压力地在本地部署、运行和扩展大语言模型。
估算很有用,但知晓其局限更为重要。
先算权重,再加 KV 缓存和框架开销。Q4 粗算:7–8B 约 5–8GB,14B 约 10–14GB,32B 约 20–24GB,稠密 70B 约 40–50GB+。别把磁盘文件大小当成最终显存,用上面的计算器带上量化和上下文。
Q4_K_M 权重大约 40GB 量级,加上短上下文和开销,按 45–50GB 显存规划。FP16 约 140GB,属于数据中心。单卡 24GB 没法在可用 Q4 质量下整卡装下。
不能整卡高质量 Q4。可以混合卸载,但 tok/s 往往只有个位数。能装下不等于丝滑。更现实的是双卡 24GB、48GB+、大统一内存的 Mac、更小的 MoE,或租云 GPU。
差很多。FP16 约 2 字节/参数,Q4_K_M 大约 0.5–0.6。7B 权重从约 14GB 降到 4–5GB。权重量化不会自动缩小 KV 缓存,长上下文还要单独量化缓存。
在计算器里选真实模型和量化、上下文:权重 + KV + 运行时。GGUF 体积只是下限。装载后再用 nvidia-smi 或 ollama ps 核对。
会。KV 缓存随 token 数和并发对话增长,32K/128K 时甚至能赶上权重。4K 能装下的模型,32K 可能爆显存。把上下文开到你真正用的长度,或对 KV 缓存进行量化。
能跑 7B/8B 的 Q4、短上下文,适合入门。现代写代码/Agent 和长上下文会紧。新购优先 12–16GB+。
本地推理优先显存容量。12GB 几乎总是赢过更快的 8GB。3060 12GB 能覆盖 13B/14B Q4;8GB 多半停在 7B/8B。
系统和 App 已经占几 GB。粗分:16GB 小模型,32GB 中等更从容,64GB+ 才比较现实去碰 70B。统一内存不是 100% 的独立显存。
常用、要隐私、要随时开,就买卡。偶发、要 48–80GB、或先验证 70B 再上双卡,就租(云 GPU / 算力云)。常见组合:本地一块卡跑日常 8B–32B,大活再租。
可以,GGUF/llama.cpp 在显存+内存够装模型时就能混跑。速度常掉到每秒几个 token,适合批处理,不适合要跟手的对话。在乎速度就换更小量化或能整卡放下的模型。
按显存档:约 8GB → 7–8B Q4;约 12GB → 13–14B;16–24GB → 20–32B;合计约 48GB → 稠密 70B Q4。务必把 KV 算进去,再用计算器确认。
文件大小只是权重。KV 缓存、激活值、桌面占用、显存碎片、长 prompt 都要另算。留足显存裕量、减小上下文、量化 KV 缓存,或选用更小量化。权重文件能放下不等于实际对话能装下。
显存跟总参数走(专家都要存),速度跟激活参数走。MoE 的优势是可以把专家卸到内存,不是显存会按激活规模自动变小。
48GB 合计是消费级跑 70B Q4 的常见方案。速度不会自动翻倍,层切分不强制 NVLink。还要考虑电源、散热和一点配置成本。
在主流的 Q4_K_M 量化下,静态权重约占用 5.5GB。配合 8k 默认上下文及 CUDA 运行环境,实际需要 7 至 8GB 显存。8GB 显存显卡(如 RTX 4060)刚好可整卡加载,而 12GB 显卡(如 RTX 3060)则可从容开启 16k 或 32k 更长上下文。
差距超过 10 倍。大模型生成属于典型的访存密集型任务,RTX 3090 / 4090 显存带宽高达 936 至 1008 GB/s,而双通道 DDR5 内存带宽仅约 60 至 80 GB/s。一旦显存不够发生 CPU 卸载,生成速度会从 30+ tokens/秒直接断崖式下跌至 1 到 2 tokens/秒。
70B 模型的 Q4_K_M 权重文件约为 42GB。在 32k 上下文并采用 GQA 分组查询注意力下,KV 缓存约需 4.5GB,加 1GB 的 CUDA 运行缓冲,实测总显存占用约 47.5 至 48GB。推荐使用双路 RTX 3090(合计 48GB 显存)或 64GB 统一内存的 Mac Studio。
因为 GGUF 文件仅包含静态参数。Ollama 启动加载后,会立即初始化 CUDA 上下文(约 500MB 到 1GB),并根据 num_ctx 配置参数预分配 KV 缓存显存空间。如果提示词较长或设置了 32k 上下文,显存占用比模型文件多出数个 GB 是完全正常的。
百元至千元入门级首选全新 RTX 3060 12GB,是运行 7B 至 14B 模型的性价比之王。中高端进阶玩家和严肃开发者最推荐二手 RTX 3090 24GB,拥有不可替代的 384-bit 位宽与 936 GB/s 显存带宽,单卡即可满速驾驭 32B 编程模型。
在本地运行大语言模型,意味着要同时把两样东西装进 GPU 显存:模型权重,以及会随激活上下文增长的 KV 缓存。权重大小很直接,就是参数量乘以每参数字节数,所以把模型从 FP16 量化到 Q4,能让体积大致缩减到四分之一。KV 缓存则容易被忽略:一个在 4K 上下文下刚好能装下的模型,到了 32K 上下文可能就会显存不足,因为缓存会随上下文长度扩大。这款计算器会同时估算这两项,并加上一小部分框架和激活内存的开销,再把总量与从 12GB 的 RTX 3060 到 80GB 的 H100 等常见 GPU 进行比对。
看看你的角色、业务或工作流程是否符合人们实际使用这个工具的方式。
Local LLM hobbyist / self-hoster
You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.
PC builder shopping for an AI GPU
You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.
ML engineer / data scientist sizing a deployment
You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.
Indie developer running a local AI coding assistant
You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.
更多免费工具
想构建提示词而不是评估硬件配置?试试AI 提示词生成器,或浏览完整的免费 AI 工具中心。