跳到主要内容
旗舰 · 免费VRAM 计算器,哪款 GPU 能运行哪个模型? →
精选 AI 模型与时尚提示词包 →
Vantaige
小硬件,大潜能。

大想法,
小内存占用。大模型显存计算器:你的 GPU 能运行哪些模型?

选择真实的开放模型,而不只是参数量,即可获得透明的显存估算、兼容的本地硬件以及匹配的 GPU 租用方案。

你的下一套 AI 设备
可能已经摆在你的桌上了。

立即测算
64 个可用模型 · 搜索每日缓存的目录
01

配置

选择要运行的模型

实时估算
热门且亲民的模型
Apache-2.0 · 开源: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
Apache-2.0 · 开源: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
Apache-2.0 · 开源: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
Apache-2.0 · 开源: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
Apache-2.0 · 开源: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
MIT · 开源: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。
8.2B 参数GQA最多 128K 上下文开源模型卡 如何查看硬件规格

商用注意事项: 宽松开源许可证(例如 Apache-2.0 或 MIT)。在遵守版权和免责声明的前提下,通常允许商用、修改和自托管。

量化术语表

选择任意显卡,对比上方模型的显存占用、余量与预估速度。

8K tokens
高级假设
显存估算结果
兼容精确文件大小

可以运行 —— Qwen3 8B 应能在 RTX 4090 上运行,尚有 17.3 GiB 显存裕量。

6.7 GiB

Qwen3 8B · Q4_K_M · 8K tokens

所需加速器显存估算RTX 4090 · 24 GiB 容量
权重
4.7 GiB
KV 缓存
1.1 GiB
运行时
0.9 GiB
预估生成速度:
~140 tok/s(1008 GB/s 带宽估算)

RTX 4060

8 GiB · 1.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 5060

8 GiB · 1.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 3060

12 GiB · 5.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 4070 Super

12 GiB · 5.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 5070

12 GiB · 5.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 4060 Ti

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 4070 Ti Super

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 4080 Super

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 5070 Ti

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 5080

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RTX 5060 Ti

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

RX 7800 XT

16 GiB · 9.3 GiB 显存裕量

联盟链接 · Vantaige 可能获得佣金。

安全匹配结果包含操作系统或加速器预留空间;仅凭原始物理容量不足以保证安全运行。

恰到好处,杜绝浪费

为你模型寻找理想家园。

当前配置下有 46 个 本地方案 适配 Qwen3 8B。从小起步,按需扩展。

已根据你的参数校验显存适配
更多探索空间S

Apple 512 GB

Apple Silicon 512 GB unified memory

轻松适配+505 GiB
~111 tok/s解码预估512 GiB435 GiB GiB 可用
查看价格整机 · 参考价
查看价格
更多探索空间S

Apple 256 GB

Apple Silicon 256 GB unified memory

轻松适配+249 GiB
~111 tok/s解码预估256 GiB218 GiB GiB 可用
查看价格整机 · 参考价
查看价格
更多探索空间S

Apple 192 GB

Apple Silicon 192 GB unified memory

轻松适配+185 GiB
~111 tok/s解码预估192 GiB163 GiB GiB 可用
查看价格整机 · 参考价
查看价格
专业 / 云端S

H200

NVIDIA H200 141 GB

轻松适配+134 GiB
~666 tok/s解码预估141 GiB134 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
更多探索空间S

Apple 128 GB

Apple Silicon 128 GB unified memory

轻松适配+121 GiB
~111 tok/s解码预估128 GiB109 GiB GiB 可用
Amazon · Apple MacBook Pro 16 M4 Max 128GB unified memory整机 · 参考价
查看价格
CUDA 就绪S

RTX PRO 6000

NVIDIA RTX PRO 6000 Blackwell 96 GB

轻松适配+89.3 GiB
~250 tok/s解码预估96 GiB90.2 GiB GiB 可用
Newegg · PNY RTX PRO 6000 Blackwell 96GB仅显卡 · 参考价
查看价格
更多探索空间S

Apple 96 GB

Apple Silicon 96 GB unified memory

轻松适配+89.3 GiB
~56 tok/s解码预估96 GiB81.6 GiB GiB 可用
Amazon · Apple Mac Studio M3 Ultra 96GB unified memory整机 · 参考价
查看价格
专业 / 云端S

H100 NVL

NVIDIA H100 NVL 94 GB

轻松适配+87.3 GiB
~541 tok/s解码预估94 GiB89.3 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
专业 / 云端S

A100 80 GB

NVIDIA A100 80 GB

轻松适配+73.3 GiB
~283 tok/s解码预估80 GiB76.0 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
专业 / 云端S

H100 80 GB

NVIDIA H100 80 GB

轻松适配+73.3 GiB
~465 tok/s解码预估80 GiB76.0 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
更多探索空间S

Ryzen Mini 64 GB

AMD Ryzen Mini PC 64 GB unified memory

轻松适配+57.3 GiB
~12 tok/s解码预估64 GiB54.4 GiB GiB 可用
Amazon · Minisforum UM890 Pro Mini PC 64GB DDR5 OCuLink整机 · 参考价
查看价格
更多探索空间S

Apple 64 GB

Apple Silicon 64 GB unified memory

轻松适配+57.3 GiB
~56 tok/s解码预估64 GiB54.4 GiB GiB 可用
Amazon · Apple MacBook Pro 16 M4 Max 64GB unified memory整机 · 参考价
查看价格
CUDA 就绪S

RTX 6000 Ada

NVIDIA RTX 6000 Ada 48 GB

轻松适配+41.3 GiB
~133 tok/s解码预估48 GiB45.1 GiB GiB 可用
Newegg · PNY RTX 6000 Ada Generation 48GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX A6000

NVIDIA RTX A6000 48 GB

轻松适配+41.3 GiB
~107 tok/s解码预估48 GiB45.1 GiB GiB 可用
Amazon · PNY RTX A6000 48GB GDDR6仅显卡 · 参考价
查看价格
专业 / 云端S

A40

NVIDIA A40 48 GB

轻松适配+41.3 GiB
~97 tok/s解码预估48 GiB45.6 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
专业 / 云端S

L40S

NVIDIA L40S 48 GB

轻松适配+41.3 GiB
~120 tok/s解码预估48 GiB45.6 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
更多探索空间S

Apple 48 GB

Apple Silicon 48 GB unified memory

轻松适配+41.3 GiB
~42 tok/s解码预估48 GiB40.8 GiB GiB 可用
Amazon · Apple Mac mini M4 Pro 48GB unified memory整机 · 参考价
查看价格
专业 / 云端S

A100 40 GB

NVIDIA A100 40 GB

轻松适配+33.3 GiB
~216 tok/s解码预估40 GiB38.0 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
更多探索空间S

Apple 36 GB

Apple Silicon 36 GB unified memory

轻松适配+29.3 GiB
~21 tok/s解码预估36 GiB30.6 GiB GiB 可用
Amazon · Apple MacBook Pro 16 M4 36GB unified memory整机 · 参考价
查看价格
CUDA 就绪S

RTX 5090

NVIDIA RTX 5090 32 GB

轻松适配+25.3 GiB
~249 tok/s解码预估32 GiB29.4 GiB GiB 可用
Amazon · ASUS TUF Gaming RTX 5090 32GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 5000 Ada

NVIDIA RTX 5000 Ada 32 GB

轻松适配+25.3 GiB
~80 tok/s解码预估32 GiB30.1 GiB GiB 可用
Amazon · PNY RTX 5000 Ada Generation 32GB仅显卡 · 参考价
查看价格
更多探索空间S

Ryzen Mini 32 GB

AMD Ryzen Mini PC 32 GB unified memory

轻松适配+25.3 GiB
~12 tok/s解码预估32 GiB27.2 GiB GiB 可用
Amazon · Beelink SER8 Mini PC AMD Ryzen 7 32GB DDR5整机 · 参考价
查看价格
CUDA 就绪S

RTX 3090

NVIDIA RTX 3090 24 GB

轻松适配+17.3 GiB
~130 tok/s解码预估24 GiB22.1 GiB GiB 可用
Amazon · ASUS TUF Gaming OC RTX 3090 24GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 4090

NVIDIA RTX 4090 24 GB

轻松适配+17.3 GiB
~140 tok/s解码预估24 GiB22.1 GiB GiB 可用
Amazon · ASUS ROG Strix LC RTX 4090 24GB仅显卡 · 参考价
查看价格
更多探索空间S

RX 7900 XTX

AMD Radeon RX 7900 XTX 24 GB

轻松适配+17.3 GiB
~133 tok/s解码预估24 GiB22.1 GiB GiB 可用
Amazon · PowerColor Red Devil RX 7900 XTX 24GB仅显卡 · 参考价
查看价格
专业 / 云端S

L4

NVIDIA L4 24 GB

轻松适配+17.3 GiB
~42 tok/s解码预估24 GiB22.8 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
专业 / 云端S

A10

NVIDIA A10 24 GB

轻松适配+17.3 GiB
~83 tok/s解码预估24 GiB22.8 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
专业 / 云端S

A30

NVIDIA A30 24 GB

轻松适配+17.3 GiB
~130 tok/s解码预估24 GiB22.8 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格
更多探索空间S

Apple 24 GB

Apple Silicon 24 GB unified memory

轻松适配+17.3 GiB
~21 tok/s解码预估24 GiB20.0 GiB GiB 可用
Amazon · Apple Mac mini M4 24GB unified memory整机 · 参考价
查看价格
更多探索空间S

RX 7900 XT

AMD Radeon RX 7900 XT 20 GB

轻松适配+13.3 GiB
~111 tok/s解码预估20 GiB18.4 GiB GiB 可用
Amazon · Sapphire Pulse RX 7900 XT 20GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 4060 Ti

NVIDIA RTX 4060 Ti 16 GB

轻松适配+9.3 GiB
~40 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · GIGABYTE Gaming OC RTX 4060 Ti 16GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 4070 Ti Super

NVIDIA RTX 4070 Ti Super 16 GB

轻松适配+9.3 GiB
~93 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · GIGABYTE Gaming OC RTX 4070 Ti Super 16GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 4080 Super

NVIDIA RTX 4080 Super 16 GB

轻松适配+9.3 GiB
~102 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · GIGABYTE Windforce OC RTX 4080 Super 16GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 5070 Ti

NVIDIA RTX 5070 Ti 16 GB

轻松适配+9.3 GiB
~124 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · ASUS Prime RTX 5070 Ti 16GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 5080

NVIDIA RTX 5080 16 GB

轻松适配+9.3 GiB
~139 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · ASUS Prime RTX 5080 16GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 5060 Ti

NVIDIA RTX 5060 Ti 16 GB

轻松适配+9.3 GiB
~62 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · ASUS Prime RTX 5060 Ti 16GB仅显卡 · 参考价
查看价格
更多探索空间S

RX 7800 XT

AMD Radeon RX 7800 XT 16 GB

轻松适配+9.3 GiB
~87 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · ASRock Steel Legend RX 7800 XT 16GB OC仅显卡 · 参考价
查看价格
更多探索空间S

RX 9060 XT

AMD Radeon RX 9060 XT 16 GB

轻松适配+9.3 GiB
~67 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · ASUS Dual RX 9060 XT 16GB仅显卡 · 参考价
查看价格
更多探索空间S

RX 9070

AMD Radeon RX 9070 16 GB

轻松适配+9.3 GiB
~89 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · ASRock Challenger RX 9070 16GB OC仅显卡 · 参考价
查看价格
更多探索空间S

RX 9070 XT

AMD Radeon RX 9070 XT 16 GB

轻松适配+9.3 GiB
~107 tok/s解码预估16 GiB14.7 GiB GiB 可用
Amazon · PowerColor Red Devil RX 9070 XT 16GB仅显卡 · 参考价
查看价格
日常优选S

Apple 16 GB

Apple Silicon 16 GB unified memory

轻松适配+9.3 GiB
~17 tok/s解码预估16 GiB12.0 GiB GiB 可用
Amazon · Apple Mac mini M4 16GB unified memory整机 · 参考价
查看价格
CUDA 就绪S

RTX 3060

NVIDIA RTX 3060 12 GB

轻松适配+5.3 GiB
~50 tok/s解码预估12 GiB11.0 GiB GiB 可用
Amazon · MSI Gaming GeForce RTX 3060 12GB Ventus 2X OC仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 4070 Super

NVIDIA RTX 4070 Super 12 GB

轻松适配+5.3 GiB
~70 tok/s解码预估12 GiB11.0 GiB GiB 可用
Amazon · GIGABYTE Windforce OC RTX 4070 Super 12GB仅显卡 · 参考价
查看价格
CUDA 就绪S

RTX 5070

NVIDIA RTX 5070 12 GB

轻松适配+5.3 GiB
~93 tok/s解码预估12 GiB11.0 GiB GiB 可用
Amazon · GIGABYTE Windforce OC RTX 5070 12GB仅显卡 · 参考价
查看价格
CUDA 就绪C

RTX 4060

NVIDIA RTX 4060 8 GB

勉强容纳 · 裕量有限+1.3 GiB
~38 tok/s解码预估8 GiB7.0 GiB GiB 可用
Amazon · MSI Ventus 2X Black RTX 4060 8GB OC仅显卡 · 参考价
查看价格
CUDA 就绪C

RTX 5060

NVIDIA RTX 5060 8 GB

勉强容纳 · 裕量有限+1.3 GiB
~40 tok/s解码预估8 GiB7.0 GiB GiB 可用
Amazon · GIGABYTE AERO OC RTX 5060 8GB仅显卡 · 参考价
查看价格
CUDA 就绪F

RTX 2060

NVIDIA RTX 2060 6 GB

超出安全预算-0.7 GiB
需卸载至 CPU速度无法预估6 GiB5.0 GiB GiB 可用
查看价格仅显卡 · 参考价
查看价格

参考价格以美元计,非实时报价。请向零售商核实最终价格与供货情况。部分购买链接可能会为我们带来佣金。

从“能否跑得动”到敲下第一句 Prompt。

从 Ollama 默认量化开始。通过 ollama ps 确认实际显存占用。

速度指预估的解码(生成 token)速度,而非 prompt 处理速度。基于内存带宽、活跃权重大小及效率假设推算,非跑分基准。CPU 卸载可能显著变慢。AMD 运行时支持存在差异,购买前请务必确认兼容性。

多一点背景知识,少走很多弯路

读懂本地 AI 部署。

无论你的第一个模型、下一次升级,还是探索更多可能性。

知识与深度指南

本地 LLM 与显存知识中心

深度技术指南、架构拆解与硬件选配手册,帮助开发者毫无压力地在本地部署、运行和扩展大语言模型。

50+ 词条8 分钟参考
掌握高频技术词汇:GGUF与Safetensors对比、K-quants量化、KV缓存、GQA、MoE激活参数及苹果统一内存。
交互式搜索与分类筛选功能
每个词条配备实用硬件选购建议
通俗直白的专业定义,拒绝无用黑话
首字母快速检索索引
阅读指南
交互式工具6 分钟阅读
搞懂为什么长上下文会导致显存溢出(OOM)、精确数学计算公式,以及如何将KV缓存占用降低50%至75%。
交互式上下文显存计算器
MHA vs GQA vs DeepSeek MLA架构对比
FP8与INT4量化缓存带来的显存节省
多轮对话上下文显存开销拆解
阅读指南
配置解码器7 分钟阅读
像算法工程师一样审视Hugging Face仓库:解析config.json、识别真实上下文极限,避开MoE参数陷阱。
交互式config.json参数解析器
GGUF量化命名规则彻底拆解
MoE总参数与激活参数显存规则
上下文窗口与RoPE扩展参数详解
阅读指南
许可证矩阵5 分钟阅读
厘清真正符合OSI标准的开源AI与Llama 3、DeepSeek、Qwen 2.5等开放权重模型之间的商业法律差异。
热门模型许可证对比矩阵
商用限制与用户量门槛分析
合成数据蒸馏限制条款解读
企业出海与商业合规检查清单
阅读指南
硬件指南8 分钟阅读
深入解析为什么显存带宽比算力更重要、苹果统一内存与英伟达对比,以及8B到70B模型实际需要的显存配置。
显存容量分级(8GB至128GB+)
显存带宽与生成速度公式
Apple Silicon Mac对比Nvidia PC
双卡搭建本地70B工作站配置方案
阅读指南

几个关键问题。

估算很有用,但知晓其局限更为重要。

先算权重,再加 KV 缓存和框架开销。Q4 粗算:7–8B 约 5–8GB,14B 约 10–14GB,32B 约 20–24GB,稠密 70B 约 40–50GB+。别把磁盘文件大小当成最终显存,用上面的计算器带上量化和上下文。

Q4_K_M 权重大约 40GB 量级,加上短上下文和开销,按 45–50GB 显存规划。FP16 约 140GB,属于数据中心。单卡 24GB 没法在可用 Q4 质量下整卡装下。

不能整卡高质量 Q4。可以混合卸载,但 tok/s 往往只有个位数。能装下不等于丝滑。更现实的是双卡 24GB、48GB+、大统一内存的 Mac、更小的 MoE,或租云 GPU。

差很多。FP16 约 2 字节/参数,Q4_K_M 大约 0.5–0.6。7B 权重从约 14GB 降到 4–5GB。权重量化不会自动缩小 KV 缓存,长上下文还要单独量化缓存。

在计算器里选真实模型和量化、上下文:权重 + KV + 运行时。GGUF 体积只是下限。装载后再用 nvidia-smi 或 ollama ps 核对。

会。KV 缓存随 token 数和并发对话增长,32K/128K 时甚至能赶上权重。4K 能装下的模型,32K 可能爆显存。把上下文开到你真正用的长度,或对 KV 缓存进行量化。

能跑 7B/8B 的 Q4、短上下文,适合入门。现代写代码/Agent 和长上下文会紧。新购优先 12–16GB+。

本地推理优先显存容量。12GB 几乎总是赢过更快的 8GB。3060 12GB 能覆盖 13B/14B Q4;8GB 多半停在 7B/8B。

系统和 App 已经占几 GB。粗分:16GB 小模型,32GB 中等更从容,64GB+ 才比较现实去碰 70B。统一内存不是 100% 的独立显存。

常用、要隐私、要随时开,就买卡。偶发、要 48–80GB、或先验证 70B 再上双卡,就租(云 GPU / 算力云)。常见组合:本地一块卡跑日常 8B–32B,大活再租。

可以,GGUF/llama.cpp 在显存+内存够装模型时就能混跑。速度常掉到每秒几个 token,适合批处理,不适合要跟手的对话。在乎速度就换更小量化或能整卡放下的模型。

按显存档:约 8GB → 7–8B Q4;约 12GB → 13–14B;16–24GB → 20–32B;合计约 48GB → 稠密 70B Q4。务必把 KV 算进去,再用计算器确认。

文件大小只是权重。KV 缓存、激活值、桌面占用、显存碎片、长 prompt 都要另算。留足显存裕量、减小上下文、量化 KV 缓存,或选用更小量化。权重文件能放下不等于实际对话能装下。

显存跟总参数走(专家都要存),速度跟激活参数走。MoE 的优势是可以把专家卸到内存,不是显存会按激活规模自动变小。

48GB 合计是消费级跑 70B Q4 的常见方案。速度不会自动翻倍,层切分不强制 NVLink。还要考虑电源、散热和一点配置成本。

在主流的 Q4_K_M 量化下,静态权重约占用 5.5GB。配合 8k 默认上下文及 CUDA 运行环境,实际需要 7 至 8GB 显存。8GB 显存显卡(如 RTX 4060)刚好可整卡加载,而 12GB 显卡(如 RTX 3060)则可从容开启 16k 或 32k 更长上下文。

差距超过 10 倍。大模型生成属于典型的访存密集型任务,RTX 3090 / 4090 显存带宽高达 936 至 1008 GB/s,而双通道 DDR5 内存带宽仅约 60 至 80 GB/s。一旦显存不够发生 CPU 卸载,生成速度会从 30+ tokens/秒直接断崖式下跌至 1 到 2 tokens/秒。

70B 模型的 Q4_K_M 权重文件约为 42GB。在 32k 上下文并采用 GQA 分组查询注意力下,KV 缓存约需 4.5GB,加 1GB 的 CUDA 运行缓冲,实测总显存占用约 47.5 至 48GB。推荐使用双路 RTX 3090(合计 48GB 显存)或 64GB 统一内存的 Mac Studio。

因为 GGUF 文件仅包含静态参数。Ollama 启动加载后,会立即初始化 CUDA 上下文(约 500MB 到 1GB),并根据 num_ctx 配置参数预分配 KV 缓存显存空间。如果提示词较长或设置了 32k 上下文,显存占用比模型文件多出数个 GB 是完全正常的。

百元至千元入门级首选全新 RTX 3060 12GB,是运行 7B 至 14B 模型的性价比之王。中高端进阶玩家和严肃开发者最推荐二手 RTX 3090 24GB,拥有不可替代的 384-bit 位宽与 936 GB/s 显存带宽,单卡即可满速驾驭 32B 编程模型。

如何为本地 LLM 选配 GPU

在本地运行大语言模型,意味着要同时把两样东西装进 GPU 显存:模型权重,以及会随激活上下文增长的 KV 缓存。权重大小很直接,就是参数量乘以每参数字节数,所以把模型从 FP16 量化到 Q4,能让体积大致缩减到四分之一。KV 缓存则容易被忽略:一个在 4K 上下文下刚好能装下的模型,到了 32K 上下文可能就会显存不足,因为缓存会随上下文长度扩大。这款计算器会同时估算这两项,并加上一小部分框架和激活内存的开销,再把总量与从 12GB 的 RTX 3060 到 80GB 的 H100 等常见 GPU 进行比对。

这个工具适合谁使用?

看看你的角色、业务或工作流程是否符合人们实际使用这个工具的方式。

Local LLM hobbyist / self-hoster

You found a model on Hugging Face and want to know before downloading gigabytes of weights whether your exact GPU can run it, so you search can I run this LLM on my GPU.

PC builder shopping for an AI GPU

You are about to spend $800-2000 on a graphics card and want proof of which quantized models it will actually handle before buying, searching best GPU for local LLM VRAM.

ML engineer / data scientist sizing a deployment

You need to pick the right quantization level to fit a model on available inference hardware without OOM errors, searching GGUF quantization VRAM calculator.

Indie developer running a local AI coding assistant

You want Continue.dev or a similar VS Code plugin talking to Ollama instead of paying for Copilot, and search how much VRAM for local coding assistant to see what fits on your dev machine.

更多免费工具

想构建提示词而不是评估硬件配置?试试AI 提示词生成器,或浏览完整的免费 AI 工具中心。