AI 本地部署硬件选择指南:从入门到生产环境 GPU 选型

把 AI 模型部署在本地,可以获得更好的数据隐私、更低的延迟和可预测的成本:数据不出内网,单次请求的延迟不受公网波动影响,账单也不会因为调用量突增而失控,还能满足 数据合规的要求。但选择什么样的硬件,取决于你运行什么模型和什么规模。这篇文章从消费级显卡一路讲到数据中心 GPU,帮你把算力和预算对起来。

先算一笔账:一个模型到底需要多少显存

所有选型判断都从一行公式开始:

显存需求 ≈ 参数量 × 每参数字节数

以 7B 参数模型为例:FP16 精度约需 14GB 显存,4bit 量化后约 4-5GB;13B 模型 FP16 约 26GB、4bit 约 8GB;70B 模型 FP16 约 140GB、4bit 约 40GB。所以“能跑多大模型”几乎完全由显存决定——这也是整篇文章的主线。公式里还没算 KV cache 和推理框架本身的开销,实际部署建议在理论值基础上多留 20%-30% 的余量。

一、消费级 GPU 方案

1.1 NVIDIA GeForce 系列

NVIDIA 消费级显卡因其 CUDA 生态,是本地 AI 部署的首选。

显卡 VRAM 适用模型 价格区间 推荐度
RTX 4060 8GB 7B 以下模型 $300 ⭐⭐⭐
RTX 4070 12GB 7B-13B 模型 $550 ⭐⭐⭐⭐
RTX 4080 16GB 13B-30B 模型 $1000 ⭐⭐⭐⭐⭐
RTX 4090 24GB 30B-70B 模型(量化) $1600 ⭐⭐⭐⭐⭐

关键考虑: VRAM 大小决定了能运行多大的模型。7B 参数模型需要约 14GB FP16 或 4GB 4bit 量化。对个人开发者,4070(12GB)是性价比甜点:能跑 7B 量化加大部分 13B 量化,价格不到 4090 的一半。

1.2 Apple Silicon Mac

Apple Silicon(M1/M2/M3/M4 系列)的统一内存架构在 AI 推理方面有独特优势。

芯片 统一内存 适用模型 推荐度
M2/M3 Pro 18GB 7B 模型(量化) ⭐⭐⭐
M2/M3 Max 36-48GB 13B-30B 模型 ⭐⭐⭐⭐
M2 Ultra / M3 Ultra 64-192GB 70B-120B 模型 ⭐⭐⭐⭐⭐

优势: 大统一内存使得 Mac Studio/Pro 可以运行其他消费平台无法运行的超大模型。缺点也很明显:推理速度通常慢于同价位 N 卡,且 MLX 生态的模型数量远少于 CUDA。

1.3 AMD Radeon

AMD ROCm 生态正在改善,但目前仍不如 CUDA 成熟。

  • RX 7900 XTX:24GB VRAM,性价比高
  • 兼容性:需确认模型框架是否支持 ROCm
  • 推荐度:仅推荐给预算有限且愿意折腾 Linux 的用户

二、工作站/专业级方案

显卡 VRAM 适用场景 价格
RTX 6000 Ada 48GB 中型模型训练/推理 $6800
RTX A6000 48GB 多模型并行推理 $4500
A5000 24GB 入门工作站 $2500

这个档位卡在“消费级跑不下、服务器级又太贵”的中间地带。48GB 意味着可以单卡跑 30B 模型(量化后甚至 70B),适合给 3-5 人的小团队做共享推理服务。注意专业卡的溢价主要在显存和散热上,算力本身未必比同代消费卡高。

三、服务器级 GPU 方案

3.1 数据中心 GPU

GPU VRAM 适用场景 功耗
H100 SXM 80GB HBM3 大模型训练 700W
H200 141GB HBM3e 超大模型推理 700W
A100 80GB 80GB HBM2e 训练/推理通用 400W
L40S 48GB GDDR6 推理/渲染 350W
L4 24GB GDDR6 入门推理 72W

数据中心卡的价值不只在显存,还有 HBM 高带宽、NVLink 互联和更强的散热/稳定性设计。对大多数网站团队,H100 这类卡主要用来做模型微调和规模化推理,日常小模型推理用 L4 这类低功耗卡反而更划算。

3.2 云 GPU 服务器推荐

如果本地硬件投入太大,可以考虑 GPU 云服务器:

云厂商 GPU 实例 小时价格
NVIDIA DGX Cloud H100 $25+
AWS p5.48xlarge (8×H100) $134
Azure ND H100 v5 $30+
Lambda Labs 8×H100 $15
Vast.ai 各种 GPU $0.5-$5

云 GPU 的好处是按需付费、不用囤卡,适合需求不稳定或先验证的阶段;缺点是长期 24 小时跑推理时,半年租金就可能超过买一台机器的成本。建议用“每月利用率”来决策:利用率高于 60% 且持续 6 个月以上,就值得考虑自购。

四、内存和存储

  • 系统内存:至少 32GB,推荐 64GB+(CPU 卸载推理时,系统内存会直接决定能跑多大模型)
  • 存储:NVMe SSD,至少 1TB,推荐 2TB+(模型权重动辄几十 GB,加上数据集和日志,很快吃满)
  • 交换空间:在 HDD 上设置大量交换空间

如果主要用云 GPU,本地机器反而不必配得很高——一台带 32GB 内存的普通工作站充当管理机和代码仓库,算力按需租用即可。

五、软件生态

框架 CUDA ROCm Metal 推荐场景
Ollama 快速上手推理
llama.cpp CPU/混合推理
vLLM 高性能推理
TensorRT-LLM NVIDIA 优化
MLX Apple Silicon

软件生态往往比硬件参数更决定成败:同样的 24GB 卡,在 Ollama 里十分钟就能跑起来,在 vLLM 里能压出好几倍吞吐但配置复杂。建议先用 Ollama 验证“模型跑得动”,再按线上并发需求上 vLLM 或 TensorRT-LLM。

三个典型场景的结论

  • 个人学习/原型:RTX 4070 12GB 或 M3 Max,跑 7B-13B 量化足够;
  • 小团队推理服务:一张 RTX 6000 Ada(48GB)或两张 4090,支撑 30B 模型的中等并发;
  • 生产级/训练:多卡 H100/A100,或直接上云 GPU 实例,配合 AI 模型部署和AI 相关分类下的文章一起规划。

参考:NVIDIA 数据中心 GPU 官方规格见 https://www.nvidia.com/en-us/data-center/;Ollama 支持的模型与硬件要求见 https://ollama.com/;llama.cpp 项目见 https://github.com/ggml-org/llama.cpp