AI 本地部署硬件选择指南:从入门到生产环境 GPU 选型
把 AI 模型部署在本地,可以获得更好的数据隐私、更低的延迟和可预测的成本:数据不出内网,单次请求的延迟不受公网波动影响,账单也不会因为调用量突增而失控,还能满足 数据合规的要求。但选择什么样的硬件,取决于你运行什么模型和什么规模。这篇文章从消费级显卡一路讲到数据中心 GPU,帮你把算力和预算对起来。
先算一笔账:一个模型到底需要多少显存
所有选型判断都从一行公式开始:
显存需求 ≈ 参数量 × 每参数字节数
以 7B 参数模型为例:FP16 精度约需 14GB 显存,4bit 量化后约 4-5GB;13B 模型 FP16 约 26GB、4bit 约 8GB;70B 模型 FP16 约 140GB、4bit 约 40GB。所以“能跑多大模型”几乎完全由显存决定——这也是整篇文章的主线。公式里还没算 KV cache 和推理框架本身的开销,实际部署建议在理论值基础上多留 20%-30% 的余量。
一、消费级 GPU 方案
1.1 NVIDIA GeForce 系列
NVIDIA 消费级显卡因其 CUDA 生态,是本地 AI 部署的首选。
| 显卡 | VRAM | 适用模型 | 价格区间 | 推荐度 |
|---|---|---|---|---|
| RTX 4060 | 8GB | 7B 以下模型 | $300 | ⭐⭐⭐ |
| RTX 4070 | 12GB | 7B-13B 模型 | $550 | ⭐⭐⭐⭐ |
| RTX 4080 | 16GB | 13B-30B 模型 | $1000 | ⭐⭐⭐⭐⭐ |
| RTX 4090 | 24GB | 30B-70B 模型(量化) | $1600 | ⭐⭐⭐⭐⭐ |
关键考虑: VRAM 大小决定了能运行多大的模型。7B 参数模型需要约 14GB FP16 或 4GB 4bit 量化。对个人开发者,4070(12GB)是性价比甜点:能跑 7B 量化加大部分 13B 量化,价格不到 4090 的一半。
1.2 Apple Silicon Mac
Apple Silicon(M1/M2/M3/M4 系列)的统一内存架构在 AI 推理方面有独特优势。
| 芯片 | 统一内存 | 适用模型 | 推荐度 |
|---|---|---|---|
| M2/M3 Pro | 18GB | 7B 模型(量化) | ⭐⭐⭐ |
| M2/M3 Max | 36-48GB | 13B-30B 模型 | ⭐⭐⭐⭐ |
| M2 Ultra / M3 Ultra | 64-192GB | 70B-120B 模型 | ⭐⭐⭐⭐⭐ |
优势: 大统一内存使得 Mac Studio/Pro 可以运行其他消费平台无法运行的超大模型。缺点也很明显:推理速度通常慢于同价位 N 卡,且 MLX 生态的模型数量远少于 CUDA。
1.3 AMD Radeon
AMD ROCm 生态正在改善,但目前仍不如 CUDA 成熟。
- RX 7900 XTX:24GB VRAM,性价比高
- 兼容性:需确认模型框架是否支持 ROCm
- 推荐度:仅推荐给预算有限且愿意折腾 Linux 的用户
二、工作站/专业级方案
| 显卡 | VRAM | 适用场景 | 价格 |
|---|---|---|---|
| RTX 6000 Ada | 48GB | 中型模型训练/推理 | $6800 |
| RTX A6000 | 48GB | 多模型并行推理 | $4500 |
| A5000 | 24GB | 入门工作站 | $2500 |
这个档位卡在“消费级跑不下、服务器级又太贵”的中间地带。48GB 意味着可以单卡跑 30B 模型(量化后甚至 70B),适合给 3-5 人的小团队做共享推理服务。注意专业卡的溢价主要在显存和散热上,算力本身未必比同代消费卡高。
三、服务器级 GPU 方案
3.1 数据中心 GPU
| GPU | VRAM | 适用场景 | 功耗 |
|---|---|---|---|
| H100 SXM | 80GB HBM3 | 大模型训练 | 700W |
| H200 | 141GB HBM3e | 超大模型推理 | 700W |
| A100 80GB | 80GB HBM2e | 训练/推理通用 | 400W |
| L40S | 48GB GDDR6 | 推理/渲染 | 350W |
| L4 | 24GB GDDR6 | 入门推理 | 72W |
数据中心卡的价值不只在显存,还有 HBM 高带宽、NVLink 互联和更强的散热/稳定性设计。对大多数网站团队,H100 这类卡主要用来做模型微调和规模化推理,日常小模型推理用 L4 这类低功耗卡反而更划算。
3.2 云 GPU 服务器推荐
如果本地硬件投入太大,可以考虑 GPU 云服务器:
| 云厂商 | GPU 实例 | 小时价格 |
|---|---|---|
| NVIDIA DGX Cloud | H100 | $25+ |
| AWS | p5.48xlarge (8×H100) | $134 |
| Azure | ND H100 v5 | $30+ |
| Lambda Labs | 8×H100 | $15 |
| Vast.ai | 各种 GPU | $0.5-$5 |
云 GPU 的好处是按需付费、不用囤卡,适合需求不稳定或先验证的阶段;缺点是长期 24 小时跑推理时,半年租金就可能超过买一台机器的成本。建议用“每月利用率”来决策:利用率高于 60% 且持续 6 个月以上,就值得考虑自购。
四、内存和存储
- 系统内存:至少 32GB,推荐 64GB+(CPU 卸载推理时,系统内存会直接决定能跑多大模型)
- 存储:NVMe SSD,至少 1TB,推荐 2TB+(模型权重动辄几十 GB,加上数据集和日志,很快吃满)
- 交换空间:在 HDD 上设置大量交换空间
如果主要用云 GPU,本地机器反而不必配得很高——一台带 32GB 内存的普通工作站充当管理机和代码仓库,算力按需租用即可。
五、软件生态
| 框架 | CUDA | ROCm | Metal | 推荐场景 |
|---|---|---|---|---|
| Ollama | ✓ | ✓ | ✓ | 快速上手推理 |
| llama.cpp | ✓ | ✓ | ✓ | CPU/混合推理 |
| vLLM | ✓ | ✗ | ✗ | 高性能推理 |
| TensorRT-LLM | ✓ | ✗ | ✗ | NVIDIA 优化 |
| MLX | ✗ | ✗ | ✓ | Apple Silicon |
软件生态往往比硬件参数更决定成败:同样的 24GB 卡,在 Ollama 里十分钟就能跑起来,在 vLLM 里能压出好几倍吞吐但配置复杂。建议先用 Ollama 验证“模型跑得动”,再按线上并发需求上 vLLM 或 TensorRT-LLM。
三个典型场景的结论
- 个人学习/原型:RTX 4070 12GB 或 M3 Max,跑 7B-13B 量化足够;
- 小团队推理服务:一张 RTX 6000 Ada(48GB)或两张 4090,支撑 30B 模型的中等并发;
- 生产级/训练:多卡 H100/A100,或直接上云 GPU 实例,配合 AI 模型部署和AI 相关分类下的文章一起规划。
参考:NVIDIA 数据中心 GPU 官方规格见 https://www.nvidia.com/en-us/data-center/;Ollama 支持的模型与硬件要求见 https://ollama.com/;llama.cpp 项目见 https://github.com/ggml-org/llama.cpp。