GPU 服务器选型:训练与推理算力匹配指南

AI 应用落地时,服务器选型里最容易"多花冤枉钱"的就是 GPU。原因很简单:训练和推理对硬件的需求完全不同,用训练的思路选推理机,或者反过来,都会浪费预算。本文从"你的工作负载"出发,讲清楚显存怎么算、卡怎么选、单卡还是多卡。

训练与推理是两种不同动物

  • 训练:需要把几十亿参数反复前向/反向传播,是典型的"算力密集 + 显存密集",通常要长时间占用整卡、多卡并行,并且依赖高带宽的卡间互联(如 NVLink)。
  • 推理:一次请求只跑一遍前向,更看重吞吐与延迟。很多推理场景显存占用远低于训练(因为不需要保存梯度),可以用更小、更便宜的卡,甚至用 MIG 把一张大卡切成多份给多个用户。

第一步:算清楚你需要多少显存

显存是 GPU 选型的第一约束。估算公式(以 FP16 精度、Transformer 模型为例):

  • 模型权重 ≈ 参数量 × 2 字节(FP16),例如 70B 模型 ≈ 140GB;
  • 训练还需叠加:优化器状态 + 梯度 + 激活值,通常会是权重的 2-3 倍以上;
  • 推理还需叠加 KV Cache 与输入输出序列占用。

直观结论:70B 参数模型,FP16 推理就需要 141GB 级别显存——这正是 NVIDIA H200(141GB HBM3e)这类卡的价值所在;7B 模型约 14GB,一张 L4 或 L40S 就够。用 INT8/FP8 量化可以把显存占用减半,进一步压低单卡规格。更精细的估算可配合LLM 推理优化一起看。

把公式落到具体数字上更直观。以 Llama 3 8B 为例:FP16 权重约 16GB,加上 KV Cache 与输入输出缓冲,一张 24GB 的 L4 就能跑起来,还留有余量;到了 70B 级别,FP16 权重约 140GB,叠加激活值与 KV Cache 后单卡放不下,就需要 8 卡并行或用 H200(141GB)单卡加量化。如果只做推理不做微调,还能用 AWQ/GPTQ 这类 4-bit 量化把 70B 压到约 40GB,一张 48GB 的 L40S 就能部署——代价是生成质量与速度的细微损失。先按"权重 + 推理开销(约 10%-20%)"粗算,再决定卡型,比凭感觉选卡稳妥得多。

第二步:理解卡型差异,别只看"几卡"

卡型 显存 显存带宽 典型定位
Blackwell Ultra(B300 等) 288GB 8TB/s 级 新一代超大模型训练/推理
H200 141GB HBM3e 4.8TB/s 大模型推理与通用训练
H100 80GB HBM3 3.35TB/s 通用训练主力
A100 80GB 80GB HBM2e 2TB/s 存量训练/推理
L40S / L4 48GB / 24GB 较低 中小模型推理、渲染、入门

以 H200 为例:它是首款搭载 HBM3e 的 GPU,官方数据显示相比 H100,Llama2 70B 推理速度最高提升约 1.9 倍、GPT-3 175B 提升约 1.6 倍,同时 FP16/BF16 Tensor Core 算力约 1979 TFLOPS,并支持 MIG 切分(最多 7 个实例)。对推理而言,显存带宽比峰值算力更关键——大模型推理是"喂数据"瓶颈,这也是 H200 提升明显的原因。

推理性能怎么量化

选推理机不能只看规格表,还要看两个数字:吞吐(tokens/s)首 token 延迟(TTFT)。同一张卡,在线对话追求低 TTFT,批量离线任务追求高吞吐,配置也会不同(如 batch size、KV Cache 复用)。常见做法是用 vLLM 这类推理引擎在目标模型上压测,记录不同并发下的吞吐曲线:并发 1 时看单请求延迟,并发 32-64 时看总吞吐是否还有提升空间。很多云厂商会公布参考数字,例如 H200 上 Llama2 70B 的吞吐可达约 3,000 tokens/s 级别(具体随量化、批大小与引擎变化)。先有这两个数字,再谈"够不够用",才不会买错。

第三步:单卡、多卡还是云 GPU

  • 单卡够用:中小模型推理、微调、Agent 应用,一张卡即可,优先看单卡显存与带宽,参考AI 托管部署
  • 多卡训练:大模型预训练需要多卡并行,卡间互联(NVLink/NVSwitch)决定扩展效率,硬件形态可参考HGX B300 服务器盘点
  • 云 GPU vs 自购:需求波动大、想快速试错就用云 GPU,厂商对比见GPU 云服务器对比;长期稳定高占用、追求单位成本,才值得考虑GPU 裸金属或自建。

第四步:常见误区

  1. 拿训练卡做轻推理:大显存卡按小时很贵,轻推理可用GPU Droplets这类入门方案起步。
  2. 只看显存不看带宽:同样是 80GB,HBM3 与 GDDR6 的推理速度天差地别。
  3. 忽略 MIG/切分:一张大卡切给多个低负载服务,利用率更高。
  4. 不评估扩展:先算清单卡容量,再决定是否需要多卡与集群网络(如 800G),避免架构返工。

一个具体选型案例

假设你要上线一个企业客服机器人,跑 7B 级开源模型,预期并发 50 路、响应控制在 2 秒内。粗略估算:7B 模型 FP16 权重约 14GB,加上 KV Cache 后单卡 24GB 的 L4 或 48GB 的 L40S 都够,重点看显存带宽能否支撑 50 路并发。这个负载完全不需要 H100/H200——按小时租用成本可能相差 5-10 倍。反过来,如果团队要每周微调一次模型,训练阶段就要按"多卡 + NVLink"规划,这时 H100 这类卡才进入射程。先明确负载是"持续推理为主"还是"周期训练为主",选型就成功了一大半。

选型速查

  • 7B 以下、轻推理 → 单张 L4/L40S 级别
  • 7B-70B 推理/微调 → H100/H200 单卡或 2-4 卡
  • 70B+ 预训练 → H200/B300 8 卡 + 高速互联
  • 预算有限/试错 → 先上Hetzner AI 方案等云 GPU

参考:https://www.nvidia.com/en-us/data-center/h200/https://docs.vllm.ai/en/latest/features/quantization/https://www.nvidia.com/en-us/data-center/hgx/

原文来源:https://www.nvidia.com/en-us/data-center/h200/