GPU 云服务器对比:2026 年 AI 训练与推理选型指南
大模型爆发之后,GPU 云服务器成了最抢手的算力资源。H100 一度一卡难求,很多团队为了等机器让训练计划推迟数周。选择 GPU 实例不只是"越贵越好",它直接决定训练吞吐、推理延迟和月度账单——同样跑一个 70B 参数模型的微调,不同方案的月成本可以相差 3-5 倍。
参考:NVIDIA 数据中心 GPU 产品页 https://www.nvidia.com/en-us/data-center/
一、主流 GPU 规格对比
| GPU | 显存 | 适用场景 | 相对性能 | 参考时价 |
|---|---|---|---|---|
| H100 SXM | 80GB HBM3 | 大模型预训练 | 100% | $3-5 |
| H200 | 141GB HBM3e | 超大模型/长上下文 | 110% | $5-8 |
| A100 80GB | 80GB HBM2e | 通用训练/微调 | 60% | $1-3 |
| L40S | 48GB GDDR6 | 推理/渲染 | 40% | $0.5-1 |
| L4 | 24GB GDDR6 | 入门推理 | 15% | $0.3-0.5 |
要点:显存决定能装多大的模型。70B 参数模型以 BF16 加载大约需要 140GB 显存,单卡 H100 装不下,要么拆张量并行,要么直接上 H200。推理场景显存需求相对小,L4/L40S 往往够用,成本却低一个数量级。
二、各厂商 GPU 实例对比
2.1 AWS
| 实例 | GPU | 按需价格/小时 | 特点 |
|---|---|---|---|
| p5.48xlarge | 8×H100 | $134 | 大模型训练,NVLink 全互联 |
| p4d.24xlarge | 8×A100 | $32.77 | 通用训练,生态最成熟 |
| g5.xlarge | 1×A10G | $1.01 | 推理/渲染/Stable Diffusion |
| g4dn.xlarge | 1×T4 | $0.526 | 入门推理,成本极低 |
2.2 Azure
| 实例 | GPU | 按需价格/小时 |
|---|---|---|
| ND H100 v5 | 8×H100 | $30+ |
| NC A100 v4 | 4×A100 | $13.50 |
| NCas T4 v3 | 1×T4 | $1.35 |
2.3 GCP
| 实例 | GPU | 按需价格/小时 |
|---|---|---|
| a3-highgpu-8g | 8×H100 | $59.60 |
| a2-highgpu-8g | 8×A100 | $37.20 |
| g2-standard-4 | 1×L4 | $0.65 |
2.4 阿里云
| 实例 | GPU | 按需价格/小时 |
|---|---|---|
| ecs.gn7i-c32g1.4xlarge | 1×A100 | $14 |
| ecs.gn6i-c4g1.xlarge | 1×T4 | $0.82 |
2.5 性价比之选
| 服务商 | GPU 型号 | 每小时价格 | 特点 |
|---|---|---|---|
| Lambda Labs | H100 | $1.99 | 专注 GPU 云,价格透明 |
| Vast.ai | 各种 | $0.5-2 | 去中心化市场,量大价低 |
| RunPod | A100 80GB | $0.99 | 推理优化,Serverless 起步快 |
| Together.ai | 各种 | 按量 | API 模式,适合直接调用 |
参考:AWS EC2 定价页 https://aws.amazon.com/ec2/pricing/on-demand/
三、GPU 实例选型矩阵
| 场景 | 推荐 GPU | 推荐厂商 | 说明 |
|---|---|---|---|
| 大模型预训练 | 8×H100 | AWS/Azure | 需要高速互联(NVLink/IB) |
| LoRA/微调 | 1×A100 80GB | Lambda Labs | 单卡显存足够,性价比高 |
| 模型推理 | L4/T4 | GCP/阿里云 | 延迟敏感选就近区域 |
| Stable Diffusion | A10G | AWS g5 | 显存 24GB,出图速度快 |
| 视频渲染 | L40S | GCP | 渲染光栅化性能突出 |
这个矩阵不是一成不变的:模型迭代、显存需求、推理并发都会变,建议每季度复评一次选型。比如你从 7B 换成 70B 模型,单卡 L4 就装不下了,得提前规划预算和实例配额。
四、成本控制技巧
- 竞价/Spot 实例:可省 60-90%,适合可中断的批量任务,不适合在线推理。
- 预留实例:承诺 1-3 年使用,折扣可观,适合持续训练项目。
- 选对区域:同一规格不同区域价格差异可达 30%,但也要考虑数据合规和延迟。
- 用完即释放:训练完成及时释放实例,避免"忘了关机"的账单事故。
- 冷热分层:实验用 Spot,生产推理用按需,长跑任务用预留。
五、一个真实选型案例
假设你要微调一个 13B 参数模型,数据集约 10GB,预期训练 3 天:
- 方案 A:AWS p4d.24xlarge(8×A100)按需,约 $32.77/h × 72h ≈ $2,360;
- 方案 B:Lambda Labs 单卡 A100 80GB 按需,约 $1.5/h × 72h ≈ $108(放慢节奏但用 batching 仍高效);
- 方案 C:若任务可中断,用 AWS Spot 跑同样的 p4d,成本约为按需的 20-30%。
显然,单卡 + 时间换成本往往比堆多卡更划算——除非你的训练对墙钟时间有硬性要求。
这里还要提醒一点:GPU 实例的按需价只是起点,真正的成本还包括存储、网络流量和快照。训练脚本每秒写多少 checkpoint、日志保留多久,一个月下来可能差出几百美元。把实例、存储、流量三张账单合起来看,才是一个任务的真实成本。
六、一个推理服务的实际部署示例
选型不只发生在购买那一刻,落地部署同样影响体验。以开源推理框架 vLLM 为例,在 1×A100 80GB 实例上部署一个 7B 模型,只需一条命令:
# 拉取 vLLM 官方镜像并启动 OpenAI 兼容的推理服务
docker run --runtime nvidia --gpus all \
-p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.1-8B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.9
服务起来后,用 curl 就能测延迟和吞吐:
curl http://127.0.0.1:8000/v1/completions \
-H "Content-Type: application/json" \
-d '{"model":"meta-llama/Llama-3.1-8B-Instruct","prompt":"用一句话介绍GPU云服务器","max_tokens":64}'
这一步能把"规格表上的数字"变成"自己手里的实测数据"。同一个模型在不同厂商、不同区域的同规格实例上,首 token 延迟可能差 30%-80%,原因包括网络拓扑、虚拟化开销和存储 IO。上线前先跑一轮压测,比看任何宣传页都靠谱。
七、常见问题
8 卡和 4 卡差距多大? 理论上翻倍,但受限于数据并行/张量并行的通信效率,实测通常只有 1.6-1.8 倍。小模型或 batch 不大时,先试单卡更划算。
为什么有的"便宜"实例用起来很慢? 便宜往往意味着共享带宽、共享存储或老一代 GPU。把训练吞吐(tokens/s)和推理延迟(ms/token)列入对比,别只看时价。
预算有限,先训练还是先推理? 大多团队应该先保推理:训练可以慢,在线推理的延迟和可用性直接决定产品口碑。
16IDC 观察
GPU 选型没有"标准答案",只有"当前任务的最优解"。建议团队把算力账单按项目核算,记录每次任务的 GPU 型号、时长和花费,三个月后你就能看到:哪类任务该用 Spot、哪类该锁定预留实例、哪些模型其实不需要上 H100。