AI 服务器选型:HGX B300 8-GPU 服务器盘点
AI 服务器正在成为数据中心里最热门的"硬件形态"。以 ServeTheHome 评测的 ASRock Rack 4U16X-GNR2 为例:它是一台 NVIDIA HGX B300 系统,搭载两颗 Intel Xeon 6"Granite Rapids"处理器、八块 NVIDIA Blackwell Ultra GPU、板载 NVLink 互连,是一款面向 AI 训练与推理的高端 GPU 服务器。8-GPU 拓扑是一种被充分验证、适配多种工作负载的经典配置。
一台典型的 AI GPU 服务器长什么样
这台 4U 机箱采用直接液冷(DLC),比风冷版本密度高得多;ASRock Rack 还提供使用 ZutaCore 两相冷却的版本,适合不想让水进循环的环境。硬件布局值得拆解:
- 计算:双路 Intel Xeon 6 + 8 块 Blackwell Ultra GPU,通过板载 NVLink 互连。
- 存储:前面板 12 个 2.5 英寸 U.2 NVMe 盘位,其中 2 个接 CPU、10 个接 PCIe 交换矩阵。
- 网络:仅前面板就有 8 个 OSFP 800Gbps 网口,未加任何 PCIe 网卡时即拥有超过 6.4Tbps 的网络带宽。
- 电源与散热:后部 10 个 3kW 80Plus 钛金电源提供冗余;两侧各一对大尺寸可热插拔风扇,底部中央还有三个小风扇负责中部散热。
- 管理:管理口与两个 1GbE(Intel i350)口默认在前端,可用内部线缆改到后部,一套机型适配多种机房布线需求。
选型时关注哪些参数
如果你是自建或采购 AI 服务器,这几个参数决定长期体验:
- GPU 数量与互连:8 卡 NVLink 全互连适合大模型训练与推理;更少的卡(如 4 卡)更便宜、更适合推理与微调。GPU 显存与带宽决定了能跑多大的模型。
- CPU 与内存:GPU 服务器仍需要一颗强劲的宿主 CPU 来调度数据,Intel Xeon 6 / AMD EPYC 是主流;内存容量影响预处理与模型加载。
- 网络:训练与多机推理需要高带宽低延迟的集群网络,800G 网口已是新一代标配。
- 存储:本地 NVMe 数量与 PCIe 连接方式(直连 CPU 还是经交换矩阵)影响数据加载速度。
- 散热与电力:液冷 vs 风冷决定机房改造成本与密度;电源冗余和功率预算要提前核算。
除了单机参数,还要考虑扩展性:8-GPU 服务器通常按机架集群规划,机柜的电力(单台 10 个 3kW 电源意味着很高的功率预算)、散热(液冷需要配套的 CDU 与管路)和网络(800G 交换机与布线)都要一起评估。很多团队低估了这类服务器的运维复杂度——固件更新、驱动与 CUDA 版本管理、NVLink 健康检查等都需要专门的运维能力,这也是为什么不少项目最终选择按需租用云上 GPU 实例,而不是自建。
一张表看懂 HGX 平台代际差异
很多人在选型时只盯着"几卡、多大显存",其实 HGX 平台本身的代际差异更值得关注。下面把几代常见平台的核心参数放在一起对比,数据以 NVIDIA 公开规格为准:
| 平台 | 单卡显存 | 显存带宽 | 卡间互连 | 典型单卡功耗 | 主要用途 |
|---|---|---|---|---|---|
| HGX A100 | 40/80GB HBM2e | 约 2TB/s | NVLink 600GB/s | 400W | 上一代训练/推理主力 |
| HGX H100 | 80GB HBM3 | 约 3.35TB/s | NVLink 900GB/s | 700W | 大模型训练标配 |
| HGX H200 | 141GB HBM3e | 约 4.8TB/s | NVLink 900GB/s | 700W | 显存敏感的大模型推理 |
| HGX B300 | 288GB HBM3e | 约 8TB/s | NVLink 5 全互连 | 约 1.2kW | 训练 + 大规模推理 |
从 A100 到 B300,单卡显存翻了 3-7 倍,带宽涨了约 4 倍。显存的含义很直接:它决定了单卡能装下多大的模型、长上下文能开多长。如果只是跑 7B-13B 量级的小模型,H100 或 H200 往往已经够用,B300 多出来的显存更多是为 70B 以上参数或超大上下文场景准备的,买之前先想清楚自己的模型规模和训练/推理比例,别为用不上的显存买单。
一个具体场景:70B 模型要多少显存
拿最常见的算账方式举例:想推理或微调一个 70B 参数的模型(Llama 3 70B 这个量级),显存要怎么算?
- 纯推理(FP16):权重约 140GB,加上 KV cache 和运行时开销,单卡 80GB 装不下,通常需要 2 张 80GB 卡或 1 张 141GB 的 H200;如果改用 8-bit 量化,权重降到约 70GB,一张 80GB 卡勉强能跑,但量化会损失少量精度。
- 全参微调(LoRA 除外):反向传播要额外存梯度与优化器状态,实际占用通常是权重的 3-4 倍,70B 全参微调基本要从 8 张 80GB 卡起步——这正是 8-GPU 拓扑最常见的落地场景。
- B300 的差别:单卡 288GB 意味着 70B 模型连同 KV cache 单卡就能装下,4 卡就能跑更大的批次,训练时的通信压力也随之下降。
这个例子说明:选 4 卡还是 8 卡,不是"越多越好",而是先算清楚模型大小、量化方式、训练还是推理这三件事,再反推需要多少显存与卡数。
选型中的几个常见误区
- 只盯 GPU,忽略网卡:训练时卡间与机间通信同样决定吞吐,NVLink 解决卡间,跨机仍要靠 800G 网卡与交换机,省网络的钱往往最亏。
- 把液冷当"可选项":B300 这类高功耗平台在风冷机房通常只能降频运行,密度与电力预算没算清楚,设备到了才发现机柜带不动。
- 以为自建一定比云上便宜:把机房改造、运维人力、电力损耗都算进去后,很多 8-GPU 项目按需租用云实例反而更划算。
- 忽略固件与驱动生命周期:Blackwell 平台的固件、NCCL、CUDA 版本耦合较紧,建议提前规划升级窗口与验证流程。
参考:NVIDIA HGX 平台规格 https://www.nvidia.com/en-us/data-center/hgx/
什么时候需要 8-GPU 服务器
8-GPU 服务器主要面向大模型训练、大规模推理和 agentic AI 场景。对大多数网站业务而言,它明显"超配"——更适合云厂商、AI 创业公司和重度算力需求方。普通团队更合适的路径是按需租用 GPU 云服务器,或参考 AI 模型托管部署与 本地 LLM 部署,先用小规模起步。
16IDC 观察
对绝大多数建站者,这份盘点更大的价值在于理解 AI 算力成本的结构:GPU 是核心,但网络、存储、散热和电力同样决定总成本。选购前建议先用 服务器成本计算估算预算,对比 VPS 与独立服务器,再用 性能测试验证。更多内容请查看 服务器选型分类。