AI 服务器选型:HGX B300 8-GPU 服务器盘点

AI 服务器正在成为数据中心里最热门的"硬件形态"。以 ServeTheHome 评测的 ASRock Rack 4U16X-GNR2 为例:它是一台 NVIDIA HGX B300 系统,搭载两颗 Intel Xeon 6"Granite Rapids"处理器、八块 NVIDIA Blackwell Ultra GPU、板载 NVLink 互连,是一款面向 AI 训练与推理的高端 GPU 服务器。8-GPU 拓扑是一种被充分验证、适配多种工作负载的经典配置。

一台典型的 AI GPU 服务器长什么样

这台 4U 机箱采用直接液冷(DLC),比风冷版本密度高得多;ASRock Rack 还提供使用 ZutaCore 两相冷却的版本,适合不想让水进循环的环境。硬件布局值得拆解:

  • 计算:双路 Intel Xeon 6 + 8 块 Blackwell Ultra GPU,通过板载 NVLink 互连。
  • 存储:前面板 12 个 2.5 英寸 U.2 NVMe 盘位,其中 2 个接 CPU、10 个接 PCIe 交换矩阵。
  • 网络:仅前面板就有 8 个 OSFP 800Gbps 网口,未加任何 PCIe 网卡时即拥有超过 6.4Tbps 的网络带宽。
  • 电源与散热:后部 10 个 3kW 80Plus 钛金电源提供冗余;两侧各一对大尺寸可热插拔风扇,底部中央还有三个小风扇负责中部散热。
  • 管理:管理口与两个 1GbE(Intel i350)口默认在前端,可用内部线缆改到后部,一套机型适配多种机房布线需求。

选型时关注哪些参数

如果你是自建或采购 AI 服务器,这几个参数决定长期体验:

  1. GPU 数量与互连:8 卡 NVLink 全互连适合大模型训练与推理;更少的卡(如 4 卡)更便宜、更适合推理与微调。GPU 显存与带宽决定了能跑多大的模型。
  2. CPU 与内存:GPU 服务器仍需要一颗强劲的宿主 CPU 来调度数据,Intel Xeon 6 / AMD EPYC 是主流;内存容量影响预处理与模型加载。
  3. 网络:训练与多机推理需要高带宽低延迟的集群网络,800G 网口已是新一代标配。
  4. 存储:本地 NVMe 数量与 PCIe 连接方式(直连 CPU 还是经交换矩阵)影响数据加载速度。
  5. 散热与电力:液冷 vs 风冷决定机房改造成本与密度;电源冗余和功率预算要提前核算。

除了单机参数,还要考虑扩展性:8-GPU 服务器通常按机架集群规划,机柜的电力(单台 10 个 3kW 电源意味着很高的功率预算)、散热(液冷需要配套的 CDU 与管路)和网络(800G 交换机与布线)都要一起评估。很多团队低估了这类服务器的运维复杂度——固件更新、驱动与 CUDA 版本管理、NVLink 健康检查等都需要专门的运维能力,这也是为什么不少项目最终选择按需租用云上 GPU 实例,而不是自建。

一张表看懂 HGX 平台代际差异

很多人在选型时只盯着"几卡、多大显存",其实 HGX 平台本身的代际差异更值得关注。下面把几代常见平台的核心参数放在一起对比,数据以 NVIDIA 公开规格为准:

平台 单卡显存 显存带宽 卡间互连 典型单卡功耗 主要用途
HGX A100 40/80GB HBM2e 约 2TB/s NVLink 600GB/s 400W 上一代训练/推理主力
HGX H100 80GB HBM3 约 3.35TB/s NVLink 900GB/s 700W 大模型训练标配
HGX H200 141GB HBM3e 约 4.8TB/s NVLink 900GB/s 700W 显存敏感的大模型推理
HGX B300 288GB HBM3e 约 8TB/s NVLink 5 全互连 约 1.2kW 训练 + 大规模推理

从 A100 到 B300,单卡显存翻了 3-7 倍,带宽涨了约 4 倍。显存的含义很直接:它决定了单卡能装下多大的模型、长上下文能开多长。如果只是跑 7B-13B 量级的小模型,H100 或 H200 往往已经够用,B300 多出来的显存更多是为 70B 以上参数或超大上下文场景准备的,买之前先想清楚自己的模型规模和训练/推理比例,别为用不上的显存买单。

一个具体场景:70B 模型要多少显存

拿最常见的算账方式举例:想推理或微调一个 70B 参数的模型(Llama 3 70B 这个量级),显存要怎么算?

  • 纯推理(FP16):权重约 140GB,加上 KV cache 和运行时开销,单卡 80GB 装不下,通常需要 2 张 80GB 卡或 1 张 141GB 的 H200;如果改用 8-bit 量化,权重降到约 70GB,一张 80GB 卡勉强能跑,但量化会损失少量精度。
  • 全参微调(LoRA 除外):反向传播要额外存梯度与优化器状态,实际占用通常是权重的 3-4 倍,70B 全参微调基本要从 8 张 80GB 卡起步——这正是 8-GPU 拓扑最常见的落地场景。
  • B300 的差别:单卡 288GB 意味着 70B 模型连同 KV cache 单卡就能装下,4 卡就能跑更大的批次,训练时的通信压力也随之下降。

这个例子说明:选 4 卡还是 8 卡,不是"越多越好",而是先算清楚模型大小、量化方式、训练还是推理这三件事,再反推需要多少显存与卡数。

选型中的几个常见误区

  • 只盯 GPU,忽略网卡:训练时卡间与机间通信同样决定吞吐,NVLink 解决卡间,跨机仍要靠 800G 网卡与交换机,省网络的钱往往最亏。
  • 把液冷当"可选项":B300 这类高功耗平台在风冷机房通常只能降频运行,密度与电力预算没算清楚,设备到了才发现机柜带不动。
  • 以为自建一定比云上便宜:把机房改造、运维人力、电力损耗都算进去后,很多 8-GPU 项目按需租用云实例反而更划算。
  • 忽略固件与驱动生命周期:Blackwell 平台的固件、NCCL、CUDA 版本耦合较紧,建议提前规划升级窗口与验证流程。

参考:NVIDIA HGX 平台规格 https://www.nvidia.com/en-us/data-center/hgx/

什么时候需要 8-GPU 服务器

8-GPU 服务器主要面向大模型训练、大规模推理和 agentic AI 场景。对大多数网站业务而言,它明显"超配"——更适合云厂商、AI 创业公司和重度算力需求方。普通团队更合适的路径是按需租用 GPU 云服务器,或参考 AI 模型托管部署本地 LLM 部署,先用小规模起步。

16IDC 观察

对绝大多数建站者,这份盘点更大的价值在于理解 AI 算力成本的结构:GPU 是核心,但网络、存储、散热和电力同样决定总成本。选购前建议先用 服务器成本计算估算预算,对比 VPS 与独立服务器,再用 性能测试验证。更多内容请查看 服务器选型分类。

原文来源:https://www.servethehome.com/asrock-rack-4u16x-gnr2-nvidia-hgx-b300-8-gpu-server-intel-zutacore-review/