NVIDIA 发布 Vera CPU:ARM 服务器选型新变量
2026 年 7 月,NVIDIA 发布了一批关于 Vera CPU 与 Rubin GPU 的重大技术信息,其中包括完整的 Vera 架构白皮书和 SPEC CPU 2026 基准成绩。Vera 是 NVIDIA 多年来首个自研 CPU 核心架构(代号 Olympus),其意义在于:NVIDIA 不再只想用 CPU 驱动自己的 GPU(就像 Grace 那样),而是要让 Vera 进入更广阔的服务器 CPU 市场。
过去几年,NVIDIA 的服务器 CPU 角色一直比较"专用":Grace 主要作为 Grace-Hopper 超算节点的配套芯片出现,围绕 GPU 提供内存与互连。Vera 的发布改变了这一叙事——它是一颗规格完整的通用 ARM 服务器处理器,与 Intel Xeon、AMD EPYC 以及 AWS Graviton 等 ARM 系芯片站在了同一赛道上。
Vera 是什么
与 Grace 相比,Vera 是一个全面跃升的 ARM 服务器处理器:
| 特性 | Grace | Vera |
|---|---|---|
| CPU 架构 | Arm Neoverse V2 | NVIDIA Olympus |
| 核心数 | 72 | 88 |
| 线程数 | 72 | 176(空间多线程) |
| 每核心 L2 | 1MB | 2MB |
| 统一 L3 | 114MB | 164MB |
| 内存带宽 | 最高 512GB/s | 最高 1.2TB/s |
| 内存容量 | 最高 480GB LPDDR5X | 最高 1.5TB LPDDR5X |
| SIMD | 4x 128b SVE2 | 6x 128b SVE2 FP8 |
| NVLink-C2C | 900GB/s | 1.8TB/s |
| PCIe/CXL | Gen5 | Gen6/CXL 3.1 |
| TDP | 250W | 250-450W |
架构亮点:Olympus 核心
- 强大的前端:神经分支预测器每个周期可输出 2 个分支;指令获取单元每周期可向解码队列送入多达 16 条 64 位指令,队列可容纳 48 条,解码器每周期输出最多 10 条融合指令。
- 超大 L1 缓存:每核心 64KB 4 路 L1 指令缓存(是 Zen 5 的两倍),搭配 96KB 6 路 L1 数据缓存,旨在应对更大的指令足迹。
- 18 条执行管线:8 条整数/分支管线、6 条向量/浮点管线(支持 FP8 低精度计算,2 条可处理 AES/SHA 等密码运算)、4 条加载、2 条存储,全部成对配置以支撑基于分区的空间多线程。
- 激进的乱序执行:采用内存重命名(在加载完成前执行依赖指令)、值预测(猜测并验证重复模式的值)和移动消除等技术提升指令级并行度。
- 图预取器:针对指针密集、间接寻址的图结构数据,在指针解析前预取最终目标内存地址——这是 AMD 和 Intel 目前都没有的预取方案。
关于 SPEC CPU 2026 成绩,值得冷静看待:基准数字说明的是在特定编译与配置下的峰值表现,实际部署中的吞吐、功耗与稳定性,必须结合真实工作负载验证。对选型者而言,更值得关注的是"1.2TB/s 内存带宽 + 176 线程 + FP8 支持"这个组合在 AI 推理场景下的实际表现。
对服务器选型意味着什么
Vera 的意义不只是"NVIDIA 又做了一颗 ARM CPU"。它意味着 ARM 服务器生态再添一位重量级玩家,与 Intel Xeon、AMD EPYC 以及众多 Arm 系 CPU 正面竞争。从评测评论的共识看,Vera 并不是要与既有处理器在所有通用工作负载上正面对决,而是瞄准 AI 服务器、尤其是 agentic AI 服务器:单核性能领先、高内存带宽、紧密耦合的并行计算能力,正好贴合 AI 推理与代理式应用的特点。
对云厂商和托管商而言,这预示着未来 ARM 云实例的选项会更丰富、价格竞争会更激烈;对开发者而言,意味着同样的预算可能买到更强的 ARM 算力,但也要重新评估软件栈在 ARM 上的兼容性。
对选型者来说,有几个务实的判断维度。一是软件生态:ARM 实例对容器、Kubernetes、常用语言运行时和数据库的兼容性已经相当成熟,但少数依赖 x86 特定指令或闭源二进制的老应用仍需实测验证。二是性价比:ARM 的核心密度与能效通常更高,在持续运行的 Web、缓存和微服务场景下往往更省成本。三是厂商锁定:确认是否能在云账号内自由迁移实例类型,避免被单一机型绑定。建议正式迁移前,先在一台小规格 ARM 实例上跑一遍真实工作负载并对比基准,而不是只看纸面参数。
一个选型场景
假设你要为一批 agentic AI 服务(多轮工具调用、检索增强)选型:这类负载的瓶颈往往不是 CPU 核心数,而是内存带宽与低延迟指令执行。对比三种方案:x86 通用实例每核带宽一般,Vera 类高带宽 ARM 实例带宽达到 1.2TB/s 且单核领先,Graviton 系则胜在生态成熟与价格平稳。如果应用已能稳定跑在 ARM 上,高带宽 ARM 实例在推理吞吐上通常更有吸引力;如果应用高度依赖 x86 二进制,则需要先做迁移测试再下结论。
16IDC 观察
服务器选型正在进入"ARM 与 x86 并行竞争"的阶段。如果你正在考虑 服务器选型,可以关注 ARM 实例的性价比变化,结合 云服务器价格对比和 服务器性能测试来做决策;AI 场景可对比 GPU 云服务器。更多内容请查看 服务器选型分类。
原文来源:https://www.servethehome.com/diving-deeper-on-nvidias-vera-cpu-new-architectural-details-and-spec-cpu-2026-benchmarks/
参考:https://www.servethehome.com/nvidia-vera-cpu-olympus-cores-and-spec-cpu-2026-benchmarks/(ServeTheHome 分析)