英伟达 Vera CPU 量产:从卖 GPU 到卖整座"AI 工厂"

2026 年 6 月的 GTC Taipei 上,黄仁勋宣布 Vera Rubin 平台进入全面量产爬坡,首批客户和合作伙伴名单里写着 OpenAI、Anthropic、SpaceX、微软、戴尔、CoreWeave。到 7 月底,媒体确认其高端型号 Rubin Ultra Kyber 机架已被头部 AI 企业部署首批系统。

这件事的重心不在某颗 GPU,而在那颗很多人忽略的 Vera CPU——它标志着英伟达正式完成从"GPU 供应商"到"全栈算力工厂定义者"的身份跃迁。

Vera CPU:为 Agent 时代重造的中央处理器

传统认知里,英伟达是卖显卡的。但 AI 数据中心的瓶颈早已不只是显卡:一台能跑大模型的服务器,至少由加速卡(GPU/NPU)、中央处理器(CPU)、以及把成百上千张卡连成集群的网络与内存三块咬合而成。过去十年英伟达靠"GPU + CUDA"吃下大头,靠的是一整套开箱即用的体系,而不是单卡跑分。

Vera 就是补齐"CPU"那块的最后一块拼图。其关键设计:

  • Olympus 核心 + 高带宽 LPDDR5X 内存 + SOCAMM 模组,带宽较主流 x86(以 AMD EPYC Turin 为基准)提升 2 倍、每核心带宽提升 3 倍、能效提升 4 倍
  • 在代码编译、解释器、脚本运行、ETL、数据分析、图计算等工作负载下,相对主流 x86 CPU 加速至 1.8 倍(SQLite 1.4×、编译 1.6×、Python 1.7×、Regex 1.8×)。
  • 单计算芯片设计,避免跨小芯片延迟;海量内存带宽让 GPU 持续吃饱,减少智能体等待耗时。

它要干的核心活,是 ETL、KV 缓存管理和编排——也就是让 GPU 在强化学习、Agent 工作流、数据处理中始终保持高利用率。用英伟达自己的话说:Vera 让"代理式内循环"涡轮加速,最大化 AI 工厂输出。

Rubin GPU:每瓦代理吞吐提升 10 倍

与 Vera 搭档的 Rubin GPU,才是执行引擎:

  • 3360 亿晶体管,224 个 SM,896 个 Tensor Core;
  • HBM4 288GB,带宽高达 22 TB/s(较 Blackwell 提升 2.8 倍);
  • 第三代 Transformer 引擎,NVFP4 推理性能达 50 Petaflops
  • NVLink 6 提供 3600 GB/s 纵向扩展带宽,NVLink-C2C 提供 1800 GB/s CPU-GPU 一致性通信,x16 PCIe Gen6 提供 256 GB/s 主机连接。

针对 Agent 工作负载,Rubin 做了大量端到端优化:沿 K 维处理能力翻倍、把 MoE 描述符共享做进 TMA、用激活稀疏 + 自适应压缩加速长上下文注意力、把内核到内核的执行重叠从"批量触发"细化到"图块级触发"。目标只有一个:在长上下文、大 KV 缓存、交互式 token 生成这些最烧钱的路径上,把每瓦 token 产出推到极限。

三档平台:从 NVL72 到 NVL576

Rubin 系列按规模铺开:

  • Vera Rubin NVL72(代号 Oberon):2026 年生产爬坡,第三季度首批出货、第四季度规模量产。
  • Vera Rubin NVL144:88 核 Vera CPU + Rubin GPU,FP4 推理 3.6 EFLOPS,是 GB300 NVL72 的 3.3 倍,2026 下半年量产发货。
  • Rubin Ultra NVL576(Kyber 机架):576 颗 GPU 封装,FP4 峰值 15 EFLOPS、FP8 训练 5 EFLOPS,是 GB300 NVL72 的 14 倍,单机柜功耗 600kW,计划 2027 下半年量产。

在系统层面,Vera Rubin NVL72 把计算、网络、液冷、动力转向和智能功耗平滑(Power Smoothing)集成为单一执行域,平均功耗降低约 10%、50 毫秒峰值功耗降低约 20%,让同样的电力预算里塞进更多有效算力。

战略含义:垂直整合,重写算力规则

Vera 量产的时间点,被刻意选在 AMD 年度 AI 大会前一天。这背后是英伟达的终局逻辑:卖工厂,不卖零件。

过去云厂商搭 AI 集群,要从英伟达买 GPU、从英特尔或 AMD 买 CPU、从博通买交换机芯片,再自己系统集成。现在英伟达给的是一套开箱即用的完整方案——接入电力和冷却,AI 工厂就能转。CPU、GPU、网络三大核心组件第一次全部收归一家,x86 四十年靠生态绑定筑起的护城河,在"数据中心主任务从跑数据库变成跑神经网络"的这一刻,失去了大半意义。

这场变革的影响会以十年为单位计算。但对于押注开放生态、想避免被单一供应商锁死的云厂商来说,英伟达越往垂直闭环走,他们扶持 AMD、自研芯片的动力就越强——这恰恰是 AMD Helios、谷歌 Frozen v2、华为超节点同时浮现的根本原因。