华为昇腾 950 流片:国产算力第一次"正面比肩"的成色

2026 年 8 月 1 日,华为在深圳坂田基地宣布 昇腾 950 一次性流片成功,即将进入大规模量产。官方给出的核心数字是:FP16 精度下 1.6 PFLOPS 单卡峰值算力,号称国产 AI 芯片首次正面比肩英伟达 H200。同一天,澜起科技试产 CXL 3.2 内存控制器、中国开源模型下载量破 100 亿次——三件事凑在一起,国产算力迎来一次集中"放料"。

但"比肩"二字,得拆开看。

纸面规格:确实是国产最强

昇腾 950 采用中芯国际 N+2 工艺(等效 5nm),集成 1080 亿晶体管,搭载自研达芬奇 3.0 架构与 HBM3e 高带宽内存(96GB、带宽 4.6 TB/s),并首次集成"星脉"光互连模块,支持 8 卡全互连,单柜算力 12.8 PFLOPS。在 Llama-3 405B 训练测试中,集群性能较前代提升 2.7 倍。

华为把 950 拆成两个版本:950PR950DT,架构相同,AI 核心、内存规格与应用场景不同。

  • 950PR:最多 32 个 Cube 核心、64 个 Vector 核心,FP4 峰值 1784 TFLOPS,内存搭配自研 HiBL 1.0(128GB 或 112GB,带宽 1.4–1.6 TB/s),主打推理 Prefill 与推荐业务,成本比 HBM 系列低得多。
  • 950DT:最多 36 个 Cube 核心、72 个 Vector 核心,FP4 峰值 2007 TFLOPS,内存升级为 HiZQ 2.0(144GB 或 96GB,带宽高达 4 TB/s),面向推理 Decode 阶段和训练。

生态方面,950 兼容 PyTorch、MindSpore、vLLM、SGLang,并通过 CANN 7.0 工具链提供"一次开发、多端部署"。华为同步发布"昇腾万里计划",与 200+ 行业 ISV 合作;阿里云、腾讯云、百度智能云均已宣布上线 950 实例。

"比肩 H200"的边界在哪

把 950 和英伟达几代卡摆在一起,差距与突破都很清楚:

规格 昇腾 950DT 英伟达 H100 英伟达 H200 英伟达 B200
内存容量 144 / 96 GB 80 GB 141 GB 192 GB
内存带宽 4 TB/s 3.35 TB/s 4.8 TB/s 8 TB/s
FP16/BF16 约 900 TFLOPS(BF16) 约 1979 TFLOPS 约 1979 TFLOPS 4500 TFLOPS
FP4 约 2.0 PFLOPS 约 4 PFLOPS 9 PFLOPS(系统)
TDP 600 W 700 W 700 W 1000 W

结论分两层:

推理领域,逼近甚至局部反超。 在 FP4 低精度计算上,950PR 达到英伟达特供版 H20 的 2.87 倍;借助自研 HBM 与 HiF8 精度格式的取舍,在特定商用场景已具备较高性价比。这一档,它确实对得起"比肩"二字。

训练领域,仍需追赶。 旗舰级 AI 训练中,950 相较 H200 仍有差距,核心不在单卡浮点算力,而在内存带宽(4 TB/s vs 4.8 TB/s)。至于和最新的 B200 比,单卡代差更明显。但因为不受出口限制,950 的综合表现已远超专供中国市场的 H20。

真正的杀手锏:超节点架构

如果单卡还有代差,华为在系统级走出了差异化路线——超节点(SuperNode)。基于先进制程受限的客观约束,华为选择用规模换性能:

Atlas 950 超节点支持最高 8192 颗昇腾 950DT 芯片高速互联,FP8 精度下总算力达 8 EFLOPS,互联带宽高达 16.3 PB/s。支撑这套互联的是自研"灵衢 2.0"协议(Linx816),通信带宽较传统协议提升 15 倍,单跳时延从 2μs 降到 200ns,可靠性提升 100 倍、互联距离超 200 米。这套能力,让华为在万卡集群层面拿到了全球同类产品的领先身位。

生态才是长期的硬仗

硬件之外,生态仍是最难啃的骨头。英伟达 CUDA 多年构筑的迁移壁垒不是靠一颗芯片能填平的。但裂缝正在出现:DeepSeek 团队将模型从 A100/H800 全量迁移到昇腾 950PR 时,不是简单驱动移植,而是做了深度协同优化——这是国产模型与国产算力第一次出现"双向奔赴"的信号。

写在最后

昇腾 950 的意义,不在于某一项参数追平了谁,而在于它证明了一件事:在被封锁的制程下,靠架构创新和系统级工程,国产算力已经能摸到"可用、好用"的门槛。但"脚迈过去了"和"路通了"是两回事——单卡训练效率、软件生态成熟度、以及 960/970 路线图(N+3 工艺、四 Die 封装、能效较 910C 提升 30% 以上)能否如期兑现,才是接下来要盯的真问题。

对行业用户而言,当下最务实的判断是:推理与推荐场景,950 已经可以认真考虑了;前沿训练,仍要算清带宽与生态的账。