Skip to main content

海光 DCU Z100

产品概述

海光 DCU Z100 是海光信息深算系列 GPGPU 加速卡(属"深算一号"代际),基于 AMD CDNA 技术授权深度定制(架构代号 gfx906,CDNA 第一代),是海光"CPU + DCU"异构计算方案的核心。Z100 脱胎于 AMD 生态,可原生兼容 ROCm 开源计算平台,并通过海光自研 DTK(DCU Toolkit) 实现对 CUDA 应用低成本迁移,是国内"类 CUDA"生态成熟度最高的国产加速卡之一。

据北京大学高性能计算系统采购中标公告,Z100 拥有 8192 个通用计算核心、32GB HBM2 显存、FP64 算力 10.8 TFLOPS,硬件参数基本与 NVIDIA A100、AMD MI100 处于同代水平。Z100 与精简版 Z100L 同属深算一号产品家族,广泛部署于国家级超算中心(如昆山、成都、郑州超算)及运营商、银行智算中心。

核心规格

项目参数
架构GPGPU,基于 AMD CDNA 授权深度定制(gfx906 / CDNA 第一代)
制程7nm(推测,基于同代 Z100L 公开信息)
计算核心8192 个通用计算核心(北京大学中标公告)
FP64 算力10.8 TFLOPS(北京大学高性能计算系统中标公告,权威来源)
FP32 算力未公开(推测 ~10.8 TFLOPS,与 FP64 持平,类 CDNA 架构特性)
FP16 / BF16 算力未公开(推测 ~21.6 TFLOPS)
INT8 算力未公开(推测 ~43.2 TOPS)
显存容量32 GB
显存类型HBM2
显存带宽未公开(Z100L 为 1024 GB/s,Z100 应更高,推测 ~1.2 TB/s)
TDP~250 W(未公开,按产品资料推测)
互联xHMI 互联(深算系列,带宽 ~184 GB/s);PCIe 4.0
接口PCIe 4.0 ×16
发布2022(深算一号)
量产/上市已量产

⚠️ 规格说明FP64 10.8 TFLOPS / 8192 核心 / 32GB HBM2 来自北京大学高性能计算系统采购中标公告(HCZB-2021-ZB0364),为权威公开数据。FP32/FP16/INT8 算力及显存带宽、TDP 官方未单列,表中推测值来源于行业对比资料与 Z100L 同代参数,标注为推测,仅供参考。海光 DCU 全精度能力突出,双精度(FP64)性能对标 A100/MI100。

关键特性

  • 类 CUDA 生态:基于 ROCm 开源生态,DTK 工具链支持 HIP/CUDA 自动迁移
  • 全精度计算:具备 FP64/FP32/FP16/INT8 全精度能力,双精度尤为突出
  • x86 协同:与海光 C86 系列 CPU 组成全国产"CPU+DCU"异构整机方案
  • 大模型适配:已适配 LLaMa、GLM、通义千问、DeepSeek 等主流大模型

厂商信息

项目内容
公司海光信息技术股份有限公司
总部天津
成立2014 年
上市科创板 688041
技术来源AMD x86 / CDNA 授权 + 自研 DCU 架构

适用场景

  • 高性能计算(HPC)/ 科学计算(FP64 双精度优势)
  • 大模型训练与推理(ROCm/CUDA 迁移成本低)
  • 国家级超算/智算中心(国产自主可控)
  • 金融/能源/运营商数据中心
  • ❌ 极致低功耗边缘场景(TDP 较高,数据中心定位)
  • ❌ CUDA 原生强依赖且不愿迁移的场景

相关卡

参考资料