海光 DCU Z100
产品概述
海光 DCU Z100 是海光信息深算系列 GPGPU 加速卡(属"深算一号"代际),基于 AMD CDNA 技术授权深度定制(架构代号 gfx906,CDNA 第一代),是海光"CPU + DCU"异构计算方案的核心。Z100 脱胎于 AMD 生态,可原生兼容 ROCm 开源计算平台,并通过海光自研 DTK(DCU Toolkit) 实现对 CUDA 应用低成本迁移,是国内"类 CUDA"生态成熟度最高的国产加速卡之一。
据北京大学高性能计算系统采购中标公告,Z100 拥有 8192 个通用计算核心、32GB HBM2 显存、FP64 算力 10.8 TFLOPS,硬件参数基本与 NVIDIA A100、AMD MI100 处于同代水平。Z100 与精简版 Z100L 同属深算一号产品家族,广泛部署于国家级超算中心(如昆山、成都、郑州超算)及运营商、银行智算中心。
核心规格
| 项目 | 参数 |
|---|---|
| 架构 | GPGPU,基于 AMD CDNA 授权深度定制(gfx906 / CDNA 第一代) |
| 制程 | 7nm(推测,基于同代 Z100L 公开信息) |
| 计算核心 | 8192 个通用计算核心(北京大学中标公告) |
| FP64 算力 | 10.8 TFLOPS(北京大学高性能计算系统中标公告,权威来源) |
| FP32 算力 | 未公开(推测 ~10.8 TFLOPS,与 FP64 持平,类 CDNA 架构特性) |
| FP16 / BF16 算力 | 未公开(推测 ~21.6 TFLOPS) |
| INT8 算力 | 未公开(推测 ~43.2 TOPS) |
| 显存容量 | 32 GB |
| 显存类型 | HBM2 |
| 显存带宽 | 未公开(Z100L 为 1024 GB/s,Z100 应更高,推测 ~1.2 TB/s) |
| TDP | ~250 W(未公开,按产品资料推测) |
| 互联 | xHMI 互联(深算系列,带宽 ~184 GB/s);PCIe 4.0 |
| 接口 | PCIe 4.0 ×16 |
| 发布 | 2022(深算一号) |
| 量产/上市 | 已量产 |
⚠️ 规格说明:FP64 10.8 TFLOPS / 8192 核心 / 32GB HBM2 来自北京大学高性能计算系统采购中标公告(HCZB-2021-ZB0364),为权威公开数据。FP32/FP16/INT8 算力及显存带宽、TDP 官方未单列,表中推测值来源于行业对比资料与 Z100L 同代参数,标注为推测,仅供参考。海光 DCU 全精度能力突出,双精度(FP64)性能对标 A100/MI100。
关键特性
- 类 CUDA 生态:基于 ROCm 开源生态,DTK 工具链支持 HIP/CUDA 自动迁移
- 全精度计算:具备 FP64/FP32/FP16/INT8 全精度能力,双精度尤为突出
- x86 协同:与海光 C86 系列 CPU 组成全国产"CPU+DCU"异构整机方案
- 大模型适配:已适配 LLaMa、GLM、通义千问、DeepSeek 等主流大模型
厂商信息
| 项目 | 内容 |
|---|---|
| 公司 | 海光信息技术股份有限公司 |
| 总部 | 天津 |
| 成立 | 2014 年 |
| 上市 | 科创板 688041 |
| 技术来源 | AMD x86 / CDNA 授权 + 自研 DCU 架构 |
适用场景
- ✅ 高性能计算(HPC)/ 科学计算(FP64 双精度优势)
- ✅ 大模型训练与推理(ROCm/CUDA 迁移成本低)
- ✅ 国家级超算/智算中心(国产自主可控)
- ✅ 金融/能源/运营商数据中心
- ❌ 极致低功耗边缘场景(TDP 较高,数据中心定位)
- ❌ CUDA 原生强依赖且不愿迁移的场景
相关卡
- 海光 DCU Z100L — 同代精简版(算力/带宽下调)
- 海光 DCU K100 AI 版 — 深算三号 AI 优化版(FP16 192 TFLOPS)
- 寒武纪 思元590 (MLU590) — 国产 AI 训练竞品