腾讯 紫霄 (Zixiao)
产品概述
紫霄(Zixiao) 是腾讯蓬莱实验室研发的首款云端 AI 推理芯片。2021-11-03,在 2021 腾讯数字生态大会上,腾讯高级执行副总裁、云与智慧产业事业群 CEO 汤道生首次对外公开腾讯造芯计划,同时披露三款自研芯片:面向 AI 计算的「紫霄」、面向视频处理的「沧海」、面向高性能网络的「玄灵」。腾讯云总裁邱跃鹏在会上表示,紫霄性能相比业界提升 100%,当时已流片成功并顺利点亮。
紫霄的架构核心是打破 AI 芯片的「内存墙」:芯片采用 2.5D 封装技术合封 HBM2e 内存与 AI 核心,突破制约算力发挥的显存带宽瓶颈;同时在芯片内部增加计算机视觉(CV)加速器与视频编解码加速器,针对腾讯业务中高频的图片/视频处理、自然语言处理、搜索推荐等场景做定向优化。这是一款推理专用 NPU/ASIC,不面向训练。
研发主体与合作模式:紫霄由腾讯蓬莱实验室(2020 年成立,专注芯片端到端设计与验证全覆盖) 主导架构与场景定义,燧原科技(上海燧原科技股份有限公司)深度参与联合研发——腾讯自 2018 年起投资燧原,目前为其第一大股东(持股约 20.5%)。芯片知识产权与落地归腾讯,主要供腾讯内部业务与腾讯云使用,不对外零售芯片。
量产与落地:截至 2023 年,紫霄已实现量产并在腾讯多个头部业务规模部署,在腾讯业务场景中提供高达 3 倍的计算加速性能与超过 45% 的整体成本节省,将语音转文字速度提升 4.7 倍、OCR 识别吞吐能力提升 2.4 倍。其标志性落地是腾讯会议实时字幕:紫霄已实现全量上线(覆盖会议字幕总流量 95% 以上),单卡紫霄机器负载可达 NVIDIA T4 的 4 倍,并将超时率从 0.005% 降低至 0,整体降低 75% 成本。其他应用包括广告推荐、OCR 文字识别、图像语音降噪、内容审核、混元大模型推理等,腾讯云亦对外提供搭载紫霄的推理加速实例。配套软件栈为腾讯自研的高性能推理运行时 LightRuntime(支持 Auto Batch、Auto Padding、多模型调度)。
核心规格
| 项目 | 参数 |
|---|---|
| 架构 | 腾讯自研 AI 推理 NPU/ASIC 架构(内置 CV 加速器 + 视频编解码加速器) |
| 制程 | 未公开(腾讯从未官宣;业界流传台积电 7nm,属未证实的供应链消息) |
| FP16 / BF16 算力 | 未公开(第三方研报称紫霄 C100 性能接近 NVIDIA A10,FP16 峰值算力约为对比卡的 2 倍) |
| INT8 算力 | 未公开 |
| FP32 算力 | 未公开 |
| 显存容量 | 未公开 |
| 显存类型 | HBM2e(官方确认,2.5D 封装与 AI 核心合封) |
| 显存带宽 | 未公开 |
| TDP | 未公开(第三方口径称相较 NVIDIA T4 等方案功耗降低约 70%) |
| 互联 | 未公开 |
| 接口 | 未公开(以腾讯星星海定制服务器板卡形态部署) |
| 封装 | 2.5D 先进封装(HBM2e + AI 核心合封) |
| 相对性能 | 官方口径:性能相比业界提升 100%;业务场景 3 倍计算加速;单卡负载 = NVIDIA T4 的 4 倍 |
| 成本效益 | 官方口径:整体成本节省超过 45%(腾讯会议场景降本 75%) |
| 软件栈 | LightRuntime(腾讯自研高性能推理运行时,支持 ONNX、Auto Batch、Auto Padding、多 Session 调度) |
| 发布 | 2021-11-03(2021 腾讯数字生态大会) |
| 量产/上市 | 2023 年量产并在腾讯头部业务规模部署;仅内部与腾讯云使用,不对外零售 |
⚠️ 规格披露极为有限 腾讯从未公开发布紫霄的算力(TFLOPS/TOPS)、显存容量、显存带宽、TDP、制程等硬指标,官方仅确认「2.5D 封装 + HBM2e + 自研架构」以及相对性能提升比例。 网络流传的「台积电 7nm」为二手供应链消息,非腾讯确认信息;「紫霄 C100 性能接近 NVIDIA A10」出自第三方券商研报,亦非官方口径。本页所有「未公开」字段均不做推测填充。
后续演进
| 型号 | 时间 | 定位与公开信息 |
|---|---|---|
| 紫霄(V1) | 2021-11 发布 / 2023 量产 | 纯 AI 推理 NPU,2.5D + HBM2e,覆盖 CV、NLP、推荐、广告、语音转写、OCR、混元大模型推理 |
| 紫霄 2.0 | 2026-07 发布(WAIC 2026) | 面向大模型训练与推理(训推一体);据腾讯云口径,训练性能相比上一代提升 4 倍,推理吞吐提升 3 倍 |
紫霄 2.0 相关信息说明:紫霄 2.0 于 2026-07 在 WAIC 2026 发布,据公开报道腾讯计划 2026 年新增自研紫霄芯片占比达 30%,年底部署规模扩至 10 万卡级别。有资料称紫霄 2.0 为腾讯「第六代自研 AI 芯片」,该表述来自 UGC 平台,可靠性待官方确认。在最高端训练算力上,紫霄 2.0 仍不及 NVIDIA H100/B200 级别,腾讯的训练算力自主路线为「自研紫霄 + 控股燧原」双线推进。
关键特性
- 2.5D 封装 + HBM2e 破内存墙:将 HBM2e 与 AI 核心合封,专门解决推理场景的显存带宽瓶颈——这是紫霄最核心的架构创新
- 内置 CV 加速器与视频编解码加速器:针对腾讯以图片/视频为主的业务负载做专用硬件卸载,而非纯通用矩阵引擎
- 推理专用定位:V1 明确不做训练,架构与场景高度绑定腾讯自身业务
- 官方性能口径:性能相比业界提升 100%;业务场景 3 倍计算加速;超过 45% 整体成本节省
- 腾讯会议实时字幕标杆落地:全量上线,覆盖字幕总流量 95%+,单卡负载 4× T4,超时率降至 0,成本降 75%
- 语音与 OCR 大幅提速:语音转文字提速 4.7 倍,OCR 吞吐提升 2.4 倍
- LightRuntime 软件栈:Auto Batch 提升约 20% 吞吐、Auto Padding 自动分桶、多 Session 优先级调度;已在腾讯会议、微信等业务打磨
- 混元大模型深度优化:与腾讯混元大模型协同调优
- 腾讯—燧原协同研发模式:蓬莱实验室主导 + 燧原联合研发,腾讯持燧原约 20.5% 股权
- 全栈闭环:紫霄芯片 + 星脉高性能网络 + 星星海定制服务器 + TI-One 平台 + 混元大模型
- 局限:不对外销售;V1 不支持训练;硬规格长期不透明,无法进行同类横向算力对比
厂商信息
| 项目 | 内容 |
|---|---|
| 公司 | 腾讯控股有限公司(Tencent Holdings Ltd.,港交所 00700.HK) |
| 总部 | 广东省深圳市南山区 |
| 成立 | 1998 年 11 月 |
| 芯片研发主体 | 蓬莱实验室(2020 年成立,负责芯片端到端设计与验证);香农实验室(参与沧海视频芯片) |
| 联合研发方 | 上海燧原科技股份有限公司(腾讯持股约 20.5%,第一大股东) |
| 业务归属 | 云与智慧产业事业群(CSIG)/ 腾讯云 |
| 自研芯片矩阵 | 紫霄(AI 推理)、沧海(视频转码,2019 启动 / 2022 量产,已投用数万片)、玄灵(智能网卡,性能提升 4 倍) |
| 其他芯片投资 | 燧原科技(AI 芯片)、云豹智能(DPU)、曦智科技(光子芯片)、Barefoot Networks(可编程网络芯片) |
| 销售模式 | 不对外零售芯片,仅供腾讯内部业务与腾讯云推理加速实例 |
| 官网 | https://www.tencent.com |
适用场景
- ✅ 腾讯会议实时字幕 / 流式语音识别(标杆落地场景)
- ✅ 微信 / 视频号内容推荐与广告推荐推理
- ✅ OCR 文字识别、图像与语音降噪
- ✅ 内容安全审核(图片/视频 CV 推理)
- ✅ 腾讯混元大模型推理服务
- ✅ 腾讯云对外推理加速实例(PaaS 形态交付)
- ✅ 金融风控、医疗影像等推理负载
- ❌ 对外采购芯片/整卡(腾讯不零售,仅通过腾讯云间接使用)
- ❌ AI 大模型训练(V1 为纯推理架构;训练需用紫霄 2.0 或外部 GPU)
- ❌ 图形渲染与通用 GPGPU 计算(专用 AI ASIC,无图形能力)
- ❌ CUDA 生态直接迁移(需通过 LightRuntime / ONNX 路径适配)
- ❌ 需要公开规格进行选型比较的场合(硬指标未披露)
相关卡
- Alibaba 含光 800 — 中国互联网大厂自研 AI 推理芯片直接对标(阿里平头哥,同为内部替代 NVIDIA T4 路线)
- Enflame 云燧 i20 — 燧原科技云端推理产品,紫霄的联合研发方自有产品线
- Enflame 云燧 i10 — 燧原第一代云端推理卡
- Moore Threads MTT S5000 — 国产全功能 GPU 路线对比(通用 GPU vs 专用 ASIC)
- MetaX 沐曦 曦云 C600 — 国产高端通用 GPU 对比
- Cambricon 寒武纪 MLU 370 — 国产 AI 专用加速芯片对比