跳到主要内容

腾讯 紫霄 (Zixiao)

产品概述

紫霄(Zixiao) 是腾讯蓬莱实验室研发的首款云端 AI 推理芯片2021-11-03,在 2021 腾讯数字生态大会上,腾讯高级执行副总裁、云与智慧产业事业群 CEO 汤道生首次对外公开腾讯造芯计划,同时披露三款自研芯片:面向 AI 计算的「紫霄」、面向视频处理的「沧海」、面向高性能网络的「玄灵」。腾讯云总裁邱跃鹏在会上表示,紫霄性能相比业界提升 100%,当时已流片成功并顺利点亮

紫霄的架构核心是打破 AI 芯片的「内存墙」:芯片采用 2.5D 封装技术合封 HBM2e 内存与 AI 核心,突破制约算力发挥的显存带宽瓶颈;同时在芯片内部增加计算机视觉(CV)加速器与视频编解码加速器,针对腾讯业务中高频的图片/视频处理、自然语言处理、搜索推荐等场景做定向优化。这是一款推理专用 NPU/ASIC,不面向训练

研发主体与合作模式:紫霄由腾讯蓬莱实验室(2020 年成立,专注芯片端到端设计与验证全覆盖) 主导架构与场景定义,燧原科技(上海燧原科技股份有限公司)深度参与联合研发——腾讯自 2018 年起投资燧原,目前为其第一大股东(持股约 20.5%)。芯片知识产权与落地归腾讯,主要供腾讯内部业务与腾讯云使用,不对外零售芯片

量产与落地:截至 2023 年,紫霄已实现量产并在腾讯多个头部业务规模部署,在腾讯业务场景中提供高达 3 倍的计算加速性能超过 45% 的整体成本节省,将语音转文字速度提升 4.7 倍、OCR 识别吞吐能力提升 2.4 倍。其标志性落地是腾讯会议实时字幕:紫霄已实现全量上线(覆盖会议字幕总流量 95% 以上),单卡紫霄机器负载可达 NVIDIA T4 的 4 倍,并将超时率从 0.005% 降低至 0,整体降低 75% 成本。其他应用包括广告推荐、OCR 文字识别、图像语音降噪、内容审核、混元大模型推理等,腾讯云亦对外提供搭载紫霄的推理加速实例。配套软件栈为腾讯自研的高性能推理运行时 LightRuntime(支持 Auto Batch、Auto Padding、多模型调度)。

核心规格

项目参数
架构腾讯自研 AI 推理 NPU/ASIC 架构(内置 CV 加速器 + 视频编解码加速器)
制程未公开(腾讯从未官宣;业界流传台积电 7nm,属未证实的供应链消息)
FP16 / BF16 算力未公开(第三方研报称紫霄 C100 性能接近 NVIDIA A10,FP16 峰值算力约为对比卡的 2 倍)
INT8 算力未公开
FP32 算力未公开
显存容量未公开
显存类型HBM2e(官方确认,2.5D 封装与 AI 核心合封)
显存带宽未公开
TDP未公开(第三方口径称相较 NVIDIA T4 等方案功耗降低约 70%)
互联未公开
接口未公开(以腾讯星星海定制服务器板卡形态部署)
封装2.5D 先进封装(HBM2e + AI 核心合封)
相对性能官方口径:性能相比业界提升 100%;业务场景 3 倍计算加速;单卡负载 = NVIDIA T4 的 4 倍
成本效益官方口径:整体成本节省超过 45%(腾讯会议场景降本 75%)
软件栈LightRuntime(腾讯自研高性能推理运行时,支持 ONNX、Auto Batch、Auto Padding、多 Session 调度)
发布2021-11-03(2021 腾讯数字生态大会)
量产/上市2023 年量产并在腾讯头部业务规模部署;仅内部与腾讯云使用,不对外零售

⚠️ 规格披露极为有限 腾讯从未公开发布紫霄的算力(TFLOPS/TOPS)、显存容量、显存带宽、TDP、制程等硬指标,官方仅确认「2.5D 封装 + HBM2e + 自研架构」以及相对性能提升比例。 网络流传的「台积电 7nm」为二手供应链消息,非腾讯确认信息;「紫霄 C100 性能接近 NVIDIA A10」出自第三方券商研报,亦非官方口径。本页所有「未公开」字段均不做推测填充。

后续演进

型号时间定位与公开信息
紫霄(V1)2021-11 发布 / 2023 量产纯 AI 推理 NPU,2.5D + HBM2e,覆盖 CV、NLP、推荐、广告、语音转写、OCR、混元大模型推理
紫霄 2.02026-07 发布(WAIC 2026)面向大模型训练与推理(训推一体);据腾讯云口径,训练性能相比上一代提升 4 倍,推理吞吐提升 3 倍

紫霄 2.0 相关信息说明:紫霄 2.0 于 2026-07 在 WAIC 2026 发布,据公开报道腾讯计划 2026 年新增自研紫霄芯片占比达 30%,年底部署规模扩至 10 万卡级别。有资料称紫霄 2.0 为腾讯「第六代自研 AI 芯片」,该表述来自 UGC 平台,可靠性待官方确认。在最高端训练算力上,紫霄 2.0 仍不及 NVIDIA H100/B200 级别,腾讯的训练算力自主路线为「自研紫霄 + 控股燧原」双线推进。

关键特性

  • 2.5D 封装 + HBM2e 破内存墙:将 HBM2e 与 AI 核心合封,专门解决推理场景的显存带宽瓶颈——这是紫霄最核心的架构创新
  • 内置 CV 加速器与视频编解码加速器:针对腾讯以图片/视频为主的业务负载做专用硬件卸载,而非纯通用矩阵引擎
  • 推理专用定位:V1 明确不做训练,架构与场景高度绑定腾讯自身业务
  • 官方性能口径:性能相比业界提升 100%;业务场景 3 倍计算加速;超过 45% 整体成本节省
  • 腾讯会议实时字幕标杆落地:全量上线,覆盖字幕总流量 95%+,单卡负载 4× T4,超时率降至 0,成本降 75%
  • 语音与 OCR 大幅提速:语音转文字提速 4.7 倍,OCR 吞吐提升 2.4 倍
  • LightRuntime 软件栈:Auto Batch 提升约 20% 吞吐、Auto Padding 自动分桶、多 Session 优先级调度;已在腾讯会议、微信等业务打磨
  • 混元大模型深度优化:与腾讯混元大模型协同调优
  • 腾讯—燧原协同研发模式:蓬莱实验室主导 + 燧原联合研发,腾讯持燧原约 20.5% 股权
  • 全栈闭环:紫霄芯片 + 星脉高性能网络 + 星星海定制服务器 + TI-One 平台 + 混元大模型
  • 局限:不对外销售;V1 不支持训练;硬规格长期不透明,无法进行同类横向算力对比

厂商信息

项目内容
公司腾讯控股有限公司(Tencent Holdings Ltd.,港交所 00700.HK
总部广东省深圳市南山区
成立1998 年 11 月
芯片研发主体蓬莱实验室(2020 年成立,负责芯片端到端设计与验证);香农实验室(参与沧海视频芯片)
联合研发方上海燧原科技股份有限公司(腾讯持股约 20.5%,第一大股东)
业务归属云与智慧产业事业群(CSIG)/ 腾讯云
自研芯片矩阵紫霄(AI 推理)、沧海(视频转码,2019 启动 / 2022 量产,已投用数万片)、玄灵(智能网卡,性能提升 4 倍)
其他芯片投资燧原科技(AI 芯片)、云豹智能(DPU)、曦智科技(光子芯片)、Barefoot Networks(可编程网络芯片)
销售模式不对外零售芯片,仅供腾讯内部业务与腾讯云推理加速实例
官网https://www.tencent.com

适用场景

  • ✅ 腾讯会议实时字幕 / 流式语音识别(标杆落地场景)
  • ✅ 微信 / 视频号内容推荐与广告推荐推理
  • ✅ OCR 文字识别、图像与语音降噪
  • ✅ 内容安全审核(图片/视频 CV 推理)
  • ✅ 腾讯混元大模型推理服务
  • ✅ 腾讯云对外推理加速实例(PaaS 形态交付)
  • ✅ 金融风控、医疗影像等推理负载
  • 对外采购芯片/整卡(腾讯不零售,仅通过腾讯云间接使用)
  • ❌ AI 大模型训练(V1 为纯推理架构;训练需用紫霄 2.0 或外部 GPU)
  • ❌ 图形渲染与通用 GPGPU 计算(专用 AI ASIC,无图形能力)
  • ❌ CUDA 生态直接迁移(需通过 LightRuntime / ONNX 路径适配)
  • ❌ 需要公开规格进行选型比较的场合(硬指标未披露)

相关卡

参考资料