跳到主要内容

Moore Threads 摩尔线程 MTT S5000 (国产 GPU 训练)

产品概述

摩尔线程(Moore Threads) 是中国全功能 GPU 创业公司,2020-10 成立,创始人为原 NVIDIA 中国区高管 张建中MTT S5000 是基于 第四代 MUSA "平湖" 架构 的训推一体 GPU 智算卡,2025-02-12 公开参数单卡 AI 算力 1000 TFLOPS80GB GDDR6X1.6 TB/s 带宽。配套自研 MUSA 统一系统架构 + MUSIFY 软件栈。

战略定位:相比华为昇腾专注 AI 训练,摩尔线程走全功能 GPU 路线(图形 + AI + 通用计算),是中国对标 NVIDIA 的国产 GPU 创业公司,与景嘉微、芯原微电子、燧原科技、壁仞科技并列为"国产 GPU 五虎"。

2026 年 6–7 月最新动态:完成对 MiniMax M3、智谱 GLM-5.2、阿里 Qwen3.5 的 Day-0 适配;2026-07-06 完成美团万亿参数大模型 LongCat-2.0 的 Day-0 适配,国产 AI 软件生态快速成熟。

核心规格

项目参数
架构MUSA(第四代,平湖)
制程TSMC 6nm(推测)
GPU 核心4096 个 MUSA Core(自研 ISA)
芯片PH100
显存80 GB(官方未公开颗粒类型;1.6 TB/s 带宽为 HBM 级)
内存带宽1.6 TB/s
FP8(稠密,官方口径)1,000 TFLOPS(液冷版 1000 / 风冷版 920)
BF16 / FP16~500 TFLOPS(按官方 FP8 稠密算力 1:2 推算,非官方直接公布)
FP3262.5 TFLOPS(推测)
INT82,000 TOPS(推测)
精度支持FP8 → FP64 全精度,含硬件级 FP8 Tensor Core
TDP300 W
PCIePCIe 5.0 ×16
互联MTLink 784 GB/s(8 卡节点内全互联)
板卡形态OAM(遵循 OAM 标准)/ PCIe;液冷 + 风冷双形态
发布2025-02-12(公开参数)
量产时间2025-Q1(公开参数)
安全认证《安全可靠测评结果公告(2026 年第 2 号)》(2026-05-26 通过,AI 训推芯片首次纳入该体系)
单价(OAM)~$4,000-6,000

📌 数据订正(2026-08 联网核实)

  • 显存类型:本站此前记为 "GDDR6X",与 1.6 TB/s 带宽自相矛盾(GDDR6X 上限约 1 TB/s,且 80GB 容量非 GDDR 常规配置)。摩尔线程官方仅公布「80GB 显存、1.6 TB/s 带宽」,未公开颗粒类型。已改为如实标注。
  • 算力精度口径:官方「单卡 AI 稠密算力 1000 TFLOPS」特指 FP8 精度(液冷版),非 FP16。FP16 约 500 TFLOPS。此前未标注精度,易被误读为 FP16 性能而高估。
  • 互联:官方为 MTLink 784 GB/s(原记「MUSA Link」无数值)。

MTT S5000 参数演进(2024 → 2025 版)

指标MTT S5000MTT S4000提升
制程7nm12nm新代
核心数40962048
显存48GB GDDR624GB GDDR6
带宽700 GB/s448 GB/s1.56×
FP3225 TFLOPS12 TFLOPS2.08×
BF1650 TFLOPS24 TFLOPS2.08×
互联MUSA Link 800 GB/s400 GB/s
TDP300W250W+20%

⚠️ 参数说明:上表为 MTT S5000 早期(2024)版本参数。2025-02-12 发布的现行量产版已升级为 80GB GDDR6X / 1.6 TB/s / 1000 TFLOPS 稠密 AI 算力(见上方核心规格)。

MUSA 架构

核心组件

组件说明
MUSA Core自研 SIMT 核心(类 CUDA Core)
Tensor Core自研矩阵单元(类 Tensor Core)
SFUSpecial Function Unit(超越函数)
RT Core硬件光追核心
MUSA Link8 卡全互联,784 GB/s 双向

与 NVIDIA CUDA 差异

维度MUSACUDA
核心架构SIMTSIMT
指令集自研(类 PTX)PTX / SASS
线程模型32 线程 / Warp32 线程 / Warp
软件栈成熟度3-4 年18 年
生态MUSIFY(类 CUDA)cuDNN / cuBLAS / NCCL
开发者基数~10K 开发者4M+ 开发者

软件栈 MUSIFY

层级工具对标 NVIDIA
AI 框架PyTorch-MUSAPyTorch + CUDA
TensorFlow-MUSATensorFlow
MindSporeMindSpore 兼容
编译器MUSA CCnvcc
运行时MUSA RuntimeCUDA Runtime
数学库MUSBlascuBLAS
深度学习库MUDNNcuDNN
通信库MUSA CCNCCL
图形 APIVulkan / OpenGL / DirectX同样

⚠️ 生态限制:MUSIFY 生态仅 3-4 年发展,算子覆盖率约 70-80%(vs CUDA 99%+),复杂 LLM 模型需要大量手工优化或降级到 CPU 回退。

厂商信息

项目内容
公司摩尔线程智能科技(北京)有限责任公司
创始人张建中(原 NVIDIA 中国区总经理)
成立2020-10
融资$500M+(A 轮 2021、B 轮 2022、C 轮 2023)
估值(2025)~¥35B
2025 营收~¥2.2B
总部北京市朝阳区
官网https://www.mthreads.com
状态准备科创板 IPO(2026-2027 预计)
员工~2000 人
主要客户中国移动、浪潮、联想、字节跳动、智谱 AI

产品线

产品线定位代表型号
MTT S 系列数据中心 AI 训练S5000, S4000, S3000
MTT G 系列消费级显卡MTT S80, S70, S50
MTT K 系列工作站专业卡K5000, K4000
MTT E 系列嵌入式 / 边缘E3000

2026 年 6–7 月最新适配(Day-0 支持)

摩尔线程在 2026 年 6–7 月实现对多个主流 LLM 的 Day-0 适配,标志着国产 GPU 软件生态快速成熟。

日期模型适配内容
2026-06-13MiniMax M3Day-0 适配,完整支持推理
2026-06-17智谱 GLM-5.2Day-0 适配,BF16 推理优化
2026-06-18阿里 Qwen3.5全面适配,支持训练 + 推理
2026-07-06美团 LongCat-2.0(万亿参数)Day-0 适配,基于 MTT S5000 + MUSA 软件栈

Day-0 适配:模型发布当天即完成 GPU 适配,体现 MUSIFY 软件栈成熟度提升。

关键特性

  • 全功能 GPU:图形 + AI + 通用计算(GPGPU)+ 光追
  • 国产化率 60%:HBM/显存来自三星/海力士,CPU 国产(兆芯),封装国产
  • 多精度支持:FP32 / FP16 / BF16 / INT8 / INT4
  • 多卡互联:MUSA Link 8 卡,784 GB/s 双向
  • PCIe 4.0:相比 PCIe 5.0 落后一代
  • 缺点:相比 NVIDIA H100 (989 BF16 TFLOPS) 算力 1/20,生态差距大

LLM 训练性能参考

  • LLaMA-2 7B 训练:MTT S5000 8 卡 ≈ H100 1/4 速度(BF16 优化)
  • Stable Diffusion XL:MTT S5000 1 卡 ≈ RTX 4090 50% 速度
  • Qwen 1.5 14B 微调:MTT S5000 4 卡 ≈ A100 60% 速度
  • 推理(70B Q4):MTT S5000 1 卡 ≈ RTX 4090 1.2× 速度(带宽优势)

夸娥(KUAE)万卡集群实测

基于 MTT S5000 构建的夸娥万卡智算集群已落地,是中国率先实现万卡级商业化部署的国产 GPU 集群:

指标实测值
集群算力10 EFLOPS
Dense 大模型训练 MFU60%
MoE 大模型训练 MFU40%
训练线性扩展效率95%(64 卡 → 1024 卡保持 90%+)
有效训练时间占比>90%(夸娥容错系统,无需改训练代码即可在线诊断恢复)
第三方验证智源研究院 2026-01 基于 S5000 千卡集群完成具身大脑模型 RoboBrain 2.5 端到端训练,与 H100 集群 loss 差异仅 0.62%
精度对齐训练 DeepSeek-236B 前 3 万步,Loss 曲线与 H100 集群相对精度误差 0.6%
商业订单2026-03 签下 ¥6.6 亿夸娥集群订单(接近 2025 全年营收一半),报告期内已交付确认收入

📌 ACE 异步通信引擎:S5000 将通信任务从计算核心卸载,实现计算与通信零冲突并行,是万卡扩展效率达 95% 的关键。

适用场景

  • ✅ 中国市场 LLM 训练与推理
  • FP8 训练与推理(原生硬件级 FP8 Tensor Core,支持 FP8→FP64 全精度)
  • ✅ 国产化替代项目
  • ✅ 政府、国企、金融、能源等信创项目(已通过《安全可靠测评》)
  • ✅ 智算中心建设(万卡级已验证)
  • ✅ 边缘 AI(嵌入式 MTT E 系列)
  • ✅ 图形渲染(消费级 MTT G 系列)
  • ❌ 国际市场
  • ❌ 顶级前沿模型训练(生态成熟度限制)

⚠️ 数据订正(2026-08 联网核实):本站此前在适用场景标注「❌ FP8 训练(仅支持 BF16)」,该结论错误。MTT S5000 配备硬件级 FP8 Tensor Core,原生支持 FP8 是其核心卖点——2026 年已基于 FP8 能力完成 DeepSeek-V4 / DeepSeek-V4-Flash 的 Day-0 适配(该模型采用「FP4+FP8」混合精度策略)。

国产 GPU 五虎

公司定位代表产品融资
摩尔线程全功能 GPU + AIMTT S5000$500M+
壁仞科技数据中心 AIBR104$700M+
景嘉微军用 + 民用 GPUJM9上市
芯原微电子IP + 设计服务多个 IP上市
天数智芯 Iluvatar数据中心 AIMR 100/200$400M+

相关卡