Moore Threads 摩尔线程 MTT S5000 (国产 GPU 训练)
产品概述
摩尔线程(Moore Threads) 是中国全功能 GPU 创业公司,2020-10 成立,创始人为原 NVIDIA 中国区高管 张建中。MTT S5000 是基于 第四代 MUSA "平湖" 架构 的训推一体 GPU 智算卡,2025-02-12 公开参数:单卡 AI 算力 1000 TFLOPS,80GB GDDR6X,1.6 TB/s 带宽。配套自研 MUSA 统一系统架构 + MUSIFY 软件栈。
战略定位:相比华为昇腾专注 AI 训练,摩尔线程走全功能 GPU 路线(图形 + AI + 通用计算),是中国对标 NVIDIA 的国产 GPU 创业公司,与景嘉微、芯原微电子、燧原科技、壁仞科技并列为"国产 GPU 五虎"。
2026 年 6–7 月最新动态:完成对 MiniMax M3、智谱 GLM-5.2、阿里 Qwen3.5 的 Day-0 适配;2026-07-06 完成美团万亿参数大模型 LongCat-2.0 的 Day-0 适配,国产 AI 软件生态快速成熟。
核心规格
| 项目 | 参数 |
|---|---|
| 架构 | MUSA(第四代,平湖) |
| 制程 | TSMC 6nm(推测) |
| GPU 核心 | 4096 个 MUSA Core(自研 ISA) |
| 芯片 | PH100 |
| 显存 | 80 GB(官方未公开颗粒类型;1.6 TB/s 带宽为 HBM 级) |
| 内存带宽 | 1.6 TB/s |
| FP8(稠密,官方口径) | 1,000 TFLOPS(液冷版 1000 / 风冷版 920) |
| BF16 / FP16 | ~500 TFLOPS(按官方 FP8 稠密算力 1:2 推算,非官方直接公布) |
| FP32 | 62.5 TFLOPS(推测) |
| INT8 | 2,000 TOPS(推测) |
| 精度支持 | FP8 → FP64 全精度,含硬件级 FP8 Tensor Core |
| TDP | 300 W |
| PCIe | PCIe 5.0 ×16 |
| 互联 | MTLink 784 GB/s(8 卡节点内全互联) |
| 板卡形态 | OAM(遵循 OAM 标准)/ PCIe;液冷 + 风冷双形态 |
| 发布 | 2025-02-12(公开参数) |
| 量产时间 | 2025-Q1(公开参数) |
| 安全认证 | 《安全可靠测评结果公告(2026 年第 2 号)》(2026-05-26 通过,AI 训推芯片首次纳入该体系) |
| 单价(OAM) | ~$4,000-6,000 |
📌 数据订正(2026-08 联网核实):
- 显存类型:本站此前记为 "GDDR6X",与 1.6 TB/s 带宽自相矛盾(GDDR6X 上限约 1 TB/s,且 80GB 容量非 GDDR 常规配置)。摩尔线程官方仅公布「80GB 显存、1.6 TB/s 带宽」,未公开颗粒类型。已改为如实标注。
- 算力精度口径:官方「单卡 AI 稠密算力 1000 TFLOPS」特指 FP8 精度(液冷版),非 FP16。FP16 约 500 TFLOPS。此前未标注精度,易被误读为 FP16 性能而高估。
- 互联:官方为 MTLink 784 GB/s(原记「MUSA Link」无数值)。
MTT S5000 参数演进(2024 → 2025 版)
| 指标 | MTT S5000 | MTT S4000 | 提升 |
|---|---|---|---|
| 制程 | 7nm | 12nm | 新代 |
| 核心数 | 4096 | 2048 | 2× |
| 显存 | 48GB GDDR6 | 24GB GDDR6 | 2× |
| 带宽 | 700 GB/s | 448 GB/s | 1.56× |
| FP32 | 25 TFLOPS | 12 TFLOPS | 2.08× |
| BF16 | 50 TFLOPS | 24 TFLOPS | 2.08× |
| 互联 | MUSA Link 800 GB/s | 400 GB/s | 2× |
| TDP | 300W | 250W | +20% |
⚠️ 参数说明:上表为 MTT S5000 早期(2024)版本参数。2025-02-12 发布的现行量产版已升级为 80GB GDDR6X / 1.6 TB/s / 1000 TFLOPS 稠密 AI 算力(见上方核心规格)。
MUSA 架构
核心组件
| 组件 | 说明 |
|---|---|
| MUSA Core | 自研 SIMT 核心(类 CUDA Core) |
| Tensor Core | 自研矩阵单元(类 Tensor Core) |
| SFU | Special Function Unit(超越函数) |
| RT Core | 硬件光追核心 |
| MUSA Link | 8 卡全互联,784 GB/s 双向 |
与 NVIDIA CUDA 差异
| 维度 | MUSA | CUDA |
|---|---|---|
| 核心架构 | SIMT | SIMT |
| 指令集 | 自研(类 PTX) | PTX / SASS |
| 线程模型 | 32 线程 / Warp | 32 线程 / Warp |
| 软件栈成熟度 | 3-4 年 | 18 年 |
| 生态 | MUSIFY(类 CUDA) | cuDNN / cuBLAS / NCCL |
| 开发者基数 | ~10K 开发者 | 4M+ 开发者 |
软件栈 MUSIFY
| 层级 | 工具 | 对标 NVIDIA |
|---|---|---|
| AI 框架 | PyTorch-MUSA | PyTorch + CUDA |
| TensorFlow-MUSA | TensorFlow | |
| MindSpore | MindSpore 兼容 | |
| 编译器 | MUSA CC | nvcc |
| 运行时 | MUSA Runtime | CUDA Runtime |
| 数学库 | MUSBlas | cuBLAS |
| 深度学习库 | MUDNN | cuDNN |
| 通信库 | MUSA CC | NCCL |
| 图形 API | Vulkan / OpenGL / DirectX | 同样 |
⚠️ 生态限制:MUSIFY 生态仅 3-4 年发展,算子覆盖率约 70-80%(vs CUDA 99%+),复杂 LLM 模型需要大量手工优化或降级到 CPU 回退。
厂商信息
| 项目 | 内容 |
|---|---|
| 公司 | 摩尔线程智能科技(北京)有限责任公司 |
| 创始人 | 张建中(原 NVIDIA 中国区总经理) |
| 成立 | 2020-10 |
| 融资 | $500M+(A 轮 2021、B 轮 2022、C 轮 2023) |
| 估值(2025) | ~¥35B |
| 2025 营收 | ~¥2.2B |
| 总部 | 北京市朝阳区 |
| 官网 | https://www.mthreads.com |
| 状态 | 准备科创板 IPO(2026-2027 预计) |
| 员工 | ~2000 人 |
| 主要客户 | 中国移动、浪潮、联想、字节跳动、智谱 AI |
产品线
| 产品线 | 定位 | 代表型号 |
|---|---|---|
| MTT S 系列 | 数据中心 AI 训练 | S5000, S4000, S3000 |
| MTT G 系列 | 消费级显卡 | MTT S80, S70, S50 |
| MTT K 系列 | 工作站专业卡 | K5000, K4000 |
| MTT E 系列 | 嵌入式 / 边缘 | E3000 |
2026 年 6–7 月最新适配(Day-0 支持)
摩尔线程在 2026 年 6–7 月实现对多个主流 LLM 的 Day-0 适配,标志着国产 GPU 软件生态快速成熟。
| 日期 | 模型 | 适配内容 |
|---|---|---|
| 2026-06-13 | MiniMax M3 | Day-0 适配,完整支持推理 |
| 2026-06-17 | 智谱 GLM-5.2 | Day-0 适配,BF16 推理优化 |
| 2026-06-18 | 阿里 Qwen3.5 | 全面适配,支持训练 + 推理 |
| 2026-07-06 | 美团 LongCat-2.0(万亿参数) | Day-0 适配,基于 MTT S5000 + MUSA 软件栈 |
Day-0 适配:模型发布当天即完成 GPU 适配,体现 MUSIFY 软件栈成熟度提升。
关键特性
- 全功能 GPU:图形 + AI + 通用计算(GPGPU)+ 光追
- 国产化率 60%:HBM/显存来自三星/海力士,CPU 国产(兆芯),封装国产
- 多精度支持:FP32 / FP16 / BF16 / INT8 / INT4
- 多卡互联:MUSA Link 8 卡,784 GB/s 双向
- PCIe 4.0:相比 PCIe 5.0 落后一代
- 缺点:相比 NVIDIA H100 (989 BF16 TFLOPS) 算力 1/20,生态差距大
LLM 训练性能参考
- LLaMA-2 7B 训练:MTT S5000 8 卡 ≈ H100 1/4 速度(BF16 优化)
- Stable Diffusion XL:MTT S5000 1 卡 ≈ RTX 4090 50% 速度
- Qwen 1.5 14B 微调:MTT S5000 4 卡 ≈ A100 60% 速度
- 推理(70B Q4):MTT S5000 1 卡 ≈ RTX 4090 1.2× 速度(带宽优势)
夸娥(KUAE)万卡集群实测
基于 MTT S5000 构建的夸娥万卡智算集群已落地,是中国率先实现万卡级商业化部署的国产 GPU 集群:
| 指标 | 实测值 |
|---|---|
| 集群算力 | 10 EFLOPS |
| Dense 大模型训练 MFU | 60% |
| MoE 大模型训练 MFU | 40% |
| 训练线性扩展效率 | 95%(64 卡 → 1024 卡保持 90%+) |
| 有效训练时间占比 | >90%(夸娥容错系统,无需改训练代码即可在线诊断恢复) |
| 第三方验证 | 智源研究院 2026-01 基于 S5000 千卡集群完成具身大脑模型 RoboBrain 2.5 端到端训练,与 H100 集群 loss 差异仅 0.62% |
| 精度对齐 | 训练 DeepSeek-236B 前 3 万步,Loss 曲线与 H100 集群相对精度误差 0.6% |
| 商业订单 | 2026-03 签下 ¥6.6 亿夸娥集群订单(接近 2025 全年营收一半),报告期内已交付确认收入 |
📌 ACE 异步通信引擎:S5000 将通信任务从计算核心卸载,实现计算与通信零冲突并行,是万卡扩展效率达 95% 的关键。
适用场景
- ✅ 中国市场 LLM 训练与推理
- ✅ FP8 训练与推理(原生硬件级 FP8 Tensor Core,支持 FP8→FP64 全精度)
- ✅ 国产化替代项目
- ✅ 政府、国企、金融、能源等信创项目(已通过《安全可靠测评》)
- ✅ 智算中心建设(万卡级已验证)
- ✅ 边缘 AI(嵌入式 MTT E 系列)
- ✅ 图形渲染(消费级 MTT G 系列)
- ❌ 国际市场
- ❌ 顶级前沿模型训练(生态成熟度限制)
⚠️ 数据订正(2026-08 联网核实):本站此前在适用场景标注「❌ FP8 训练(仅支持 BF16)」,该结论错误。MTT S5000 配备硬件级 FP8 Tensor Core,原生支持 FP8 是其核心卖点——2026 年已基于 FP8 能力完成 DeepSeek-V4 / DeepSeek-V4-Flash 的 Day-0 适配(该模型采用「FP4+FP8」混合精度策略)。
国产 GPU 五虎
| 公司 | 定位 | 代表产品 | 融资 |
|---|---|---|---|
| 摩尔线程 | 全功能 GPU + AI | MTT S5000 | $500M+ |
| 壁仞科技 | 数据中心 AI | BR104 | $700M+ |
| 景嘉微 | 军用 + 民用 GPU | JM9 | 上市 |
| 芯原微电子 | IP + 设计服务 | 多个 IP | 上市 |
| 天数智芯 Iluvatar | 数据中心 AI | MR 100/200 | $400M+ |
相关卡
- Cambricon 寒武纪 MLU 590 - 国产 AI 训练
- Huawei Ascend 910C - 国产最强 AI
- Huawei Ascend 920 - 国产下一代
- Tenstorrent - RISC-V AI
- SambaNova SN40L - 美国 RDU
- NVIDIA A100 - 数据中心经典
- NVIDIA RTX 4090 - 消费级