阿里云灵骏真武M890芯片:超节点实例GP9A,万亿参数MoE推理

阿里云灵骏超节点GP9A实例基于自研真武M890芯片,采用超节点架构面向万亿参数规模模型高性能推理设计,实例规格efg3.GP9A(M890P),9216 GB显存、1024核CPU、18.4TB 内存,阿腾云atengyun.com分享阿里云灵骏超节点GP9A实例优势、实例规格、网络及应用场景全解析,在阿里云CLUB中心:aliyun.club 免费领取优惠券。

阿里云灵骏超节点GP9A实例(真武M890芯片)
阿里云灵骏超节点GP9A实例(真武M890芯片)

超节点GP9A实例优势

超节点GP9A实例具有故障自愈、MoE模型训推、高效推理及生态兼容优势:

阿里云灵骏真武M890超节点GP9A实例优势
阿里云灵骏真武M890超节点GP9A实例优势

  • 超节点架构故障自愈:面向 ICN64 超节点架构,支持故障自愈能力,2^n卡持续可用。
  • 万亿参数MoE模型训推:每卡 144 GB 显存,实例 64 卡共 9,216 GB 显存池,承载万亿参数级模型。
  • MXFP4 高效推理:新增 MXFP4 精度,相比 BF16 可提供数倍吞吐提升,适用于 LLM 推理、推荐系统等追求极致吞吐的场景。同时兼容 BF16 / FP16 / FP8 / FP32。
  • 主流生态全兼容:T-Head SAIL™ 软件栈(Interface / SDK / OS 三层架构)全面兼容主流 AI 生态,业务迁移零代码修改。PyTorch / vLLM / SGLang / Megatron-LM / DeepSpeed 开箱即用。

灵骏超节点实例efg3.GP9A

灵骏超节点efg3.GP9A实例适用于万亿参数MoE推理、具身智能、自动驾驶及搜索推荐,灵骏超节点GP9A实例规格对比如下表:

实例 efg2.P16EN (810E) efg3.GP9A (M890P)
芯片代际 真武 810E(PPU 1.1) 真武 M890P(PPU 1.5)
支持精度 FP32 / BF16 / INT8 FP32 / FP16 / BF16 / FP8 / MXFP4
显存容量 1536 GB 9216 GB
CPU 96 核 1024 核
内存 2 TB 18.4 TB
本地存储 15.36 TB NVMe + 960 GB SATA SSD 122.88 TB NVMe
前端网络 400 Gbps 3.2 Tbps
Scale‑up 卡间互联 11.2 TB/s 51.2 TB/s
Scale‑out 实例间互联 1.6 Tbps 12.8 Tbps
每实例 GPU 16 卡 64 卡
最小售卖单元 裸金属(16 卡) 超节点(64 卡 / 8 节点)
开服地域 北京、杭州、上海、乌兰察布 乌兰察布(可用区 D),中卫(规划中)

灵骏超节点GP9A实例适用场景

GP9A实例覆盖从大模型训练到自动驾驶的全场景AI工作负载,可用于高性能推理、自动驾驶、搜推广与多模态及MXFP4 高效推理等使用场景:

  • 高性能推理:原生支持 vLLM、SGLang 推理引擎,自研 HolmesLLM 提供极致加速。支持 PD 分离推理架构,满足不同推理阶段需求。
  • 自动驾驶:已验证兼容 50+ 自动驾驶模型(感知、预测、端到端)环境部署训练与推理。
  • 搜推广与多模态:支持推荐系统、搜索排序、广告模型等核心场景。同时支持视觉-语言模型、图像生成、视频理解等多模态任务。
  • MXFP4高效推理:MXFP4 精度相比 BF16 可提供数倍吞吐提升,适用于 LLM 推理、推荐系统、实时图像处理和自动驾驶等极致吞吐场景。

腾讯云服务器特价:https://curl.qcloud.com/oRMoSucP

阿里云服务器优惠:https://t.aliyun.com/U/bLynLC