华为盘古大模型所使用的服务器主要基于华为自研的昇腾(Ascend)AI 计算集群,其核心硬件架构依托于华为的Atlas 系列 AI 服务器和昇腾 910/310 系列 AI 处理器。
具体而言,盘古大模型的训练和推理通常运行在以下关键组件构成的算力底座上:
-
核心芯片:
- 昇腾 910 (Ascend 910):这是华为专为 AI 训练打造的高性能 NPU(神经网络处理单元),拥有强大的浮点运算能力,是支撑盘古大模型大规模参数训练的核心算力来源。
- 昇腾 310 (Ascend 310):主要用于边缘侧或推理场景,配合大模型进行端侧部署。
-
服务器硬件形态:
- Atlas 800 训练服务器:这是华为推出的高性能 AI 训练服务器,通常采用多卡互联架构(如 8 卡、16 卡甚至更多),通过华为自研的HCCS(High-speed Chip-to-Chip)高速互联技术,实现芯片间的高速通信,以支持千卡乃至万卡集群的并行训练。
- Atlas 900 PoD(Packet of Devices):这是一个超大规模的 AI 训练集群解决方案,由数百台 Atlas 800 服务器组成,专门用于超大规模模型的训练任务。
-
软件与生态:
- 这些服务器运行在CANN(Compute Architecture for Neural Networks)异构计算架构之上,并配合MindSpore深度学习框架,共同构成了从硬件到软件的完整闭环,确保盘古大模型的高效训练和部署。
总结:
华为盘古大模型并非依赖通用的 x86 服务器(如搭载 NVIDIA GPU 的服务器),而是深度绑定华为自研的昇腾算力体系,主要使用搭载昇腾 910 芯片的 Atlas 800 训练服务器以及Atlas 900 PoD 集群来构建其庞大的算力底座。这种全栈自研方案旨在解决算力自主可控的问题,并针对盘古大模型的特性进行了深度优化。
CLOUD云