华为昇腾全系列 AI 芯片汇总:昇腾 310/910 (ABCD)/950/960/970 参数梳理
本文来源: snail(公众号:snail)
原文链接: https://mp.weixin.qq.com/s/Oc0wpnkrGms_MxLOBVprNw
发布时间: 2026-07-23 00:00

作者: snail 发布时间: 2026-07-23 00:00
**
(一) 昇腾310
https://ascend.developer.huaweicloud.com/courseStudy/7f6da4a3e9ee43f9b8ac8e9df272ac6d/0042bec8baad45d09515b1bea84ca383
**
1. 昇腾310技术参数
昇腾310是高能效比推理型AI处理器,基于达芬奇架构,采用12nm工艺制造,功耗只有8瓦。其本质上是一块SoC,集成了多个运算单元,包括CPU(8个a55)、AI Core、数字视觉预处理子系统等,实现高通量、大算力和低功耗的推理能力。
目前该芯片能对整型数(INT8、INT4) 或对浮点数(FP16)提供强大的算力,
FP16算力为8TOPS
INT8算力16TOPS
2. 昇腾310硬件逻辑构架

上图展示了昇腾310的硬件逻辑架构图。与昇腾910类似,昇腾310的组成部分包括AI Core、ARM CPU核心、DVPP、Cache & Buffer等。
- AI Core是昇腾310的计算核心,负责执行矩阵、向量、标量计算密集的算子任务,采用达芬奇架构。 昇腾 310集成了2个AI Core。
- ARM CPU核心集成了8个ARM A55。其中一部分部署为AI CPU,负责执行不适合跑在AI Core上的算子(非矩阵类计算),一部分部署为专用于控制芯片整体运行的控制CPU。两类任务占用的 CPU核数可由软件根据系统实际运行情况动态分配。此外,还部署了一个专用CPU作为任务调度器(Task Scheduler,TS),以实现计算任务在AI Core上的高效分配和调度。该CPU专门服务于AI Core和AI CPU,不承担任何其他的事务和工作。
- 对外接口支持PCIE3.0、RGMII、USB3.0等高速接口、以及GPIO、UART、 I2C、SPI等低速接口。
- DVPP数字视觉预处理子系统,完成图像视频的编解码。用于将从网络或终端设备获得的 视觉数据,进行预处理以实现格式和精度 转换等要求,之后提供给AI计算引擎。
- Cache & Buffer:SOC片内有层次化的memory结构,AI core内部有两级memory buffer,SOC片上还有8MB L2 buffer,专用于AI Core、AI CPU,提供高带宽、低延迟的memory访 问。芯片还集成了LPDDR4x控制器,为芯片提供更大容量的DDR内存。
(二) 昇腾910**



昇腾910技术参数
昇腾910芯片,是当前计算密度最大的单芯片,适用于AI模型训练,采用7nm制作工艺。其性能接近英伟达 A100(40GB),半精度(FP16)算力达到 320 TFLOPS,整数精度(INT8)算力达到 640TOPS,最大功耗为310瓦。
此外,昇腾 910 还集成了 HCCS、PCIe 4.0 和 RoCE v2 接口,为构建横向扩展(Scale Out)和纵向扩展(Scale Up)系统提供了灵活高效的方法,互联能力突出。
https://ascend.developer.huaweicloud.com/courseStudy/7f6da4a3e9ee43f9b8ac8e9df272ac6d/df80351900fb4c42a058c03a6a4a29b1昇腾910硬件逻辑架构

1 昇腾 910A

2 昇腾 910B

B1 --- 旗舰性能天花板:采用台积电先进工艺,FP16算力高达414 TFLOPS,专为千亿参数以上大模型训练和超算中心设计。但需要液冷散热环境,部署成本最高。
B2 --- 企业级主力:性能与成本的黄金平衡点,376 TFLOPS的算力足以应对10B-50B参数模型的训练任务,支持风冷或液冷,是金融、科研、大型企业AI平台的首选。
B3 --- 国产化性价比之王:由中芯国际生产,是兼顾性能、成本和国产化合规的最佳选择。313 TFLOPS算力可覆盖1B-30B模型的训练+推理混合负载,适用于政务云、国企、制造业等信创场景。
B4 --- 推理专用:显存减半至32GB,功耗最低,专为纯推理任务和边缘端场景设计,适合7B及以下小模型推理、API服务等场景。
对应机型

3 昇腾 910C
- 昇腾910C包含多款子型号,其中910C1为性能最高的一款。910C芯片可视为由两颗910B拼接而成,其架构支持组建多达384个节点的超大规模集群。

(三) 昇腾950(转折,开始支持GPGPU架构)**


昇腾950系列存在着两个版本,分别为PR版本以及DT版本 。

PR版本主要是在推理的Prefill阶段,采用的是HiBL内存,其成本相较于HBM要低上许多

DT版本主要进行训练以及推理的Decode工作,采用的是更为高级规格的HiZQ 2.0内存,带宽为4TB/s 。


(四)昇腾960 — 千亿参数超大规模(规划中)
(五) 昇腾970 — 万亿参数MoE旗舰(规划中)**

-- 信息为不同渠道搜集,仅供参考,侵权删
本文转载自微信公众号「snail」,仅供学习交流使用。
觉得内容不错?我要
