华为昇腾全家桶概览:先把型号和定位理清楚

本文摘要华为昇腾全家桶概览:先把型号和定位理清楚本文来源: IT孙磊(公众号:IT孙磊) 原文链接: https://mp.weixin.qq.com/s/dpbdPrOn6CmOUqMgF6gw5A 发布时间: 2026-08-19 06:07作者: IT孙磊  发布时间: 2026-08-19 06:07本期摘要昇腾的型号命名容易让人晕:310和910差一个数字,实际是两条完全不同的产品线;Atlas...

华为昇腾全家桶概览:先把型号和定位理清楚

本文来源: IT孙磊(公众号:IT孙磊)
原文链接: https://mp.weixin.qq.com/s/dpbdPrOn6CmOUqMgF6gw5A
发布时间: 2026-08-19 06:07

华为昇腾全家桶概览:先把型号和定位理清楚

作者: IT孙磊  发布时间: 2026-08-19 06:07


本期摘要

昇腾的型号命名容易让人晕:310和910差一个数字,实际是两条完全不同的产品线;Atlas 200/300/500/800/900听起来像五代产品,其实是同一批芯片的五种封装形态。这篇不做深度测评,只做一件事:把昇腾的产品结构讲清楚——哪条线管训练、哪条线管推理,达芬奇架构为什么擅长矩阵运算,Atlas各型号分别对应什么部署场景。后面三篇再分别深挖910系列、310系列和生态短板。

一、两条产品线,别混着记

昇腾的芯片编号有个简单规律:3开头是推理线,9开头是训练线。这两条线不是高低配关系,是面向完全不同的场景设计的。

310系列910系列
定位边缘/端侧推理数据中心训练与推理
典型功耗8W ~ 24W310W ~ 400W
显存板载LPDDR,容量小HBM,32~64GB
多卡互联基本不需要HCCS高速互联
典型场景摄像头分析、工业质检、边缘盒子大模型训练、集中式推理服务

两条产品线的功耗与算力定位

▲ 两条产品线的功耗与算力定位

看左图的两个色带:310系列挤在10W量级,910系列在400W量级,中间是空的。这个空档不是产品缺失,是边缘和数据中心本来就没有中间态需求——要么是功耗受限的现场设备,要么是机房里的标准卡。

二、达芬奇架构:为什么擅长矩阵

昇腾用的是华为自研的达芬奇(DaVinci)架构。它和GPU最大的区别在于计算单元的构成比例

  • Cube单元

:专做矩阵乘法,是算力的主要来源。一次运算处理16×16的矩阵块

  • Vector单元

:处理向量运算,负责激活函数、归一化这类逐元素操作

  • Scalar单元

:标量运算与流程控制,占比最小

右图那个80%说明了设计取向:达芬奇把绝大部分晶体管预算给了Cube。这带来一个直接结果——跑Transformer这类矩阵密集的负载效率高,但遇到大量逐元素操作或者不规则计算时,Vector单元会成为瓶颈

这解释了一个常见现象:同一款昇腾卡,跑标准Transformer的实测效率不错,换成结构比较特殊的模型就掉下来。不是驱动没优化好,是架构的比例决定的。选型时要问的问题是:我的模型里矩阵运算占比多高。

三、Atlas矩阵:同一批芯片的五种封装

Atlas是产品品牌,不是芯片代号。同一颗310P可以出现在模组里、加速卡里、也可以出现在边缘一体机里,区别只在封装形态和配套。

Atlas产品矩阵的部署规模

▲ Atlas产品矩阵的部署规模

Atlas型号形态装的是什么典型用途
200I计算模组310/310P嵌入到自己的设备里
300I标准PCIe卡310P插进通用服务器做推理
500边缘小站310/310P现场部署,无机房环境
800 推理型整机服务器多张310P集中式推理服务
800 训练型整机服务器8×910训练主力机型
900集群方案大量910万卡级训练集群

采购时的一个实际提醒:昇腾910系列通常不单卡零售,主要以Atlas 800整机或集群方案交付。这和买NVIDIA卡的模式不同——你买的是一套配好CANN环境的系统,不是一张卡。这既降低了自己搭环境的难度,也意味着议价和配置的自由度更低

四、这个系列接下来讲什么

这篇只做索引。真正影响选型决策的三个问题,分别放在后面三篇:

  1. 910系列到底能不能替代A100?

纸面算力和实测性能的差距在哪,四个版本怎么选(第21篇)

  1. 310系列的边缘覆盖能力如何?

310/310P/310B/310I的差异,Atlas 200模组的实际部署(第22篇)

  1. 生态短板有多大?

CANN和CUDA的差距、算子覆盖率、HuggingFace模型的迁移工作量(第23篇)

如果只带走一句话:昇腾的产品结构本身是清晰的——两条线、一套架构、一个Atlas矩阵。真正需要花时间评估的不是型号,是CANN生态能不能跑起你的模型。这也是为什么这个小节要用四篇来讲。

核心要点

  • 3开头是推理线、9开头是训练线

,不是高低配关系。310在8~24W,910在310~400W,中间没有产品

  • 达芬奇架构把约80%算力预算给了Cube矩阵单元。

跑Transformer效率好,遇到大量逐元素操作时Vector单元成瓶颈

  • 选型要先问:我的模型里矩阵运算占比多高。

同一款卡在不同模型结构上的实测效率差别,源于架构比例而非驱动

  • Atlas是封装形态不是芯片代号:

200I模组、300I标准卡、500边缘站、800整机、900集群,装的是同一批310P或910

  • 910主要以Atlas 800整机交付,不单卡零售。

好处是环境配好了,代价是配置和议价自由度低

  • 产品结构清晰,真正的评估重点在生态:

CANN能不能跑起你的模型,比记住型号重要得多

下期预告

昇腾910系列深度测评:910/910A/910B/910C

910B对标A100:384 TFLOPS FP16、64GB HBM2e。但纸面算力更高,实测推理反而可能更慢——差距出在哪。四个版本的真实差异、MIG类功能对比,以及国产替代的实际落点。

看完有启发的话,点个"在看"再走

本文包含AI辅助创作内容,作者已审核并对全文负责


本文转载自微信公众号「IT孙磊」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论