华为昇腾全线产品形态梳理:国产AI算力卡的产品形态与趋势

本文摘要华为昇腾全线产品形态梳理:国产AI算力卡的产品形态与趋势本文来源: 小鱼儿(公众号:小鱼儿) 原文链接: https://mp.weixin.qq.com/s/xJwbPefgrBIpaHVb1KczAw 发布时间: 2026-09-04 08:02作者: 小鱼儿  发布时间: 2026-09-04 08:022025年,中国市场卖出约 400 万张 AI 加速卡。其中本土厂商出货约 165 万张...

华为昇腾全线产品形态梳理:国产AI算力卡的产品形态与趋势

本文来源: 小鱼儿(公众号:小鱼儿)
原文链接: https://mp.weixin.qq.com/s/xJwbPefgrBIpaHVb1KczAw
发布时间: 2026-09-04 08:02

华为昇腾全线产品形态梳理:国产AI算力卡的产品形态与趋势

作者: 小鱼儿  发布时间: 2026-09-04 08:02


2025年,中国市场卖出约 400 万张 AI 加速卡。其中本土厂商出货约 165 万张,占 41%,国产份额第一次突破四成。到 2026 年 8 月,TrendForce 把预测直接改到接近 90%——国产方案要吃掉中国高端 AI 芯片市场的九成,英伟达份额从约 40% 掉到 8% 左右。

这组数字最近被转了很多遍。但过去半年我在客户现场感受到的变化,跟份额关系不大。

真正的变化在形态。三年前客户问我,买 A100 还是买 910B。现在不问这个了,现在的问题长这样:我要建一个能跑万亿参数的推理池,你给我报什么形态?八卡服务器、一体机,还是直接上超节点?

问题变了,因为产品变了。国产 AI 算力卡正在从一颗芯片,长成一台机器。

一、五层形态,把算力卡放回它该在的位置

我们习惯说算力卡,这个词现在已经不太够用。卡只是中间的一层,往上往下各有两层,每一层的选型逻辑完全不同。

图示

图 1 国产 AI 算力的五层产品形态

芯片层决定天花板。制程、架构、HBM 容量和带宽、支持哪些低精度格式,这些是物理约束,买哪家就锁定哪家。

板卡层决定怎么插。同样是 910B,做成 PCIe 标卡还是 OAM 模组,后面的散热方案、机柜密度、能不能组超节点,全都不一样。

服务器和一体机层是政企客户真正接触的界面。客户不会去摸一颗芯片,他摸的是那台 4U 机器的把手,看的是开机到跑通服务要几个小时。

超节点层是 2026 年最大的变量,后面单说。

集群层是结果。国家数据局披露,截至 2025 年底全国智能算力规模达 159 万 PFLOPS,到 2026 年 3 月底进一步增至 188 万 PFLOPS。这个数字是前面四层一层层堆出来的。

还漏了一层,软件栈。它不占物理位置,但贯穿五层。

华为的 CANN 异构计算架构 2025 年全面开源开放,向上对接框架,向下管理算子、内存、调度和通信,配套 MindSpore、PyTorch 昇腾适配版、torch-npu、vLLM-Ascend、sglang-npu、MindIE 等工具链。寒武纪有 BANG 异构计算平台,沐曦有 MXMACA 软件栈。昇腾生态合作伙伴已超过 3000 家,截至 2025 年开发者数量超过 400 万。

软件栈的形态决定了前面五层能不能真正跑起来,也决定了迁移成本。同样规格的卡,软件栈成熟度差一年,落到项目上就是几个月的工期差。

二、板卡层的分岔,PCIe 标卡还是 OAM 模组

这是最容易被忽略、但代价最大的一个选择。很多客户第一次采购时只盯着 FP16 算力,等第二批扩容才发现形态不对,前面的机柜全用不上。

对比项PCIe 标卡OAM 模组
形态标准 PCIe 插卡,插通用服务器定制基板 + 扣卡,装专用 AI 服务器
散热以风冷为主,部分支持液冷高密度设计,多数为液冷
单节点密度一般 4 至 8 卡常见 8 卡,超节点可达 32 至 128 卡
卡间互联走 PCIe 或板内桥接,带宽受限专用高速互联,带宽显著更高
升级弹性可插进任意兼容服务器,灵活绑定特定服务器型号,锁定厂商
典型场景开发测试、中小规模推理、存量机房改造大模型训练、超节点、高密度推理池
维护单卡可插拔更换,运维门槛低多为整模组更换,对运维要求高

说明:OAM 指 OCP Accelerator Module,开放计算项目定义的加速模组规范,目前已成为国产超节点的主流承载形态。

我在一个省级政务云项目上见过典型踩坑。一期买了 8 台 PCIe 标卡服务器做推理,跑得很顺。二期要加训练能力,发现标卡形态撑不起来,卡间互联带宽不够,只能另起炉灶买 OAM 形态的训练服务器。一期那批机器最后退化成开发测试环境用。

一句话判断
如果你的算力需求三年内不会超过单节点 8 卡,选 PCIe 标卡,灵活、便宜、好维护。如果你要跑大模型训练或者建高密度推理池,一开始就该按 OAM 形态规划,别指望后面平滑升级。

三、华为昇腾全线产品形态梳理

国内厂商里,昇腾是唯一把五层形态全打通的。从几瓦的边缘模组到万卡级超节点,客户可以一路买上去。也正因为形态太多,选型时最容易看花眼。

梳理这条产品线,从芯片层开始最清楚。

3.1 芯片谱系,两条线并行

昇腾芯片分两个序列。310 系列面向边缘和推理,910 系列面向训练和云端。两条线的制程、功耗、算力目标完全不同,拿在一起比没有意义。

型号发布算力显存 / 功耗定位
昇腾 310201816 TOPS INT88 TFLOPS FP16LPDDR4X 4–32GB8W边缘推理,摄像头、终端
昇腾 310B8 TOPS INT84 TFLOPS FP16—8W工业级、车载、宽温,带 ECC 纠错
昇腾 610202164 TOPS INT832 TFLOPS FP16LPDDR4X 16–64GB20–40W中端推理,Atlas 300I 早期加速卡所用
昇腾 310P百 TOPS 级Atlas 300I Duo 双芯推理卡所用

310 系的关键词是低功耗。8W 起步,可以直接塞进摄像头和工控机,这是国产芯片在边缘场景渗透最深的一块。很多城市的视频结构化项目底层跑的就是它。

型号状态关键规格定位
昇腾 910A已停产7nm(台积电),FP16 256 TFLOPS,HBM2 32GB第一代训练芯片
昇腾 910BB1 至 B4现役主力7nm,FP16 280–414 TFLOPSHBM2e / HBM2.5 / HBM3e,32/64GB,310W主流训练与推理平台
昇腾 910C2025Q1 供货双 910B 合封(Chiplet)FP16 640–800 TFLOPS,HBM2e 128GB / 3.2TB/s,约 600W千亿级大模型训练与推理
昇腾 950PR昇腾 950DT2026 发布自研 HBM HiBL 1.0 / HiZQ 2.0FP8 1 PFLOPS,FP4 2 PFLOPS超节点基础,PR 主打 Prefill,DT 主打训练与 Decode
昇腾 9602027Q4 规划FP8 2 PFLOPS,FP4 4 PFLOPSHBM 288GB / 9.6TB/s下一代
昇腾 9702028Q4 规划FP8 4 PFLOPS,FP4 8 PFLOPSHBM 288GB / 14.4TB/s下一代

910 系里有个关键转折。910C 用双 910B 合封的 Chiplet 方案把算力堆到 640–800 TFLOPS,代价是功耗也涨到约 600W。这是在可获得的制造工艺下提升单卡算力的现实办法,属于工程上的巧劲,不是架构突破。

950 系列才是真正的跨代。从这一代起全部切换自研 HBM,同时把 PR 和 DT 拆成两颗不同侧重的芯片,一颗主攻推理的 Prefill 阶段,一颗主攻训练和 Decode 阶段。这个拆法跟当前大模型推理的 PD 分离趋势是直接对应的,不是随便起的型号名。

3.2 产品形态矩阵,看懂 Atlas 命名规则

昇腾的硬件产品统一叫 Atlas,后面跟数字和后缀。数字本身就是一张选型地图。

Atlas 数字规则
200 系列 = 模组与开发者套件
300 系列 = PCIe 加速卡
500 系列 = 边缘小站与边缘服务器
800 系列 = 数据中心 AI 服务器
900 系列 = 超节点与集群

后缀也有讲究。T 是 Training 训练,I 是 Inference 推理,V 是 Video 视频解析,A2 和 A3 是代际标识,分别对应 910B 和 910C。看懂这几个字母,看型号就知道这机器是干什么用的。

200 系列 加速模块与开发者套件

产品说明
Atlas 200I A2 加速模块面向边缘的板卡级 AI 模组
Atlas 200I DK A2 开发者套件开发者入门套件
Atlas 200 DK早期开发者套件

300 系列 AI 加速卡与视频解析卡

产品芯片关键点
Atlas 300I A2(新命名 A300I A2)昇腾 910B2025 年 9 月上市,推理标卡,24 / 32 / 64GB HBM2e
Atlas 300I Pro昇腾 910BPCIe 推理卡,FP16 256T / INT8 512T
Atlas 300I Duo昇腾 310P 双 Die双芯高密度推理,生命周期短,约 292 天即停产
Atlas 300V / 300V Pro昇腾 310 / 310P视频解析卡,32 / 48GB
Atlas 300T Pro昇腾 910训练标卡
Atlas 300T A2300V Pro A2 等昇腾 910 系训练与视频解析升级版

300 系列里有个值得记住的教训。Atlas 300I Duo 上市约 292 天就停产了。做政企项目时如果选了生命周期短的产品,二期扩容会非常被动,这条在选型时一定要问清楚厂商的产品生命周期承诺。

500 系列 智能边缘

产品说明
Atlas 500 A2 智能小站边缘一体机,算力强、体积小、环境适应性强
Atlas 500 Pro 智能边缘服务器(型号 3000)边缘场景多卡部署

800 系列 AI 服务器与一体机

产品芯片定位
Atlas 800 推理服务器(型号 3000)910B中心侧推理
Atlas 800T A2 训练服务器910B × 88 卡训练主力
Atlas 800I A2 推理服务器910B × 88 卡推理
Atlas 800T A3 超节点服务器910C训练超节点,支持 32 至 384 卡扩展
Atlas 800I A3 超节点服务器910C推理超节点,2026 年 4 月发布
Atlas 800 A2 / A3910B / 910C2025 年 3 月发布,2U 结构,AI 推理优化,支持 MoE 加速

800 系列是政企客户接触最多的一层。判断依据很简单,看后缀 T 还是 I。要训练买 T,要推理买 I。数字后面跟 A2 说明是 910B 平台,A3 说明是 910C 平台。

900 系列 超节点与大规模集群

产品关键点
Atlas 900 AI 集群 / SuperPoD万卡级集群,早期主打 1750 亿参数训练提速
CloudMatrix 384 超节点满配 384 颗 910C
Atlas 950 SuperPoD 超节点搭载 950 系列,2026 年 WAIC 首秀

3.3 主力型号 910B,规格与分档

910B 是目前出货量最大、使用最广的型号,也是多数政企客户真正会买到的那一款。它的完整规格如下。

项目规格
芯片架构华为自研达芬奇 3D Cube 架构,针对矩阵运算深度优化
制程工艺7nm EUV(增强版)
AI 核心数32 核昇腾 AI 处理器
核心算力FP16 256–376 TFLOPS(依版本,B1 最高 414)
整数算力INT8 512–1000+ TOPS
显存类型HBM2e / HBM2.5 / HBM3e(依版本不同)
显存容量32GB / 64GB(B1 至 B3 多为 64GB)
显存带宽约 1.2–1.6 TB/s(HBM3e 版本),HBM2e 版本约 392 GB/s 至 1 TB/s
典型功耗310W(部分版本最高 400W)
能效比0.8 TFLOPS/W(FP16)
卡间互联HCCS,单节点 8 卡全互联带宽约 448 GB/s
接口PCIe 4.0 x16(加速卡另支持 RoCE v2 双端口)

说明:以上规格综合自行业公开资料与生态伙伴信息,不同供货批次存在差异,采购选型时须以厂商实际规格书为准。

两个容易被忽略的指标值得单说。一个是卡间互联 HCCS,单节点 8 卡全互联带宽约 448 GB/s,这个数字直接决定 8 卡能不能跑出接近线性的加速比。另一个是能效比 0.8 TFLOPS/W,310W 的功耗对上 A100 的 400W,在机房电力紧张的场景是实打实的优势。

910B 在供货上分了四个档位,这是很多人第一次采购时最困惑的地方。

型号FP16 算力显存显存类型定位与适用场景
910B1414 TFLOPS64GBHBM2千亿级参数大模型训练,性能天花板
910B2376 TFLOPS64GBHBM2e通用训练服务器标准配置
910B3313 TFLOPS64GBHBM3e(1.2TB/s)大模型推理优化,DeepSeek 一体机常用
910B4280 TFLOPS32 / 64GBHBM2边缘计算、中小模型推理、低功耗定制

B1 至 B4 选型原则
训练 50B 以上大模型,选 B1,注意需要液冷
训练 10B 至 50B,或科研金融场景,选 B2
训练加推理混合、国产化替代、政务云,选 B3,性价比最稳
只做推理或 API 服务、跑小模型,选 B4

注意 B1 的算力最高但用的是 HBM2,带宽反而不是最强。B3 虽然 FP16 算力只有 313 TFLOPS,但配的是 HBM3e,带宽 1.2TB/s,做推理反而更合适。算力数字不是唯一标准,得看你的负载是计算密集还是访存密集。

3.4 与英伟达的选型对照

把 910B 和同期英伟达的几款主流卡放在一起,差距在哪一目了然。

规格项昇腾 910B(以 B2 为例)A100 80GBH100 80GBH20 96GB
架构达芬奇AmpereHopperHopper
FP16 算力376 TFLOPS312 TFLOPS约 495 TFLOPS148 TFLOPS
FP8不支持不支持989 TFLOPS296 TFLOPS
显存64GB HBM2e80GB HBM2e80GB HBM396GB HBM3e
显存带宽约 1.2–1.6 TB/s2.0 TB/s3.35 TB/s4.0 TB/s
功耗310W400W700W400W
卡间互联HCCSNVLink 3.0NVLink 4.0NVLink 4.0

三条结论。FP16 算力已经超过 A100,这是实打实的进步。FP8 缺失是最大硬伤,训练场景绕不开。显存带宽仍是短板,HBM2e 版本差距明显,HBM3e 版本(B3)补上了一部分。

按场景对照着选,比背参数快。

场景昇腾选择英伟达对应参考
边缘摄像头、终端推理昇腾 310 / 310B + Atlas 500Jetson Orin
视频解析、OCR、目标检测Atlas 300V Pro / 300I DuoT4
数据中心通用推理910B(B3 / B4)+ Atlas 300I A2 / 800I A2L4 / A10 / A100
大模型训练 10B 至 50B910B(B2)+ Atlas 800T A2A100 80GB
千亿级大模型训练与推理910C + Atlas 800T A3H100(约 60% 档)
万亿级、超节点集群910C SuperPoD,或 950B200 / B300 SuperPOD
国产化合规加性价比通用910B3,当前最稳

一句话判断
看重生态成熟度和 FP8 训练,优先英伟达。看重国产化、合规、性价比和推理部署,昇腾 910B3 和 910C 是当前最务实的选择。

3.5 迭代路线图

时间节点芯片要点
2025Q1910C双 910B 合封,大模型主力
2026Q1950PR自研 HBM HiBL 1.0,FP8 1P,主攻 Prefill
2026Q4(提前至 2026.8 上线)950DT自研 HBM HiZQ 2.0,主攻训练与 Decode
2027Q4960FP8 2P / FP4 4P,HBM 288GB / 9.6TB/s
2028Q4970FP8 4P / FP4 8P,HBM 288GB / 14.4TB/s

华为官网公布的节奏是一年一代、算力翻倍。从 950 起全部切换华为自研 HBM,同时引入 SIMD 与 SIMT 双编程模型。前者解决供应安全,后者解决编程易用性,两条都是冲着长期生态去的。

四、其他厂商的形态版图

昇腾之外,把其他主要厂商的产品形态摊开看,路线差异也很清晰。

厂商主力芯片板卡形态系统形态与特点
寒武纪思元 590思元 690以 OAM 模组为主,兼顾 PCIe训推一体,思元 690 采用双 die 封装,2026 年初量产
海光信息DCU 深算系列OAM 与 PCIe 均有CPU 加 DCU 双芯方案,与中科曙光深度协同做系统集成
沐曦曦云 C500 / C550 / C600PCIe 版与 OAM 版并行通用 GPGPU 路线,MXMACA 软件栈,2026 年首发曦景 S600 超节点
昆仑芯P800 / R200 系列OAM 为主深度适配百度文心,推理规模化落地成熟,超节点已量产
燧原科技云燧系列OAM 模组2026 年首发云燧 ESL64-O 超节点,强调五层协同设计
阿里 / 百度 / 腾讯自研 ASIC自用为主不对外单卖卡,以云服务形式输出,走内部消化路线

数据来源:各厂商官网及公开产品资料整理,截至 2026 年 9 月。部分厂商未公开完整规格,此处仅列形态信息。

寒武纪 2026 年上半年营收 

59.96 亿元

、净利润 

23.11 亿元

,新一代旗舰思元 690 已量产,采用双 die 封装,FP16 算力超过 700 TFLOPS,配 196GB HBM3 显存。这个规格已经不是替代 A100 的量级了。

海光走的是另一条路,CPU 加 DCU 双芯,配合中科曙光做系统。2026 年 7 月,双方宣布中国首个全国产十万卡 AI 超集群曙光 8000(登峰)落成。这是芯片厂商和系统集成商深度绑定的典型。

互联网大厂的自研 ASIC 不对外卖卡,这是很多人会忽略的一块。它们以云服务形式输出,但同样吃掉了大量国产芯片产能,也间接推高了国产份额。

五、2026 年最大变量,超节点成为主导形态

2026 年 7 月的 WAIC,国产算力展区几乎变成了超节点展会。这个信号比任何一份研报都直接。

厂商 / 方案超节点产品规模公开关键指标
华为Atlas 900 超节点满配 384 卡搭载 910C,最大算力 300 PFLOPS,2025 年 3 月推出
华为Atlas 950 SuperPoD8192 卡FP8 精度下总算力 1 EFLOPS,2026 年 WAIC 首秀
新华三UniPoD S8000032 至 1024 卡,最高扩至 16384 卡训练性能提升 70%,推理性能提升 3 倍
联想问天超节点单节点 40 张 GPUFP8 算力超 28 PFLOPS,HBM 显存突破 5.76 TB
超聚变超节点方案单柜 128 卡第五代 100% 原生液冷整机柜,PUE 低至 1.06
海光 + 曙光ScaleX640 + ScaleX40十万卡级曙光 8000(登峰),全国产十万卡 AI 超集群
中兴超节点方案128 卡支持多芯片混插,dOCS 算网一体化液冷
东方算芯拓域 TY64单柜 64 卡33P BF16 算力,单卡 896GB/s 互联
阿里云真武 M890 × 磐久 AL128128 卡获选 2026 WAIC 镇馆之宝

数据来源:2026 世界人工智能大会公开报道及厂商发布信息整理,规格以厂商官方口径为准。

为什么超节点突然成了必选项?

答案有点无奈。受制于可获得的制造工艺,国产单颗芯片的算力跟英伟达旗舰仍有代差。华为轮值董事长徐直军在 2025 年全联接大会上讲得很直白,受制于先进芯片制造工艺的不可获得,华为单颗芯片算力与英伟达仍有差距,但可以用超节点方案做到算力能力不弱于世界先进水平。

单卡不够,就用规模补。这是国产算力最现实的一条路,也解释了为什么国内厂商在系统工程上投入这么猛。

但规模补的前提是互联。把 384 张卡物理上连起来不难,难的是让它们通信时不要互相拖后腿。传统集群用以太网或 InfiniBand 组网,卡间通信要绕经网卡和交换机,延迟和带宽都上不去。超节点的做法是专用高速互联把卡直连,华为的灵衢 UnifiedBus 走的就是这个思路,从 2.0 版本起开放技术规范。昇腾 950 系列互联带宽做到 2TB/s,970 系列目标 4TB/s。

互联带宽这个指标在采购清单上经常被忽略,但它对训练效率的影响是非线性的。带宽不够,卡越多越浪费,加到一定规模后加卡几乎不再提升性能。这也是为什么有些万卡集群的实际训练效率远低于纸面算力。

超节点到底解决了什么
传统集群里,多台服务器通过网络连接,通信开销大,编程模型复杂。超节点通过高速互联把几十到几千张卡连成一个逻辑整体,让它们像一台机器一样工作。物理上是多台机器,逻辑上是一台。这对大模型训练的并行效率影响巨大。

六、六条趋势判断

01形态上移,从卖卡到卖系统

客户买的单位正在从卡变成柜。对厂商来说,这意味着竞争维度从芯片性能扩展到互联、散热、调度软件的整体能力。对客户来说,选型的颗粒度变粗了,但试错成本也高了。以前买几张卡试试水,现在一上来就是一柜。

02液冷从选配变成标配

超聚变的单柜 PUE 做到 1.06,奕行智能的 Epoch 超节点宣称整体 PUE 控制在 1.15 以内。这些数字在三年前还是实验室指标。当单机柜功率密度突破几十千瓦,风冷已经物理上做不到,液冷没有讨论余地。政企客户做机房规划时,这一条必须提前考虑,改造成本远高于新建。

03自研 HBM 成为新的分水岭

华为从昇腾 950 系列起全面切换自研 HBM,950PR 用 HiBL 1.0,950DT 用 HiZQ 2.0。这不是营销话术,HBM 是当前国产算力卡最卡脖子的环节之一,能否自主直接决定出货能力和成本结构。接下来两年,能不能拿到稳定的 HBM 供应,会把国产厂商分成两拨。

04低精度格式成为新战场

昇腾 910B 最大的短板是不支持 FP8,这在训练场景是硬伤。华为的路线图已经把补上这块作为重点,950 系列支持 FP32 / HF32 / FP16 / BF16 / FP8 / MXFP8 / HiF8 / MXFP4 / HiF4,960 还会支持自研 HiF4。FP8 算力从 950 系列的 1 PFLOPS 提到 960 的 2 PFLOPS、970 的 4 PFLOPS。低精度不只是算力数字,它直接影响推理成本和显存占用。

05生态从迁移适配走向 Day-0 原生

2026 年 4 月 DeepSeek V4 发布,技术报告把华为昇腾 950PR 写进硬件验证清单,实现了从 CUDA 到国产算力的全栈迁移。V4 发布后至少 8 家国产芯片厂商公布适配方案,V4 Flash 版本发布时超过 100 家企业做到 Day-0 接入。这个速度在 18 个月前不可想象。美团公开披露 LongCat-2.0 完全在国产算力上训练部署,训练峰值使用超过 5 万张国产加速卡,这是头部互联网公司给出的实证。

06光互连是下一个卡点

曦智科技与中兴、壁仞、沐曦、燧原、天数智芯合作的 Matrix 超节点拿了 2026 WAIC 的 SAIL 之星,方案是柜内 OEX 正交无背板互联加柜间分布式 dOCS 光交换。曦智的光跃 LightSphereX 方案已实现 2000 卡商业化落地,建成国产第一个光互连光交换超节点集群。当超节点规模往万卡走,电互联的功耗和距离都撑不住,光进铜退是迟早的事。

七、政企落地,一体机是最现实的一公里

前面讲的大多是头部玩家的故事。回到我日常接触的政企客户,真实情况要朴素得多。

绝大多数政企客户的诉求是:给我一台机器,通电、联网、开机,三天内我的业务能跑起来。他们不关心卡间互联带宽是 400GB/s 还是 896GB/s,也不关心 PUE 是 1.06 还是 1.15。

这个诉求把一体机推到了台前。一体机是面向 AI 场景设计的集成化计算设备,把 AI 芯片、服务器硬件、算法框架、行业应用软件深度集成,形成开箱即用的方案。单台一般配 8 颗或 12 颗 AI 芯片,分推理一体机和训推一体机两类。

一体机的三个实际价值
交付快。浪潮 NF5468H7 推理一体机通过 inAIP 智能引擎,3 小时完成从开机到推理服务上线。传统路径要经过硬件调试、框架适配、算子优化,周期以周计。
利用率高。通过算力智能切割与动态调度,把 8 卡集群虚拟化为多份算力单元按需分配,硬件利用率可提升至 92%。
运维简单。全栈可视化管理加健康自检,实时监控加速卡温度、显存占用,预测性维护可显著降低宕机风险。

华为的 FusionCube A3000 训推超融合一体机提供 Ultra、Pro、Lite 三种型号,搭载 Atlas 800I A2 推理服务器。中科曙光推出采用国产 x86 CPU 和国产 GPGPU 加速卡的全国产超融合一体机。三大运营商也都出了各自的 DeepSeek 版智算一体机。

还有一个值得关注的动向。山东移动的芯合一体机依托自研异构超融合软件栈,已实现 6 家国产芯片混合训练、适配 9 家国产芯片的跨架构部署能力,昇腾 910B 环境系统吞吐提升 36.6%,DeepSeek 满血版部署时间从 30 小时压缩到 4 小时。这种跨架构调度能力,对那些已经买了不止一家国产卡的客户价值很大。

场景与形态对照

场景推荐形态选型要点
市区级政务问答、办公助手推理一体机,8 卡优先看交付周期和运维简易度,算力够用就行
三甲医院影像、病历分析训推一体机或 8 卡服务器数据不出院区是硬约束,关注私有化合规能力
工业质检、视频结构化边缘小站或 PCIe 标卡服务器环境适应性优先,宽温、防尘、抗震动
省级政务云、行业智算中心OAM 形态训练服务器,逐步向超节点演进一开始就按超节点规划互联和液冷,别分期另起炉灶
模型厂商、头部互联网超节点,千卡级以上重点评估互联带宽、调度软件成熟度和实际训练效率

选型前必问的四个问题

  • 三年后规模多大。

如果超过单节点 8 卡,现在就别买 PCIe 标卡形态,形态切换的成本远高于差价。

  • 机房能不能上液冷。

不能的话,高密度形态直接排除,别买回来发现跑不满。

  • 要不要混插多家国产卡。

要的话,重点考察跨架构调度软件栈,这不是硬件厂商的强项。

  • 模型侧适配谁负责。

很多项目卡在这里,硬件厂商说模型方负责,模型方说硬件方适配,最后拖的是客户。

写在最后

2024 年国产 AI 芯片占比约 30%,2025 年跃到 41%,2026 年可能被推到接近 90%。这组曲线很漂亮,但它描述的是结果。

真正发生的事情在形态上。国产算力从一颗芯片起步,现在长成了模组、服务器、一体机、超节点、集群这样一个完整的形态谱系。单卡性能的差距还在,但系统工程的差距已经填回来不少,甚至在液冷、光互连这些新方向上跑到了前面。

对做交付的人来说,这意味着选型这件事变难了。以前比一张表就够了,现在得问清楚客户三年后要什么,再倒推今天该买什么形态。买错形态的代价,比买错品牌大得多。

要看懂国产算力,光盯着 FP16 那个数字已经不够了。得往上看一层,看它最终以什么形态交到你手上。

小鱼儿
写于 2026 年 9 月

本文数据来自 IDC、TrendForce、国家数据局、华为官网及各厂商公开资料,规格以厂商官方口径为准


本文转载自微信公众号「小鱼儿」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论