华为昇腾全线产品形态梳理:国产AI算力卡的产品形态与趋势
本文来源: 小鱼儿(公众号:小鱼儿)
原文链接: https://mp.weixin.qq.com/s/xJwbPefgrBIpaHVb1KczAw
发布时间: 2026-09-04 08:02

作者: 小鱼儿 发布时间: 2026-09-04 08:02
2025年,中国市场卖出约 400 万张 AI 加速卡。其中本土厂商出货约 165 万张,占 41%,国产份额第一次突破四成。到 2026 年 8 月,TrendForce 把预测直接改到接近 90%——国产方案要吃掉中国高端 AI 芯片市场的九成,英伟达份额从约 40% 掉到 8% 左右。
这组数字最近被转了很多遍。但过去半年我在客户现场感受到的变化,跟份额关系不大。
真正的变化在形态。三年前客户问我,买 A100 还是买 910B。现在不问这个了,现在的问题长这样:我要建一个能跑万亿参数的推理池,你给我报什么形态?八卡服务器、一体机,还是直接上超节点?
问题变了,因为产品变了。国产 AI 算力卡正在从一颗芯片,长成一台机器。
一、五层形态,把算力卡放回它该在的位置
我们习惯说算力卡,这个词现在已经不太够用。卡只是中间的一层,往上往下各有两层,每一层的选型逻辑完全不同。

图 1 国产 AI 算力的五层产品形态
芯片层决定天花板。制程、架构、HBM 容量和带宽、支持哪些低精度格式,这些是物理约束,买哪家就锁定哪家。
板卡层决定怎么插。同样是 910B,做成 PCIe 标卡还是 OAM 模组,后面的散热方案、机柜密度、能不能组超节点,全都不一样。
服务器和一体机层是政企客户真正接触的界面。客户不会去摸一颗芯片,他摸的是那台 4U 机器的把手,看的是开机到跑通服务要几个小时。
超节点层是 2026 年最大的变量,后面单说。
集群层是结果。国家数据局披露,截至 2025 年底全国智能算力规模达 159 万 PFLOPS,到 2026 年 3 月底进一步增至 188 万 PFLOPS。这个数字是前面四层一层层堆出来的。
还漏了一层,软件栈。它不占物理位置,但贯穿五层。
华为的 CANN 异构计算架构 2025 年全面开源开放,向上对接框架,向下管理算子、内存、调度和通信,配套 MindSpore、PyTorch 昇腾适配版、torch-npu、vLLM-Ascend、sglang-npu、MindIE 等工具链。寒武纪有 BANG 异构计算平台,沐曦有 MXMACA 软件栈。昇腾生态合作伙伴已超过 3000 家,截至 2025 年开发者数量超过 400 万。
软件栈的形态决定了前面五层能不能真正跑起来,也决定了迁移成本。同样规格的卡,软件栈成熟度差一年,落到项目上就是几个月的工期差。
二、板卡层的分岔,PCIe 标卡还是 OAM 模组
这是最容易被忽略、但代价最大的一个选择。很多客户第一次采购时只盯着 FP16 算力,等第二批扩容才发现形态不对,前面的机柜全用不上。
| 对比项 | PCIe 标卡 | OAM 模组 |
|---|---|---|
| 形态 | 标准 PCIe 插卡,插通用服务器 | 定制基板 + 扣卡,装专用 AI 服务器 |
| 散热 | 以风冷为主,部分支持液冷 | 高密度设计,多数为液冷 |
| 单节点密度 | 一般 4 至 8 卡 | 常见 8 卡,超节点可达 32 至 128 卡 |
| 卡间互联 | 走 PCIe 或板内桥接,带宽受限 | 专用高速互联,带宽显著更高 |
| 升级弹性 | 可插进任意兼容服务器,灵活 | 绑定特定服务器型号,锁定厂商 |
| 典型场景 | 开发测试、中小规模推理、存量机房改造 | 大模型训练、超节点、高密度推理池 |
| 维护 | 单卡可插拔更换,运维门槛低 | 多为整模组更换,对运维要求高 |
说明:OAM 指 OCP Accelerator Module,开放计算项目定义的加速模组规范,目前已成为国产超节点的主流承载形态。
我在一个省级政务云项目上见过典型踩坑。一期买了 8 台 PCIe 标卡服务器做推理,跑得很顺。二期要加训练能力,发现标卡形态撑不起来,卡间互联带宽不够,只能另起炉灶买 OAM 形态的训练服务器。一期那批机器最后退化成开发测试环境用。
一句话判断
如果你的算力需求三年内不会超过单节点 8 卡,选 PCIe 标卡,灵活、便宜、好维护。如果你要跑大模型训练或者建高密度推理池,一开始就该按 OAM 形态规划,别指望后面平滑升级。
三、华为昇腾全线产品形态梳理
国内厂商里,昇腾是唯一把五层形态全打通的。从几瓦的边缘模组到万卡级超节点,客户可以一路买上去。也正因为形态太多,选型时最容易看花眼。

梳理这条产品线,从芯片层开始最清楚。
3.1 芯片谱系,两条线并行
昇腾芯片分两个序列。310 系列面向边缘和推理,910 系列面向训练和云端。两条线的制程、功耗、算力目标完全不同,拿在一起比没有意义。
| 型号 | 发布 | 算力 | 显存 / 功耗 | 定位 |
|---|---|---|---|---|
| 昇腾 310 | 2018 | 16 TOPS INT88 TFLOPS FP16 | LPDDR4X 4–32GB8W | 边缘推理,摄像头、终端 |
| 昇腾 310B | — | 8 TOPS INT84 TFLOPS FP16 | —8W | 工业级、车载、宽温,带 ECC 纠错 |
| 昇腾 610 | 2021 | 64 TOPS INT832 TFLOPS FP16 | LPDDR4X 16–64GB20–40W | 中端推理,Atlas 300I 早期加速卡所用 |
| 昇腾 310P | — | 百 TOPS 级 | — | Atlas 300I Duo 双芯推理卡所用 |
310 系的关键词是低功耗。8W 起步,可以直接塞进摄像头和工控机,这是国产芯片在边缘场景渗透最深的一块。很多城市的视频结构化项目底层跑的就是它。
| 型号 | 状态 | 关键规格 | 定位 |
|---|---|---|---|
| 昇腾 910A | 已停产 | 7nm(台积电),FP16 256 TFLOPS,HBM2 32GB | 第一代训练芯片 |
| 昇腾 910BB1 至 B4 | 现役主力 | 7nm,FP16 280–414 TFLOPSHBM2e / HBM2.5 / HBM3e,32/64GB,310W | 主流训练与推理平台 |
| 昇腾 910C | 2025Q1 供货 | 双 910B 合封(Chiplet)FP16 640–800 TFLOPS,HBM2e 128GB / 3.2TB/s,约 600W | 千亿级大模型训练与推理 |
| 昇腾 950PR昇腾 950DT | 2026 发布 | 自研 HBM HiBL 1.0 / HiZQ 2.0FP8 1 PFLOPS,FP4 2 PFLOPS | 超节点基础,PR 主打 Prefill,DT 主打训练与 Decode |
| 昇腾 960 | 2027Q4 规划 | FP8 2 PFLOPS,FP4 4 PFLOPSHBM 288GB / 9.6TB/s | 下一代 |
| 昇腾 970 | 2028Q4 规划 | FP8 4 PFLOPS,FP4 8 PFLOPSHBM 288GB / 14.4TB/s | 下一代 |
910 系里有个关键转折。910C 用双 910B 合封的 Chiplet 方案把算力堆到 640–800 TFLOPS,代价是功耗也涨到约 600W。这是在可获得的制造工艺下提升单卡算力的现实办法,属于工程上的巧劲,不是架构突破。
950 系列才是真正的跨代。从这一代起全部切换自研 HBM,同时把 PR 和 DT 拆成两颗不同侧重的芯片,一颗主攻推理的 Prefill 阶段,一颗主攻训练和 Decode 阶段。这个拆法跟当前大模型推理的 PD 分离趋势是直接对应的,不是随便起的型号名。
3.2 产品形态矩阵,看懂 Atlas 命名规则
昇腾的硬件产品统一叫 Atlas,后面跟数字和后缀。数字本身就是一张选型地图。
Atlas 数字规则
200 系列 = 模组与开发者套件
300 系列 = PCIe 加速卡
500 系列 = 边缘小站与边缘服务器
800 系列 = 数据中心 AI 服务器
900 系列 = 超节点与集群
后缀也有讲究。T 是 Training 训练,I 是 Inference 推理,V 是 Video 视频解析,A2 和 A3 是代际标识,分别对应 910B 和 910C。看懂这几个字母,看型号就知道这机器是干什么用的。
200 系列 加速模块与开发者套件
| 产品 | 说明 |
|---|---|
| Atlas 200I A2 加速模块 | 面向边缘的板卡级 AI 模组 |
| Atlas 200I DK A2 开发者套件 | 开发者入门套件 |
| Atlas 200 DK | 早期开发者套件 |
300 系列 AI 加速卡与视频解析卡
| 产品 | 芯片 | 关键点 |
|---|---|---|
| Atlas 300I A2(新命名 A300I A2) | 昇腾 910B | 2025 年 9 月上市,推理标卡,24 / 32 / 64GB HBM2e |
| Atlas 300I Pro | 昇腾 910B | PCIe 推理卡,FP16 256T / INT8 512T |
| Atlas 300I Duo | 昇腾 310P 双 Die | 双芯高密度推理,生命周期短,约 292 天即停产 |
| Atlas 300V / 300V Pro | 昇腾 310 / 310P | 视频解析卡,32 / 48GB |
| Atlas 300T Pro | 昇腾 910 | 训练标卡 |
| Atlas 300T A2300V Pro A2 等 | 昇腾 910 系 | 训练与视频解析升级版 |
300 系列里有个值得记住的教训。Atlas 300I Duo 上市约 292 天就停产了。做政企项目时如果选了生命周期短的产品,二期扩容会非常被动,这条在选型时一定要问清楚厂商的产品生命周期承诺。
500 系列 智能边缘
| 产品 | 说明 |
|---|---|
| Atlas 500 A2 智能小站 | 边缘一体机,算力强、体积小、环境适应性强 |
| Atlas 500 Pro 智能边缘服务器(型号 3000) | 边缘场景多卡部署 |
800 系列 AI 服务器与一体机
| 产品 | 芯片 | 定位 |
|---|---|---|
| Atlas 800 推理服务器(型号 3000) | 910B | 中心侧推理 |
| Atlas 800T A2 训练服务器 | 910B × 8 | 8 卡训练主力 |
| Atlas 800I A2 推理服务器 | 910B × 8 | 8 卡推理 |
| Atlas 800T A3 超节点服务器 | 910C | 训练超节点,支持 32 至 384 卡扩展 |
| Atlas 800I A3 超节点服务器 | 910C | 推理超节点,2026 年 4 月发布 |
| Atlas 800 A2 / A3 | 910B / 910C | 2025 年 3 月发布,2U 结构,AI 推理优化,支持 MoE 加速 |
800 系列是政企客户接触最多的一层。判断依据很简单,看后缀 T 还是 I。要训练买 T,要推理买 I。数字后面跟 A2 说明是 910B 平台,A3 说明是 910C 平台。
900 系列 超节点与大规模集群
| 产品 | 关键点 |
|---|---|
| Atlas 900 AI 集群 / SuperPoD | 万卡级集群,早期主打 1750 亿参数训练提速 |
| CloudMatrix 384 超节点 | 满配 384 颗 910C |
| Atlas 950 SuperPoD 超节点 | 搭载 950 系列,2026 年 WAIC 首秀 |
3.3 主力型号 910B,规格与分档
910B 是目前出货量最大、使用最广的型号,也是多数政企客户真正会买到的那一款。它的完整规格如下。
| 项目 | 规格 |
|---|---|
| 芯片架构 | 华为自研达芬奇 3D Cube 架构,针对矩阵运算深度优化 |
| 制程工艺 | 7nm EUV(增强版) |
| AI 核心数 | 32 核昇腾 AI 处理器 |
| 核心算力 | FP16 256–376 TFLOPS(依版本,B1 最高 414) |
| 整数算力 | INT8 512–1000+ TOPS |
| 显存类型 | HBM2e / HBM2.5 / HBM3e(依版本不同) |
| 显存容量 | 32GB / 64GB(B1 至 B3 多为 64GB) |
| 显存带宽 | 约 1.2–1.6 TB/s(HBM3e 版本),HBM2e 版本约 392 GB/s 至 1 TB/s |
| 典型功耗 | 310W(部分版本最高 400W) |
| 能效比 | 0.8 TFLOPS/W(FP16) |
| 卡间互联 | HCCS,单节点 8 卡全互联带宽约 448 GB/s |
| 接口 | PCIe 4.0 x16(加速卡另支持 RoCE v2 双端口) |
说明:以上规格综合自行业公开资料与生态伙伴信息,不同供货批次存在差异,采购选型时须以厂商实际规格书为准。
两个容易被忽略的指标值得单说。一个是卡间互联 HCCS,单节点 8 卡全互联带宽约 448 GB/s,这个数字直接决定 8 卡能不能跑出接近线性的加速比。另一个是能效比 0.8 TFLOPS/W,310W 的功耗对上 A100 的 400W,在机房电力紧张的场景是实打实的优势。
910B 在供货上分了四个档位,这是很多人第一次采购时最困惑的地方。
| 型号 | FP16 算力 | 显存 | 显存类型 | 定位与适用场景 |
|---|---|---|---|---|
| 910B1 | 414 TFLOPS | 64GB | HBM2 | 千亿级参数大模型训练,性能天花板 |
| 910B2 | 376 TFLOPS | 64GB | HBM2e | 通用训练服务器标准配置 |
| 910B3 | 313 TFLOPS | 64GB | HBM3e(1.2TB/s) | 大模型推理优化,DeepSeek 一体机常用 |
| 910B4 | 280 TFLOPS | 32 / 64GB | HBM2 | 边缘计算、中小模型推理、低功耗定制 |
B1 至 B4 选型原则
训练 50B 以上大模型,选 B1,注意需要液冷
训练 10B 至 50B,或科研金融场景,选 B2
训练加推理混合、国产化替代、政务云,选 B3,性价比最稳
只做推理或 API 服务、跑小模型,选 B4
注意 B1 的算力最高但用的是 HBM2,带宽反而不是最强。B3 虽然 FP16 算力只有 313 TFLOPS,但配的是 HBM3e,带宽 1.2TB/s,做推理反而更合适。算力数字不是唯一标准,得看你的负载是计算密集还是访存密集。
3.4 与英伟达的选型对照
把 910B 和同期英伟达的几款主流卡放在一起,差距在哪一目了然。
| 规格项 | 昇腾 910B(以 B2 为例) | A100 80GB | H100 80GB | H20 96GB |
|---|---|---|---|---|
| 架构 | 达芬奇 | Ampere | Hopper | Hopper |
| FP16 算力 | 376 TFLOPS | 312 TFLOPS | 约 495 TFLOPS | 148 TFLOPS |
| FP8 | 不支持 | 不支持 | 989 TFLOPS | 296 TFLOPS |
| 显存 | 64GB HBM2e | 80GB HBM2e | 80GB HBM3 | 96GB HBM3e |
| 显存带宽 | 约 1.2–1.6 TB/s | 2.0 TB/s | 3.35 TB/s | 4.0 TB/s |
| 功耗 | 310W | 400W | 700W | 400W |
| 卡间互联 | HCCS | NVLink 3.0 | NVLink 4.0 | NVLink 4.0 |
三条结论。FP16 算力已经超过 A100,这是实打实的进步。FP8 缺失是最大硬伤,训练场景绕不开。显存带宽仍是短板,HBM2e 版本差距明显,HBM3e 版本(B3)补上了一部分。
按场景对照着选,比背参数快。
| 场景 | 昇腾选择 | 英伟达对应参考 |
|---|---|---|
| 边缘摄像头、终端推理 | 昇腾 310 / 310B + Atlas 500 | Jetson Orin |
| 视频解析、OCR、目标检测 | Atlas 300V Pro / 300I Duo | T4 |
| 数据中心通用推理 | 910B(B3 / B4)+ Atlas 300I A2 / 800I A2 | L4 / A10 / A100 |
| 大模型训练 10B 至 50B | 910B(B2)+ Atlas 800T A2 | A100 80GB |
| 千亿级大模型训练与推理 | 910C + Atlas 800T A3 | H100(约 60% 档) |
| 万亿级、超节点集群 | 910C SuperPoD,或 950 | B200 / B300 SuperPOD |
| 国产化合规加性价比通用 | 910B3,当前最稳 | — |
一句话判断
看重生态成熟度和 FP8 训练,优先英伟达。看重国产化、合规、性价比和推理部署,昇腾 910B3 和 910C 是当前最务实的选择。
3.5 迭代路线图
| 时间节点 | 芯片 | 要点 |
|---|---|---|
| 2025Q1 | 910C | 双 910B 合封,大模型主力 |
| 2026Q1 | 950PR | 自研 HBM HiBL 1.0,FP8 1P,主攻 Prefill |
| 2026Q4(提前至 2026.8 上线) | 950DT | 自研 HBM HiZQ 2.0,主攻训练与 Decode |
| 2027Q4 | 960 | FP8 2P / FP4 4P,HBM 288GB / 9.6TB/s |
| 2028Q4 | 970 | FP8 4P / FP4 8P,HBM 288GB / 14.4TB/s |
华为官网公布的节奏是一年一代、算力翻倍。从 950 起全部切换华为自研 HBM,同时引入 SIMD 与 SIMT 双编程模型。前者解决供应安全,后者解决编程易用性,两条都是冲着长期生态去的。
四、其他厂商的形态版图
昇腾之外,把其他主要厂商的产品形态摊开看,路线差异也很清晰。
| 厂商 | 主力芯片 | 板卡形态 | 系统形态与特点 |
|---|---|---|---|
| 寒武纪 | 思元 590思元 690 | 以 OAM 模组为主,兼顾 PCIe | 训推一体,思元 690 采用双 die 封装,2026 年初量产 |
| 海光信息 | DCU 深算系列 | OAM 与 PCIe 均有 | CPU 加 DCU 双芯方案,与中科曙光深度协同做系统集成 |
| 沐曦 | 曦云 C500 / C550 / C600 | PCIe 版与 OAM 版并行 | 通用 GPGPU 路线,MXMACA 软件栈,2026 年首发曦景 S600 超节点 |
| 昆仑芯 | P800 / R200 系列 | OAM 为主 | 深度适配百度文心,推理规模化落地成熟,超节点已量产 |
| 燧原科技 | 云燧系列 | OAM 模组 | 2026 年首发云燧 ESL64-O 超节点,强调五层协同设计 |
| 阿里 / 百度 / 腾讯 | 自研 ASIC | 自用为主 | 不对外单卖卡,以云服务形式输出,走内部消化路线 |
数据来源:各厂商官网及公开产品资料整理,截至 2026 年 9 月。部分厂商未公开完整规格,此处仅列形态信息。
寒武纪 2026 年上半年营收
59.96 亿元
、净利润
23.11 亿元
,新一代旗舰思元 690 已量产,采用双 die 封装,FP16 算力超过 700 TFLOPS,配 196GB HBM3 显存。这个规格已经不是替代 A100 的量级了。
海光走的是另一条路,CPU 加 DCU 双芯,配合中科曙光做系统。2026 年 7 月,双方宣布中国首个全国产十万卡 AI 超集群曙光 8000(登峰)落成。这是芯片厂商和系统集成商深度绑定的典型。
互联网大厂的自研 ASIC 不对外卖卡,这是很多人会忽略的一块。它们以云服务形式输出,但同样吃掉了大量国产芯片产能,也间接推高了国产份额。
五、2026 年最大变量,超节点成为主导形态
2026 年 7 月的 WAIC,国产算力展区几乎变成了超节点展会。这个信号比任何一份研报都直接。
| 厂商 / 方案 | 超节点产品 | 规模 | 公开关键指标 |
|---|---|---|---|
| 华为 | Atlas 900 超节点 | 满配 384 卡 | 搭载 910C,最大算力 300 PFLOPS,2025 年 3 月推出 |
| 华为 | Atlas 950 SuperPoD | 8192 卡 | FP8 精度下总算力 1 EFLOPS,2026 年 WAIC 首秀 |
| 新华三 | UniPoD S80000 | 32 至 1024 卡,最高扩至 16384 卡 | 训练性能提升 70%,推理性能提升 3 倍 |
| 联想 | 问天超节点 | 单节点 40 张 GPU | FP8 算力超 28 PFLOPS,HBM 显存突破 5.76 TB |
| 超聚变 | 超节点方案 | 单柜 128 卡 | 第五代 100% 原生液冷整机柜,PUE 低至 1.06 |
| 海光 + 曙光 | ScaleX640 + ScaleX40 | 十万卡级 | 曙光 8000(登峰),全国产十万卡 AI 超集群 |
| 中兴 | 超节点方案 | 128 卡 | 支持多芯片混插,dOCS 算网一体化液冷 |
| 东方算芯 | 拓域 TY64 | 单柜 64 卡 | 33P BF16 算力,单卡 896GB/s 互联 |
| 阿里云 | 真武 M890 × 磐久 AL128 | 128 卡 | 获选 2026 WAIC 镇馆之宝 |
数据来源:2026 世界人工智能大会公开报道及厂商发布信息整理,规格以厂商官方口径为准。
为什么超节点突然成了必选项?
答案有点无奈。受制于可获得的制造工艺,国产单颗芯片的算力跟英伟达旗舰仍有代差。华为轮值董事长徐直军在 2025 年全联接大会上讲得很直白,受制于先进芯片制造工艺的不可获得,华为单颗芯片算力与英伟达仍有差距,但可以用超节点方案做到算力能力不弱于世界先进水平。
单卡不够,就用规模补。这是国产算力最现实的一条路,也解释了为什么国内厂商在系统工程上投入这么猛。
但规模补的前提是互联。把 384 张卡物理上连起来不难,难的是让它们通信时不要互相拖后腿。传统集群用以太网或 InfiniBand 组网,卡间通信要绕经网卡和交换机,延迟和带宽都上不去。超节点的做法是专用高速互联把卡直连,华为的灵衢 UnifiedBus 走的就是这个思路,从 2.0 版本起开放技术规范。昇腾 950 系列互联带宽做到 2TB/s,970 系列目标 4TB/s。
互联带宽这个指标在采购清单上经常被忽略,但它对训练效率的影响是非线性的。带宽不够,卡越多越浪费,加到一定规模后加卡几乎不再提升性能。这也是为什么有些万卡集群的实际训练效率远低于纸面算力。
超节点到底解决了什么
传统集群里,多台服务器通过网络连接,通信开销大,编程模型复杂。超节点通过高速互联把几十到几千张卡连成一个逻辑整体,让它们像一台机器一样工作。物理上是多台机器,逻辑上是一台。这对大模型训练的并行效率影响巨大。
六、六条趋势判断
01形态上移,从卖卡到卖系统
客户买的单位正在从卡变成柜。对厂商来说,这意味着竞争维度从芯片性能扩展到互联、散热、调度软件的整体能力。对客户来说,选型的颗粒度变粗了,但试错成本也高了。以前买几张卡试试水,现在一上来就是一柜。
02液冷从选配变成标配
超聚变的单柜 PUE 做到 1.06,奕行智能的 Epoch 超节点宣称整体 PUE 控制在 1.15 以内。这些数字在三年前还是实验室指标。当单机柜功率密度突破几十千瓦,风冷已经物理上做不到,液冷没有讨论余地。政企客户做机房规划时,这一条必须提前考虑,改造成本远高于新建。
03自研 HBM 成为新的分水岭
华为从昇腾 950 系列起全面切换自研 HBM,950PR 用 HiBL 1.0,950DT 用 HiZQ 2.0。这不是营销话术,HBM 是当前国产算力卡最卡脖子的环节之一,能否自主直接决定出货能力和成本结构。接下来两年,能不能拿到稳定的 HBM 供应,会把国产厂商分成两拨。
04低精度格式成为新战场
昇腾 910B 最大的短板是不支持 FP8,这在训练场景是硬伤。华为的路线图已经把补上这块作为重点,950 系列支持 FP32 / HF32 / FP16 / BF16 / FP8 / MXFP8 / HiF8 / MXFP4 / HiF4,960 还会支持自研 HiF4。FP8 算力从 950 系列的 1 PFLOPS 提到 960 的 2 PFLOPS、970 的 4 PFLOPS。低精度不只是算力数字,它直接影响推理成本和显存占用。
05生态从迁移适配走向 Day-0 原生
2026 年 4 月 DeepSeek V4 发布,技术报告把华为昇腾 950PR 写进硬件验证清单,实现了从 CUDA 到国产算力的全栈迁移。V4 发布后至少 8 家国产芯片厂商公布适配方案,V4 Flash 版本发布时超过 100 家企业做到 Day-0 接入。这个速度在 18 个月前不可想象。美团公开披露 LongCat-2.0 完全在国产算力上训练部署,训练峰值使用超过 5 万张国产加速卡,这是头部互联网公司给出的实证。
06光互连是下一个卡点
曦智科技与中兴、壁仞、沐曦、燧原、天数智芯合作的 Matrix 超节点拿了 2026 WAIC 的 SAIL 之星,方案是柜内 OEX 正交无背板互联加柜间分布式 dOCS 光交换。曦智的光跃 LightSphereX 方案已实现 2000 卡商业化落地,建成国产第一个光互连光交换超节点集群。当超节点规模往万卡走,电互联的功耗和距离都撑不住,光进铜退是迟早的事。
七、政企落地,一体机是最现实的一公里
前面讲的大多是头部玩家的故事。回到我日常接触的政企客户,真实情况要朴素得多。
绝大多数政企客户的诉求是:给我一台机器,通电、联网、开机,三天内我的业务能跑起来。他们不关心卡间互联带宽是 400GB/s 还是 896GB/s,也不关心 PUE 是 1.06 还是 1.15。
这个诉求把一体机推到了台前。一体机是面向 AI 场景设计的集成化计算设备,把 AI 芯片、服务器硬件、算法框架、行业应用软件深度集成,形成开箱即用的方案。单台一般配 8 颗或 12 颗 AI 芯片,分推理一体机和训推一体机两类。
一体机的三个实际价值
交付快。浪潮 NF5468H7 推理一体机通过 inAIP 智能引擎,3 小时完成从开机到推理服务上线。传统路径要经过硬件调试、框架适配、算子优化,周期以周计。
利用率高。通过算力智能切割与动态调度,把 8 卡集群虚拟化为多份算力单元按需分配,硬件利用率可提升至 92%。
运维简单。全栈可视化管理加健康自检,实时监控加速卡温度、显存占用,预测性维护可显著降低宕机风险。
华为的 FusionCube A3000 训推超融合一体机提供 Ultra、Pro、Lite 三种型号,搭载 Atlas 800I A2 推理服务器。中科曙光推出采用国产 x86 CPU 和国产 GPGPU 加速卡的全国产超融合一体机。三大运营商也都出了各自的 DeepSeek 版智算一体机。
还有一个值得关注的动向。山东移动的芯合一体机依托自研异构超融合软件栈,已实现 6 家国产芯片混合训练、适配 9 家国产芯片的跨架构部署能力,昇腾 910B 环境系统吞吐提升 36.6%,DeepSeek 满血版部署时间从 30 小时压缩到 4 小时。这种跨架构调度能力,对那些已经买了不止一家国产卡的客户价值很大。
场景与形态对照
| 场景 | 推荐形态 | 选型要点 |
|---|---|---|
| 市区级政务问答、办公助手 | 推理一体机,8 卡 | 优先看交付周期和运维简易度,算力够用就行 |
| 三甲医院影像、病历分析 | 训推一体机或 8 卡服务器 | 数据不出院区是硬约束,关注私有化合规能力 |
| 工业质检、视频结构化 | 边缘小站或 PCIe 标卡服务器 | 环境适应性优先,宽温、防尘、抗震动 |
| 省级政务云、行业智算中心 | OAM 形态训练服务器,逐步向超节点演进 | 一开始就按超节点规划互联和液冷,别分期另起炉灶 |
| 模型厂商、头部互联网 | 超节点,千卡级以上 | 重点评估互联带宽、调度软件成熟度和实际训练效率 |
选型前必问的四个问题
- 三年后规模多大。
如果超过单节点 8 卡,现在就别买 PCIe 标卡形态,形态切换的成本远高于差价。
- 机房能不能上液冷。
不能的话,高密度形态直接排除,别买回来发现跑不满。
- 要不要混插多家国产卡。
要的话,重点考察跨架构调度软件栈,这不是硬件厂商的强项。
- 模型侧适配谁负责。
很多项目卡在这里,硬件厂商说模型方负责,模型方说硬件方适配,最后拖的是客户。
写在最后
2024 年国产 AI 芯片占比约 30%,2025 年跃到 41%,2026 年可能被推到接近 90%。这组曲线很漂亮,但它描述的是结果。
真正发生的事情在形态上。国产算力从一颗芯片起步,现在长成了模组、服务器、一体机、超节点、集群这样一个完整的形态谱系。单卡性能的差距还在,但系统工程的差距已经填回来不少,甚至在液冷、光互连这些新方向上跑到了前面。
对做交付的人来说,这意味着选型这件事变难了。以前比一张表就够了,现在得问清楚客户三年后要什么,再倒推今天该买什么形态。买错形态的代价,比买错品牌大得多。
要看懂国产算力,光盯着 FP16 那个数字已经不够了。得往上看一层,看它最终以什么形态交到你手上。
小鱼儿
写于 2026 年 9 月
本文数据来自 IDC、TrendForce、国家数据局、华为官网及各厂商公开资料,规格以厂商官方口径为准
本文转载自微信公众号「小鱼儿」,仅供学习交流使用。
觉得内容不错?我要