算力白热化:DGX Spark/Strix Halo/AI Studio三足鼎立,加速AI平民进阶

本文摘要25 年扎堆发布的几款新 mini 微型算力盒子/架构,把个人算力白热化:DGX Spark/Strix Halo/AI Studio 三足鼎立,加速 AI 平民进阶。本文做了详细的介绍。

本期介绍

人工智能技术的迅猛发展,正以前所未有的速度推动算力需求的增长。华为《智能世界 2035》预测,2035 年全社会的算力总量跟 2025 年相比,将增长 10 万倍。计算领域将迎来历史性变革——技术演进路径将逐步脱离传统冯 • 诺依曼架构的框架束缚,在计算架构、材料器件、工程工艺、计算范式四大核心层面实现颠覆性创新,最终催生新型计算的全面兴起。

25 年扎堆发布的几款新 mini 微型算力盒子/架构,把个人算力白热化:DGX Spark/Strix Halo/AI Studio 三足鼎立,加速 AI 平民进阶。本文做了详细的介绍。

一. 算力集群向个人算力演进

从当前形式看,算力集群 向 个人算力的加速进程,比当年的个人 PC 来的更快!

马斯克 COLOSSUS AI 超算集成了 10 万个英伟达 H100 GPU,华为昇腾 384 超节点等等算力集群,逐步向平民化的 mini 个人算力进化。

image.png

image.png

image.png

(图 1:算力集群向平民化的 mini 个人算力快速演进)

24 年末到 25 年,扎堆发布的几款新 mini 微型算力盒子/架构,回顾如下:

2025-1-7 AMD Strix Halo

北京时间 1 月 7 日,处理器大厂 AMD 在 CES 2025 展会上推出全新 APU 系列产品——代号为代号“Strix Halo”的 Ryzen AI Max 系列,面向高端 AI PC,号称可提供最卓越的 Copilot+ 体验。其中,旗舰型号 Ryzen AI Max+ 395 拥有高达 16 核 CPU 和 40 核 GPU,为 AI PC 带来前所未有的性能提升。

2025-3-18 NVIDIA DGX Spark

2025 年 3 月 18 日,NVIDIA 发布了由 NVIDIA Grace Blackwell 平台驱动的 DGX™ 个人 AI 超级计算机。

DGX Spark 是小型 AI 超级计算机,为数以百万计的研究人员、数据科学家、机器人开发者和学生提供超强性能和功能,助力他们突破生成式和物理 AI 的边界。

2025-9-18 Orange Pi AI Studio

2025 年 9 月 18-20 日的第十届华为全联接大会(HUAWEI CONNECT 2025)上,华为昇腾 APN 钻石合作伙伴迅龙软件发布高算力人工智能产品 OrangePi AI Studio Pro。

它是一款 352TOPS 超强算力卡,集成了两个 16 核芯片,双芯动力,支持训练与推理一体化部署,96GB / 192GB 大内存,可高效运行大模型与多模态 AI 任务。其紧凑的设计和广泛的操作系统兼容性,也让企业用户能在不更换现有设备的情况下,快速提升 AI 处理能力,显著降低开发与运营成本。

oem 产品化 数十家厂商陆续推出 mini 机

  • 英伟达(NVIDIA)NVIDIA DGX Spark 主机 AI 超级计算机 桌面大模型一体机 Blackwell 构架 Deepseek 深度学习工作站小型服务器
  • 联想(Lenovo)ThinkStation PGX GB10 Grace Blackwell 4TB 便携式 AI 开发者工作站主机 DGX Spark AI 超级计算机
  • 华硕(ASUS)DGX spark GX10 迷你 mini 主机 个人 AI 超级计算机桌面级电脑移动工作站 GB10 超级芯片 128GB+1T
  • 戴尔 Dell Pro Max with GB10 高性能 AI 超算台式电脑 Blackwell 128G 2T 机器人开发 智算推理 DGX Spark
  • 挚科 ZK-miniPC 智算推理一体机 Dell Pro Max with GB10 高性能超算便携式 AI 开发 Grace Blackwell 2TB
  • 香橙派 Orange Pi AI Studio 华为升腾 OPI AI Studio Pro 算力卡 192G 套件
  • abee 迷你 AMD 锐龙 AI Max+395/128G/2T/8060S 液冷 AI 工作站台式电脑主机 本地部署 存算一体机
  • ROG 幻 X2025 锐龙 AI MAX+395 8060S | 128G 内存 1TB 高速固态硬盘 2.5K 180Hz P3 13.4 英寸触控二合一游戏本笔记本电脑
  • ……
    [以上参考数据来源:京东商品]
    *

二. 个人算力架构分析

三类(DGX Spark/Strix Halo/AI Studio)架构设计核心参数如下:

image.png

1. DGX Spark 架构详解

DGX Spark 的核心是 NVIDIA GB10 Grace Blackwell 超级芯片,是 NVIDIA 与联发科联合设计的革命性产品 。该芯片采用先进的 2.5D 封装技术,将 CPU、GPU、内存集成在同一封装内,实现了前所未有的系统集成度。

在 CPU 设计上,GB10 配备了 20 核 Arm 架构处理器,采用大小核设计:10 个 Cortex-X925 高性能核心(主频最高 3.3GHz)和 10 个 Cortex-A725 能效核心(主频 2.5GHz) 。每个核心都配备了独立的 L2 缓存,其中 Cortex-X925 核心每个拥有 1MB L2 缓存,Cortex-A725 核心每个拥有 512KB L2 缓存,两个集群各拥有 16MB L3 缓存 。这种设计确保了在处理复杂 AI 工作负载时既能提供强大性能,又能保持良好的能效比。

GPU 部分采用了最新的 Blackwell 架构,配备 6144 个 CUDA 核心,支持第五代 Tensor Core 和第四代 RT Core 。第五代 Tensor Core 的最大亮点是支持 FP4 精度计算,理论上可提供高达 1000 AI TOPS(1 PetaFLOP)的 AI 性能 。同时,该 GPU 还集成了第五代 NVDEC 和第九代 NVENC 编解码引擎,支持 MPEG-2、VC-1、H.264、H.265、VP8、VP9 和 AV1 等多种视频格式的硬件加速。

内存系统是 DGX Spark 的另一个关键创新。它配备了 128GB LPDDR5X-9400 统一内存,通过 256 位内存接口提供高达 273GB/s 的带宽 。CPU 和 GPU 通过 NVLink-C2C 互连技术共享这个统一内存池,带宽高达 900GB/s,是第五代 PCIe 的 5 倍 。这种设计彻底打破了传统架构中 CPU 和 GPU 之间的数据传输瓶颈,实现了真正的内存一致性模型。

网络方面,DGX Spark 集成了 ConnectX-7 200Gb/s 智能网卡,支持 RDMA(远程直接内存访问)技术 。通过双机互连,可以将两台 DGX Spark 连接起来,总内存扩展到 256GB,支持高达 4050 亿参数的模型 。

[以上参考数据来源:官方资料]

2. AMD Strix Halo 架构创新

AMD Strix Halo(正式名称为 Ryzen AI Max 系列)代表了 AMD 在 AI PC 领域的重大突破,是首款采用 Chiplet 设计的客户端 APU。其架构设计充分体现了 AMD "Zen5+RDNA3.5+XDNA2" 的三重计算单元战略。

CPU 部分采用了 16 核 32 线程的 Zen5 架构,基于台积电 4nm 工艺制程 。与传统的移动处理器不同,Strix Halo 仅使用完整的 Zen5 核心,没有采用能效核心(Zen5c),所有核心的最高频率都可达 5.1GHz 。旗舰型号 Ryzen AI Max+ 395 配备了 80MB 三级缓存(L3 Cache),其中包含 64MB 的共享 L3 缓存和 16MB 的 L2 缓存 。这种全大核设计确保了在处理多线程 AI 工作负载时的卓越性能。

GPU 采用了 RDNA 3.5 架构,集成了强大的集成显卡。旗舰型号配备 40 个计算单元(CUs),相当于 2560 个流处理器,最高频率可达 2.9GHz 。该 GPU 还配备了 32MB 的 Infinity Cache(也称为 MALL,Memory Access at Last Level),通过 256 位 LPDDR5X-8000 内存接口提供高达 256GB/s 的带宽 。根据配置不同,可以分配最多 96GB 作为专用显存(通过 AMD Variable Graphics Memory 技术),这在集成显卡中是前所未有的 。

最具创新性的是 XDNA 2 NPU,提供高达 50 TOPS 的 AI 算力 。这个 NPU 专门针对 AI 工作负载优化,在能效比上表现出色。与 CPU 和 GPU 不同,NPU 采用了完全不同的架构设计,能够高效处理矩阵运算、向量运算等 AI 专用操作。

Strix Halo 的另一个重要创新是其互连设计。AMD 采用了全新的水平扇出封装技术,通过"电线的海洋"直接连接两个 CCD(Chip Chiplet Die),取代了传统的 GMI 收发器和 SerDes 电路 。这种设计不仅降低了延迟,还减少了功耗,系统整体能耗较传统方案降低约 18%。

[以上参考数据来源:官方资料]

3. AI Studio Pro 架构特色

AI Studio Pro 由香橙派(Orange Pi)与华为合作推出,采用了昇腾 AI 技术路线,是一款训推一体的人工智能算力卡 。其架构设计充分体现了华为在 AI 芯片领域的技术积累。

该产品搭载了两颗昇腾 310 系列处理器(可能是 310B 或 310P),每颗处理器集成了 8 个 A55 架构核心和 2 个 AI Core 。通过双处理器设计,总共提供 16 个 A55 核心和 16 个 AI Core,总算力达到 352 TOPS(INT8 精度) 。这种设计充分利用了昇腾芯片的架构优势,通过多核并行处理实现了强大的 AI 算力。

AI Core 采用了华为自研的达芬奇架构,每个 AI Core 能够在每个周期内完成 4096 次 MAC(Multiply-Accumulate)计算 。这种架构特别适合处理深度学习中常用的矩阵、向量和标量计算。同时,芯片还集成了数字视觉预处理模块(DVPP),能够高效处理图像和视频数据 。

内存系统提供了 96GB 或 192GB 的 LPDDR4X 内存,运行速率高达 4266Mbps 。虽然内存带宽相比前两款产品较低,但对于边缘 AI 应用来说已经足够。该产品还配备了两组 32MB SPI Flash 用于存储启动代码和配置信息 。

在接口设计上,AI Studio Pro 配备了 Type-C(USB4.0)接口,支持 40Gbps 的数据传输速率 。电源采用 DC 12V/20A 输入,标准功耗 240W。散热方面采用了双风扇设计,确保在长时间高负载运行时的稳定性 。

软件生态是 AI Studio Pro 的重要优势。它预装了完整的昇腾 AI 软件栈,包括 MindSpore、CANN 等华为自研的 AI 开发框架和工具链。目前支持 Ubuntu 22.04.5 系统(Linux 5.15 内核),并计划支持 Windows 系统 。特别值得一提的是,该产品深度适配了 DeepSeek-R1 蒸馏模型,支持本地离线部署 。

[以上参考数据来源:官方资料]

三. 整体性能表现评估

三款产品在峰值算力、内存系统性能、功耗与能效比、互连性能分析等纬度对比展现出了截然不同的特点和定位:

image.png

1. 峰值算力对比

在峰值算力方面,三款产品展现出了截然不同的特点和定位:

DGX Spark 在 FP4 精度下理论上可提供高达 1 PetaFLOP(1000 TFLOPS)的 AI 算力 。然而,实际测试结果却存在较大争议。根据 John Carmack 等独立测试者的报告,DGX Spark 在 BF16 工作负载下仅能达到约 60 TFLOPS 的性能,在 FP4 工作负载下约为 480 TFLOPS,均远低于官方宣传值 。这种巨大的差距主要源于 NVIDIA 对 FP4 性能的宣传基于稀疏计算,而实际应用中很难达到理论峰值。在 FP16 稠密模式下,DGX Spark 的算力约为 125 TFLOPS ,这才是更接近实际应用场景的性能指标。

[以上参考数据来源:新浪,快科技官方]

AMD Strix Halo 的性能表现相对更加务实。其 XDNA 2 NPU 提供高达 50 TOPS(INT8)的 AI 算力 。虽然绝对数值不及 DGX Spark,但考虑到其功耗仅为 45-120W ,能效比表现相当出色。在 CPU 性能方面,Strix Halo 在 Cinebench R23 多核测试中获得了 31,485 分 ,性能超越了许多桌面级处理器。GPU 部分,其集成的 Radeon 8060S 在 3DMark Time Spy 测试中展现出了接近 RTX 4060 笔记本电脑显卡的性能 。

[以上参考数据来源:IT 之家-故渊]

AI Studio Pro 配备两颗昇腾 310 处理器,总算力达到 352 TOPS(INT8)或 176 TFLOPS(FP16) 。单颗昇腾 310 处理器的规格为 FP16 16 TFLOPS,INT8 22 TOPS ,通过双处理器设计实现了性能翻倍。虽然绝对算力不及 DGX Spark,但考虑到其主要面向边缘 AI 应用,这样的性能已经足够。

[以上参考数据来源:华为云]

2. 内存系统性能

内存系统的性能直接影响了大模型的加载和运行能力。

DGX Spark 配备了 128GB LPDDR5X-9400 统一内存,通过 256 位内存接口提供 273-275GB/s 的带宽 。CPU 和 GPU 通过 NVLink-C2C 互连共享内存池,理论带宽高达 900GB/s 。这种高带宽设计对于运行大模型至关重要,特别是在处理需要频繁访问内存的数据时。

[以上参考数据来源:51CTO]

AMD Strix Halo 支持最高 128GB LPDDR5X-8000 统一内存,通过四通道设计提供 256GB/s 的带宽 。通过 AMD Variable Graphics Memory 技术,可以分配最多 96GB 作为专用显存 。虽然内存带宽略低于 DGX Spark,但考虑到其主要面向笔记本电脑等移动设备,这样的配置已经相当出色。

[以上参考数据来源:IT 之家-故渊]

AI Studio Pro 提供了 96GB 或 192GB LPDDR4X 内存,运行速率为 4266Mbps 。虽然内存类型较老(LPDDR4X vs LPDDR5X),但 192GB 的容量在三款产品中是最大的,这对于需要处理大量数据的 AI 应用来说是一个重要优势。

以上参考数据来源:IT 之家-故渊

3. 功耗与能效比

功耗和能效比是评估 AI 硬件的重要指标,特别是对于需要大规模部署的场景。

DGX Spark 的额定功耗为 240W,但实际测试中最高仅能达到约 100W,不到额定值的一半 。待机功耗约为 44-45W 。在能效比方面,DGX Spark 的整机能效比达到 0.184 TFLOPs/W(FP16 等效),比 H100 数据中心 GPU 的能效提升 3.2 倍。然而,考虑到实际性能与宣传的巨大差距,其实际能效比可能并不如理论值那么出色。

以上参考数据来源:OC3D.NET]

AMD Strix Halo 的功耗范围为 45-120W,可根据应用需求动态调节 。在 80W 功耗释放状态下,核心平均温度仅为 90℃ ,显示出良好的散热设计。特别值得一提的是,其待机功耗可低至 5W 左右,不到桌面版锐龙 9 9950X 的 1/5 。在 7-8W 的最低功耗模式下,续航时间可达 6-7 小时 ,这对于移动设备来说是一个巨大优势。

以上参考数据来源:IT 之家-故渊

AI Studio Pro 的标准功耗为 240W(DC 12V/20A 输入) 。考虑到其总算力为 352 TOPS,其能效比约为 1.47 TOPS/W。作为对比,单颗昇腾 310 处理器的能效比为 2.75 TOPS/W(22 TOPS/8W) ,双处理器设计在一定程度上降低了整体能效比,但仍处于可接受范围内。

以上参考数据来源:电子街

4. 互连性能分析

互连性能对于多设备协作和数据传输至关重要。

DGX Spark 采用了革命性的 NVLink-C2C 互连技术,相比 PCIe Gen 5 PHY,能效提升了 25 倍,面积效率提升了 90 倍 。CPU 和 GPU 之间的理论带宽高达 900GB/s,是第五代 PCIe 的 5 倍 。此外,DGX Spark 还配备了 ConnectX-7 200Gb/s 智能网卡,支持 RDMA 技术,两台设备通过专用电缆互连后可扩展至 4050 亿参数的模型处理能力 。

以上参考数据来源:51CTO]

AMD Strix Halo 采用了创新的互连设计,通过水平扇出封装直接连接两个 CCD,移除了传统的 GMI 收发器和 SerDes 电路 。这种设计带来了显著的改进:系统整体能耗降低约 18%,通信延迟改善,在多芯粒协同计算场景下,数据传输效率提升达 35% 。同时,其 Infinity Fabric 互连技术确保了 CPU、GPU 和 NPU 之间的高效协作。

以上参考数据来源:ITBEAR 科技资讯

AI Studio Pro 主要通过 Type-C(USB4.0)接口进行数据传输,支持 40Gbps 的传输速率 。虽然相比前两款产品的专用互连技术显得简单,但对于边缘 AI 应用和原型开发来说已经足够。

以上参考数据来源:智慧科技-IT 新闻]

四. 大模型训练能力深度分析

三款产品在 支持的最大模型规模、主流模型训练性能、混合精度训练与模型并行支持、实际用户案例分析 等纬度对比展现出了不同的能力边界:

image.png

1. 支持的最大模型规模

三款产品在支持的最大模型规模方面展现出了不同的能力边界。

DGX Spark 凭借其 128GB 统一内存,在单机模式下可支持高达 2000 亿参数的 AI 大模型推理,或 700 亿参数的模型微调 。通过双机互连(使用 ConnectX-7 网卡),总内存扩展到 256GB,可支持高达 4050 亿参数的模型(FP4 精度)。这种扩展能力使其能够处理接近目前最大开源模型规模的 AI 工作负载。

以上参考数据来源:DLEADTEK]

AMD Strix Halo 的表现同样令人印象深刻。在 128GB 内存配置下,可支持运行高达 1280 亿参数的模型 。更重要的是,它是全球首款支持运行 700 亿参数模型的 AI PC 处理器 。通过 AMD Variable Graphics Memory 技术,可以分配最多 96GB 作为专用显存,这对于运行大型模型特别是 MoE(Mixture of Experts)专家模型具有独特优势 。在多机扩展方面,Strix Halo 支持双机、四机甚至六机并联,最多可提供 768GB 总内存和 576GB 总专用显存。

以上参考数据来源:腾讯新闻-驱动之家

AI Studio Pro 虽然在绝对算力上不及前两款产品,但凭借其 192GB 的最大内存配置,在处理某些特定类型的 AI 任务时仍有其独特价值。根据华为昇腾 310 的技术规格推算,AI Studio Pro 理论上可支持数百亿参数规模的模型,但具体上限还需要更多实际测试数据来验证。

2. 主流模型训练性能

在实际模型训练性能方面,三款产品展现出了各自的特点。

DGX Spark 在模型训练方面表现出色。在 Llama 3.2 2B 模型的全量微调中,达到了峰值 82,739.2 tokens/s 的处理速度;在 Llama 3.1 8B 模型使用 LoRA(Low-Rank Adaptation)微调时,峰值速度为 53,657 tokens/s。这些数据表明,DGX Spark 在处理中等规模模型的微调任务时具有很高的效率。某自动驾驶初创公司的测试显示,使用 DGX Spark 训练的视觉 Transformer 模型,精度较单 GPU 训练提升 12%,而训练时间从 56 小时缩短至 7 小时 ,这种效率提升直接将算法迭代周期从周级压缩至日级。

以上参考数据来源:七号智算]

AMD Strix Halo 在模型推理方面表现尤为突出。在 MLPerf Client v1.0 测试中,其集成显卡达到了高达 61 tokens/s 的性能。更重要的是,Strix Halo 是全球首款能够运行 OpenAI 的 GPT-OSS 120B 参数模型的消费级 AI PC 处理器。在实际应用中,它能够运行 Meta 的 Llama 4 Scout 109B 模型(17B 激活参数),并支持完整的视觉和 MCP(Multi-Channel Processing)功能 。在 DeepSeek 70B 本地模型推理测试中,速度达到 10 tokens/s。

以上参考数据来源:neowin.net]

AI Studio Pro 主要面向边缘 AI 应用,在大模型训练方面的表现相对有限。根据华为官方数据,基于 MindYolo 框架在 AI Studio Pro 上训练 YOLOv8 模型时,使用 16 的 batch size,训练 10 个 epoch 可以完成模型训练和验证 。虽然无法处理超大规模的语言模型,但在计算机视觉等边缘 AI 应用中表现良好。

以上参考数据来源:华为云

3. 混合精度训练与模型并行支持

混合精度训练和模型并行技术是训练大模型的关键技术。

DGX Spark 全面支持混合精度训练技术。利用 Blackwell GPU 的第五代 Tensor Core,可以使用 FP16 进行计算,同时使用 FP32 存储参数和梯度 。通过 PyTorch 的 autocast 和 GradScaler API,可以轻松实现混合精度训练流程。在模型并行方面,DGX Spark 支持张量并行(Tensor Parallelism)和流水线并行(Pipeline Parallelism)两种模式 。开发者可以使用 torch.distributed.rpc 实现自定义的模型并行策略,将大型模型分布到多个计算单元上进行训练 。

以上参考数据来源:51CCTO

AMD Strix Halo 同样支持混合精度训练。通过 ROCm 平台,可以使用 FP16 数据类型代替部分或全部标准单精度浮点数(FP32),在减少内存占用的同时加快前向传播和反向传播的速度 。在分布式训练方面,ROCm 支持分布式数据并行(DDP),多个进程可以各自拥有模型的副本,在正向传播时并行处理不同的 batch 数据 。此外,Strix Halo 还支持使用 LoRA 等参数高效微调技术,进一步降低了大模型训练的资源需求。

以上参考数据来源:AMD 官网]

AI Studio Pro 基于昇腾 310 处理器,全面支持华为的混合精度训练技术。昇腾芯片的达芬奇架构天然支持混合精度计算,可以根据不同的计算需求自动选择最合适的精度。在模型并行方面,AI Studio Pro 通过双处理器设计提供了基本的并行能力,但不支持复杂的分布式训练架构。用户主要通过 MindSpore 框架的自动并行功能来实现模型的并行训练。

4. 实际用户案例分析

了解这些产品在实际项目中的应用情况对评估其价值至关重要。

DGX Spark 的首批用户包括了众多知名企业和机构。SpaceX 是最引人注目的用户之一,黄仁勋亲自向埃隆·马斯克交付了首批 DGX Spark。在 SpaceX 的应用中,DGX Spark 主要用于星舰的设计仿真、AI 模型训练(包括自动驾驶、图像识别和语音识别)以及海量遥测数据处理 。其他重要用户还包括 Anaconda、Cadence、ComfyUI、Docker、谷歌、Hugging Face、JetBrains、LM Studio、Meta、微软、Ollama 和 Roboflow 等。在学术界,纽约大学全球 AI 前沿实验室已经开始使用 DGX Spark 加速其 AI 研发工作,该实验室的 Kyunghyun Cho 教授表示:"DGX Spark 让我们能够通过台式机访问千兆级计算能力,这种 AI 研发的新方式使我们能够快速进行原型设计并实验先进的 AI 算法和模型"。

以上参考数据来源:搜狐

AMD Strix Halo 已经在多个领域得到应用。在 AIGC 创作领域,用户可以实现"实时 AI 修图",导入 100 张模糊人像,5 秒内就能完成降噪、瘦脸、优化光影;在视频剪辑中,AI 自动生成字幕的速度比传统 CPU 快 3 倍,还能实时去除视频背景杂音 。在六联智能的 STHT1 主板产品中,Strix Halo 融合 16 核 CPU、40 核 GPU 以及 50TOPS 算力的 NPU,为高端轻薄设备提供了完整的 AI 解决方案,特别适合实时语音识别、图像生成等场景。在金融领域,Strix Halo 被用于开发信用评分模型和加密货币价格预测工具 。

以上参考数据来源:HP 官网

AI Studio Pro 的应用场景主要集中在边缘 AI 领域。其典型应用包括 OCR 识别、目标识别、人脸识别、搜索推荐、大模型多模态处理、内容审核、VR 智能、数字医疗和物联网等 。在 2024 源创会盛典上,香橙派现场演示了 AI Studio 搭载大模型的应用案例,包括内容生成、聊天机器人、智能助手等方向 。特别值得一提的是,AI Studio Pro 深度适配了 DeepSeek-R1 蒸馏模型,支持本地离线部署,这对于需要数据隐私保护的应用场景具有重要意义 。

以上参考数据来源:官方资料 ORANGE PI

五. 推理能力综合评估

三款产品在 推理延迟与吞吐量、模型优化与推理框架支持、多模态推理能力、实时推理能力 等纬度对比展现出了不同的能力表现:

image.png

1. 推理延迟与吞吐量

推理性能是评估 AI 硬件的关键指标,直接影响用户体验:

根据独立测试者的对比评测,DGX Spark 和 AMD Strix Halo 在推理性能上各有千秋。在推理输出表现(每秒生成 token 数)方面,两者互有胜负,差距通常在个位数,可谓旗鼓相当 。然而,在 TTFT(Time to First Token,输出第一个 token 的时间)指标上,AMD Strix Halo 取得了三胜一负的成绩,领先幅度相当大 。这意味着 Strix Halo 在响应速度上具有明显优势,这对于实时交互场景至关重要。

具体到不同模型的推理速度,DGX Spark 在 Llama 3.3 70B 模型测试中,推理速度为 4.67 tokens/s;在 GPT-OSS 20B 模型测试中,推理速度为 60.33 tokens/s;在 Qwen3 Coder 30B 模型测试中,推理速度为 38.03 tokens/s。这些数据表明,DGX Spark 在处理不同规模模型时表现稳定,能够满足大部分 AI 推理需求。

以上参考数据来源:新浪财经

AMD Strix Halo 在推理性能上表现突出。其集成显卡在 MLPerf Client v1.0 测试中达到了高达 61 tokens/s 的性能。在 DeepSeek 70B 本地模型推理测试中,速度达到 10 tokens/s。更重要的是,Strix Halo 是全球首款能够运行 OpenAI 的 GPT-OSS 120B 参数模型的消费级 AI PC 处理器,这充分证明了其强大的推理能力。

AI Studio Pro 在推理方面的表现主要体现在边缘 AI 应用中。根据华为官方数据,基于 MindYolo 框架在 AI Studio Pro 上进行 YOLOv8 模型推理时,能够达到实时处理的性能要求 。虽然具体的延迟和吞吐量数据有限,但考虑到其 352 TOPS 的总算力和专门的 NPU 设计,在边缘推理场景中应该有不错的表现。

以上参考数据来源:华为云

2. 模型优化与推理框架支持

模型优化技术对于提升推理性能至关重要:

DGX Spark 支持多种模型优化技术。首先是 FP4 量化,这是其最大的技术亮点之一。通过 FP4 格式,内存占用可以缩小约 3-3.5 倍(相比 FP16)或 1.8 倍(相比 FP8)。NVIDIA 声称,通过特殊的量化优化,FP4 格式的模型精度损失通常低于 1%,接近 FP8 的质量。例如,Llama 3.1 8B 模型在 NVFP4 格式下能达到 39 tokens/s,而使用其他量化格式时约为 23 tokens/s。其次,DGX Spark 支持推测解码(Speculative Decoding)技术,通过使用小型快速模型预测并让大型模型验证的方式来加速文本生成,可将端到端吞吐量提高高达 2 倍。

AMD Strix Halo 同样支持多种优化技术。通过 ROCm 平台,可以使用混合精度推理,根据任务需求调整数值精度,在速度和准确性之间取得平衡 。Strix Halo 还支持多种量化格式,包括 GGUF,使其能够灵活地适用于不同场景 。在驱动程序层面,AMD 不断优化对大模型的支持,其最新的 Adrenalin Edition 25.8.1 驱动程序引入了对 128B 参数 LLM 模型的支持 。

以上参考数据来源:今日头条

AI Studio Pro 基于昇腾 AI 技术,支持华为自研的多种优化技术。昇腾芯片的达芬奇架构天然支持混合精度计算,可以根据不同的计算需求自动选择最合适的精度。AI Studio Pro 还深度集成了华为的推理优化工具,包括 MindSpore Lite 和 AscendCL 等。特别值得一提的是,该产品深度适配了 DeepSeek-R1 蒸馏模型,通过在边缘进行离线部署,帮助用户实现高效端侧智能,确保数据处理的安全性和可控性 。

以上参考数据来源:芯语

3. 多模态推理能力

多模态 AI 是当前的发展趋势,三款产品在这方面各有特色:

DGX Spark 凭借其强大的 GPU 和统一内存架构,在多模态推理方面表现出色。其集成的第四代 RT Core 提供了硬件级的光线追踪加速,这对于处理 3D 视觉内容非常重要。同时,第五代 NVDEC 和第九代 NVENC 编解码引擎支持多种视频格式的硬件加速,使其能够高效处理视频流数据。在实际应用中,DGX Spark 可以同时运行文本、图像、视频等多种模态的 AI 模型,特别适合开发多模态 AI 应用。

AMD Strix Halo 在多模态处理方面具有独特优势。其集成的 XDNA 2 NPU 专门针对 AI 工作负载优化,在处理视觉和语言融合任务时表现出色。在实际测试中,Strix Halo 在 IBM Granite Vision 3.2 3b 模型上的性能比竞争对手快 7 倍,在 Google Gemma 3 4b 模型上快 4.6 倍,在 Google Gemma 3 12b 模型上快 6 倍。更重要的是,配备 64GB 内存的 ASUS ROG Flow Z13 可以轻松运行 Google Gemma 3 27B Vision 模型,这是目前最先进的视觉语言模型之一。

AI Studio Pro 基于昇腾 AI 技术,在多模态处理方面也有不错的表现。其集成的 DVPP(数字视觉预处理模块)能够高效处理图像和视频数据,为多模态 AI 应用提供了硬件基础。根据产品介绍,AI Studio Pro 可以广泛应用于大模型多模态处理场景 ,虽然具体性能数据有限,但考虑到其专门的硬件设计,在处理视觉相关的 AI 任务时应该有良好表现。

以上参考数据来源:官方资料

4. 实时推理能力

实时性是许多 AI 应用的关键需求:

DGX Spark 在实时推理方面表现优秀。根据测试数据,在运行 Llama 3.3 70B 模型时,虽然绝对速度只有 4.67 tokens/s,但考虑到模型规模,这样的性能已经相当出色。更重要的是,通过 FP4 量化和推测解码等优化技术,可以显著提升实际应用中的响应速度。在处理较小规模的模型时,DGX Spark 能够轻松达到实时处理的要求。

AMD Strix Halo 在实时推理方面具有明显优势。其低延迟设计使其特别适合实时应用场景。在实际应用中,用户可以实现"实时 AI 修图",导入 100 张模糊人像,5 秒内就能完成降噪、瘦脸、优化光影;在视频剪辑中,AI 自动生成字幕的速度比传统 CPU 快 3 倍,还能实时去除视频背景杂音 。这些应用都对实时性有很高要求,Strix Halo 的表现证明了其在这方面的优势。

以上参考数据来源:今日头条

AI Studio Pro 虽然在绝对性能上不及前两款产品,但在边缘 AI 实时推理场景中表现良好。根据华为官方提供的 YOLOv8 模型训练和推理案例,AI Studio Pro 能够实现实时的目标检测和识别 。考虑到其主要面向边缘应用,这样的性能已经能够满足大部分实时推理需求。

以上参考数据来源:华为云

六. 场景应用分析

三款产品在 企业级 AI 研发、科研与教育、边缘 AI 部署、创意内容生成、行业定制应用 等纬度对比展现出了不同的能力表现各有千秋:

image.png

1. 企业级 AI 研发

对于大型企业的 AI 研发中心,三款产品各有定位:

DGX Spark 定位为"AI Lab in a Box"或开发者平台,特别适合需要在本地进行大模型开发和微调的场景。其 128GB 统一内存使其能够运行和微调大规模模型,避免了昂贵的云 GPU 租赁费用。对于需要频繁迭代的 AI 项目,DGX Spark 提供了理想的开发环境。例如,某自动驾驶初创公司使用 DGX Spark 后,将算法迭代周期从周级压缩至日级 。此外,DGX Spark 预装了完整的 NVIDIA AI 软件栈,包括 CUDA、cuDNN、TensorRT 等,开发者可以开箱即用地开始工作。

以上参考数据来源:七号智算

AMD Strix Halo 凭借其 x86 架构和 Windows 系统的天然优势,在企业兼容性方面具有明显优势。它不仅是一个 AI 开发平台,同时也是一台性能强大的工作站,可以"一机多用"。在实际应用中,Strix Halo 已经被用于金融机构的信用评分模型开发和加密货币价格预测 。其相对较低的价格(普遍 1.5 万元甚至更低)使其特别适合预算有限的中小企业。

以上参考数据来源:HP]

AI Studio Pro 主要面向边缘 AI 研发和原型开发。其训推一体的设计使其特别适合需要在边缘部署 AI 应用的企业。例如,在智能制造场景中,AI Studio Pro 可以用于开发和部署生产线检测系统;在智慧零售中,可以用于开发实时客流分析和商品识别系统。

2. 科研与教育

在科研和教育领域,三款产品都有其独特价值:

DGX Spark 在学术界已经获得广泛认可。纽约大学全球 AI 前沿实验室已经开始使用 DGX Spark 加速其 AI 研发工作。该实验室的 Kyunghyun Cho 教授评价道:"DGX Spark 让我们能够通过台式机访问千兆级计算能力,这种 AI 研发的新方式使我们能够快速进行原型设计并实验先进的 AI 算法和模型,甚至包括像医疗保健这类对隐私和安全性要求极高的应用领域"。在教育方面,高校可以配置 DGX Spark 集群建立 AI 教学平台,学生通过 Jupyter Notebook 直接调用 Blackwell GPU 资源;在机器人课程实践中,工程学院可以将 DGX Spark 连接到机器人教学套件,学生可在真实硬件上测试自主导航算法。

AMD Strix Halo 在科研教育领域同样表现出色。其强大的 CPU 性能和集成显卡使其特别适合需要进行复杂计算和图形渲染的科研项目。在 AI 教育方面,Strix Halo 的低功耗设计使其特别适合笔记本电脑形态,可以让学生在任何地方进行 AI 学习和实践。

AI Studio Pro 在科研教育中的应用主要集中在边缘 AI 研究和嵌入式 AI 教学。其开源特性和相对较低的价格使其特别适合学生和研究人员进行实验和探索。

3. 边缘 AI 部署

边缘 AI 是 AI 应用的重要发展方向,三款产品在这方面各有特色:

DGX Spark 虽然性能强大,但由于其较高的功耗(额定 240W),不太适合传统的边缘部署场景。然而,其紧凑的尺寸(150mm×150mm×50.5mm)和强大的性能使其在一些特殊的边缘场景中仍有应用价值,例如需要处理大量数据的边缘数据中心。

AMD Strix Halo 在边缘 AI 部署方面具有独特优势。其功耗范围为 45-120W,可以根据需求灵活调节,特别适合移动和边缘场景。在实际应用中,Strix Halo 已经被用于开发实时语音识别、图像生成等边缘 AI 应用。其低待机功耗(5W)使其特别适合需要长时间运行的边缘设备。

AI Studio Pro 是专门为边缘 AI 设计的产品。其典型应用包括 OCR 识别、目标识别、人脸识别、搜索推荐、大模型多模态处理、内容审核、VR 智能、数字医疗和物联网等 。特别是其深度适配 DeepSeek-R1 蒸馏模型,支持本地离线部署,这对于需要数据隐私保护的边缘应用具有重要意义 。其双风扇散热设计确保了在长时间高负载运行时的稳定性,特别适合需要 24/7 运行的边缘 AI 系统。

以上参考数据来源:官方资料

4. 创意内容生成

在 AIGC(AI Generated Content)领域,三款产品都有出色表现:

DGX Spark 凭借其强大的 GPU 和大内存,特别适合运行大型的 AIGC 模型。例如,在使用 Comfy UI 进行图像生成时,虽然其原始性能(约 1 迭代/秒)远低于双 RTX 4090(约 11 迭代/秒),但其 128GB 内存使其能够运行更大的模型,从而获得更高质量的生成结果。在实际应用中,DGX Spark 可以同时运行多个不同的 AIGC 模型,支持复杂的多步骤工作流程。

AMD Strix Halo 在 AIGC 创作中表现尤为出色。用户反馈显示,使用 Strix Halo 可以实现"实时 AI 修图",导入 100 张模糊人像,5 秒内就能完成降噪、瘦脸、优化光影;在视频剪辑中,AI 自动生成字幕的速度比传统 CPU 快 3 倍,还能实时去除视频背景杂音 。这种实时处理能力极大提升了创作效率。

以上参考数据来源:今日头条

AI Studio Pro 在 AIGC 领域的应用主要集中在边缘创作场景。例如,在 2024 源创会盛典上,香橙派现场演示了 AI Studio 搭载大模型的内容生成、聊天机器人、智能助手等应用 。虽然其绝对性能不及前两款产品,但其训推一体的设计和相对较低的成本使其特别适合个人创作者和小型工作室。

以上参考数据来源:官方资料

5. 行业定制应用

不同行业对 AI 硬件有不同的需求,三款产品在行业应用方面各有优势:

  • 在航天航空领域,SpaceX 已经开始使用 DGX Spark 进行星舰的设计仿真、AI 模型训练和遥测数据处理 。DGX Spark 的强大计算能力和低延迟特性使其能够处理复杂的物理仿真和实时数据分析。
  • 在金融服务领域,AMD Strix Halo 被用于开发信用评分模型和加密货币价格预测工具 。其 x86 架构和 Windows 系统的兼容性使其能够无缝集成到现有的金融 IT 系统中。
  • 在智能制造领域,AI Studio Pro 被用于开发生产线检测系统和质量控制系统。其边缘部署能力和低功耗特性使其特别适合工业环境。
  • 在医疗健康领域,三款产品都有应用潜力。DGX Spark 的大内存使其能够处理大型医学影像数据;Strix Halo 的多模态处理能力适合开发医疗诊断 AI;AI Studio Pro 的边缘部署能力使其能够在医院的各个科室部署 AI 应用。

七. 实际应用性能测试结果

三款产品在 基准测试数据、大模型推理性能对比、训练性能实测、功耗与温度测试、多设备扩展性能 等纬度对比展现出了不同的能力表现较大差异。

1. 基准测试数据

根据多方测试数据,我们可以对三款产品的实际性能有更清晰的认识。

DGX Spark 基准测试结果存在较大争议。根据 John Carmack 等独立测试者的报告,DGX Spark 的实际性能远低于官方宣传值:

  • BF16 工作负载:约 60 TFLOPS(官方无明确数据) [以上参考数据来源:新浪科技]
  • FP4 工作负载:约 480 TFLOPS(官方宣传 1000 TOPS)
    [以上参考数据来源:新浪科技]
  • FP16 稠密模式:约 125 TFLOPS(非官方数据)
  • [以上参考数据来源:中文网]
  • 功耗:实际最高约 100W(官方额定 240W)
    以上参考数据来源:OC3D.NET]

这些数据表明,DGX Spark 的实际性能仅达到官方宣传值的 50-60% 左右,主要原因是官方的 FP4 性能基于稀疏计算,而实际应用中很难达到理论峰值。

AMD Strix Halo 基准测试结果相对更加务实:

  • CPU 性能:Cinebench R23 多核 31,485 分
    [以上参考数据来源:抖音]
  • GPU 性能:3DMark Time Spy 测试接近 RTX 4060 笔记本电脑显卡
    [以上参考数据来源:什么值得买]
  • NPU 性能:50 TOPS(INT8)
    [以上参考数据来源:notebookcheck]
  • 功耗:45-120W(可动态调节)
    [以上参考数据来源:IT 之家]

AI Studio Pro 基准测试结果基于昇腾 310 处理器:

  • 总算力:352 TOPS(INT8)或 176 TFLOPS(FP16)
    [以上参考数据来源:华为云]
  • 单芯片算力:16 TFLOPS(FP16),22 TOPS(INT8)
    [以上参考数据来源:博睿谷]
  • 功耗:240W(DC 12V/20A 输入)
    [以上参考数据来源:智慧科技]

2. 大模型推理性能对比

在大模型推理性能方面,根据独立测试者 Bijan Bowen 的对比评测 ,我们可以看到:

模型推理速度对比(单位:tokens/s)

image.png

在推理输出表现上,两者互有胜负,差距通常在个位数。但在 TTFT(输出第一个 token 的时间)指标上,AMD Strix Halo 取得了三胜一负的成绩,领先幅度相当大 。

[参考数据来源:新浪财经]

其他重要推理性能数据:

  • AMD Strix Halo 在 MLPerf Client v1.0 测试中达到 61 tokens/s
  • AMD Strix Halo 运行 DeepSeek 70B 本地模型推理速度为 10 tokens/s
  • AMD Strix Halo 是全球首款运行 OpenAI GPT-OSS 120B 参数模型的消费级处理器

3. 训练性能实测

在模型训练性能方面,我们有以下实测数据:

DGX Spark 训练性能:

  • Llama 3.2 2B 全量微调:峰值 82,739.2 tokens/s
  • Llama 3.1 8B 使用 LoRA 微调:峰值 53,657 tokens/s
  • 视觉 Transformer 模型训练:精度提升 12%,时间从 56 小时缩短至 7 小时
    [以上参考数据来源:七号智算]

AMD Strix Halo 训练相关数据:

  • 虽然具体训练速度数据有限,但 Strix Halo 支持从 1B 到 128B 参数模型的训练和推理
    [以上参考数据来源:搜狐]
  • 支持 LoRA 等参数高效微调技术,降低训练资源需求

AI Studio Pro 训练性能:

  • 基于 MindYolo 训练 YOLOv8:batch size 16,10 个 epoch 完成训练
    [参考数据来源:华为云]
  • 主要面向边缘 AI 应用,适合中小型模型训练

4. 功耗与温度测试

功耗和温度是影响系统稳定性和能效的重要因素。

DGX Spark 功耗测试结果:

  • 额定功耗:240W
    [以上参考数据来源:OC3D.NET]
  • 实际最高功耗:约 100W(不到额定值的一半)
    [以上参考数据来源:OC3D.NET]
  • 待机功耗:44-45W
    [以上参考数据来源:什么值得买]
  • 运行 Llama3-70B 推理时的功耗和温度:未提供具体数据

AMD Strix Halo 功耗测试结果:

  • 功耗范围:45-120W(可动态调节)
  • [以上参考数据来源:IT 之家]
  • 80W 功耗释放时核心平均温度:90℃
    [以上参考数据来源:快科技]
  • 待机功耗:低至 5W(不到桌面版锐龙 9 9950X 的 1/5)
    [以上参考数据来源:快科技]
  • 最低功耗模式(7-8W)续航时间:6-7 小时
    [以上参考数据来源:抖音]

AI Studio Pro 功耗数据:

  • 标准功耗:240W(DC 12V/20A 输入)
    [以上参考数据来源:智慧科技]
  • 散热设计:双风扇,确保长时间高负载稳定运行

5. 多设备扩展性能

在多设备协作方面,我们有以下测试数据:

DGX Spark 扩展性能:

  • 双机互连:总内存 256GB,支持 4050 亿参数模型(FP4 精度)
  • 互连技术:ConnectX-7 200Gb/s 网卡,支持 RDMA
  • 多机集群:可通过交换机扩展至 6 个或更多系统

AMD Strix Halo 扩展能力:

  • 支持双机、四机、六机并联
  • 六机并联总配置:768GB 总内存,576GB 总专用显存
  • 互连方式:通过标准网络连接(具体性能未提供)

AI Studio Pro 扩展能力:

  • 主要通过 Type-C(USB4.0)接口连接,支持 40Gbps 传输
  • 多设备协作能力:有限,主要用于单机或简单双机协作
  • 集群支持:未提供相关数据

小结

展望未来,这三款产品都有值得期待的发展,代表了 AI 硬件的发展方向,各有特色和优势:

  • DGX Spark 官方定位为高端的"AI Lab in a Box",主要面向专业的 AI 开发者和研究机构。其最大优势在于 128GB 统一内存和理论上的强大算力,能够处理大规模的 AI 模型。然而,实际性能与宣传存在较大差距,需要用户有清醒的认识。
  • AMD Strix Halo 定位为全能型的 AI PC 处理器,既可以作为高性能工作站,又可以作为 AI 开发平台。其 x86 架构和 Windows 系统的兼容性使其具有广泛的应用场景,相对较低的价格也使其更具性价比。
  • AI Studio Pro 定位为边缘 AI 解决方案,主要面向需要在边缘部署 AI 应用的场景。其训推一体的设计和对 DeepSeek 等模型的深度适配使其在特定领域具有独特价值。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论