Qwen3.8-Flash-Next 125B 本地部署实测:AMD Strix Halo 的极限挑战
本文来源: 玩开源(公众号:玩开源)
原文链接: https://mp.weixin.qq.com/s/vm_oSKJsK0Yhy-vb_R6ooA
发布时间: 2026-08-28 11:15

作者: 玩开源 发布时间: 2026-08-28 11:15

关联文章:Qwen3.8-Flash-Next 参数迷思:别被 176B 的数字骗了
Qwen3.8 Flash Next:125B MoE 架构的本地推理观察
Qwen3.8-27B:RTX PRO 6000四路262K
Qwen 团队刚刚发布的 Qwen3.8-Flash-Next 模型,以其 125B 总参数和 6B 活跃参数的 MoE(混合专家)架构迅速成为社区焦点。这款模型不仅引入了 Gated DeltaNet 和稀疏注意力机制(QSA),还包含一个庞大的 51B n-gram 嵌入表,使得 llama-bench 报告的总参数量高达 176.94B。
对于拥有 AMD Strix Halo(Ryzen AI Max+ 395)设备的开发者来说,这是一个极具诱惑力的测试场景。在 128GB 统一内存和 Fedora 44 系统环境下,该模型成功实现了本地部署,并展现出令人惊讶的实用性能。
技术构建:绕过上游限制的“野路子”
由于 llama.cpp 上游尚未合并对该架构的支持,开发者需要基于社区 PR #27742 进行构建。以下是关键的技术路径:

- 分支拉取
:从 ggml-org/llama.cpp 获取包含 Qwen4Exp 支持的 PR 分支。
- 关键补丁
:在 src/llama-context.cpp 的 graph_max_nodes() 函数中,手动添加 model.arch == LLM_ARCH_QWEN4EXP || 到架构列表中。这一步至关重要,否则在内存拟合探测阶段会触发 GGML_ASSERT(obj_new) failed 崩溃。
- 后端选择
:推荐使用 Vulkan (RADV) 而非 ROCm。实测显示,Vulkan 在当前 Qwen3.8 DeltaNet 家族模型上的表现更优,且该架构主要由 llama.cpp 已有的操作符组成,无需额外的 GPU 内核支持即可运行。
构建命令示例:
cmake -B build -G Ninja -DCMAKE_BUILD_TYPE=Release -DGGML_VULKAN=ON cmake --build build --target llama-server llama-bench 性能表现:100W 功耗下的“旗舰级”体验
使用 Unsloth 提供的 UD-IQ4_XS 量化版本(3分片 GGUF,磁盘占用 87 GiB),在 131k 上下文长度下,模型常驻内存约 91 GB,加载时间仅需 45 秒。

核心基准测试数据(llama-bench, fa=1):
| 测试项目 | 速度 (tokens/s) |
|---|---|
| Prompt Processing (pp512) | 390.3 |
| Prompt Processing (pp4096) | 357.5 |
| Text Generation (tg128) | 23.0 |
| Long Context (d16384) PP | ~310-318 |
23 t/s 的生成速度对于一个 125B 级别的模型而言,在 APU 平台上已具备极高的日常可用性。值得注意的是,该设备在全负载下功耗仅约 100W-120W,相比传统 GPU 方案,其能效比优势显著。
深度分析与局限性
尽管性能亮眼,但在实际部署中仍存在几个值得注意的技术细节:
- KV Cache 限制
:目前必须保持 KV cache 为 f16 精度。尝试量化 KV cache(如 q8_0)会导致断言失败或系统挂起,这是当前架构下的已知问题。
- 长上下文衰减
:随着上下文长度增加至 100k+,生成速度会明显下降至 12-15 t/s 左右。部分用户观察到 CPU 占用率异常升高(20-30%),这可能与 MoE 架构在统一内存下的调度策略有关,目前尚未有明确的优化方案。
- 量化精度影响
:由于活跃参数仅为 6B,模型对量化误差的敏感度较高。UD-IQ4_XS 虽能运行,但在复杂推理任务中,其“思考深度”可能不如同量级的 Qwen3.8-27B Q8 版本。部分开发者建议,若追求最佳智能表现,可考虑回退至 27B 密集模型,或等待 MTP(Multi-Token Prediction)支持的成熟。
- MTP 支持现状
:虽然模型本身包含 4B MTP 头,但当前的量化版本尚未完全集成该功能。预计未来更新将带来速度提升,目前仍处于“可用但未优化”阶段。
总结:Strix Halo 的新定位
Qwen3.8-Flash-Next 的成功本地部署,标志着 AMD Strix Halo 平台在 AI 推理领域的地位发生了质变。它证明了在有限功耗(~100W)和统一内存架构下,运行百亿级 MoE 模型不仅可行,而且具备实际生产力价值。
对于拥有 128GB 内存的 Strix Halo 用户而言,这不仅仅是一个玩具,而是一个可以替代云端 API 进行日常编码、Agent 编排的本地引擎。虽然长上下文下的性能瓶颈和量化精度问题仍需社区进一步挖掘(如 n-gram 嵌入表的 mmap 优化),但这无疑是本地大模型部署的一个里程碑时刻。
提示:在尝试部署前,请确保你的系统内核和 Vulkan 驱动保持最新,并预留足够的磁盘空间用于 GGUF 分片文件。
本文转载自微信公众号「玩开源」,仅供学习交流使用。
觉得内容不错?我要