本文摘要Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-flash-next实战本文来源: 小桥(公众号:小桥) 原文链接: https://mp.weixin.qq.com/s/TnajhXJDW5ux3RV0BZtxfQ 发布时间: 2026-09-05 21:07作者: 小桥 发布时间: 2026-09-05 21:07大家好,我是小桥,算法工程师,我写文章主要是记录我自己学...
Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-flash-next实战
本文来源: 小桥(公众号:小桥)
原文链接: https://mp.weixin.qq.com/s/TnajhXJDW5ux3RV0BZtxfQ
发布时间: 2026-09-05 21:07

作者: 小桥 发布时间: 2026-09-05 21:07
大家好,我是小桥,算法工程师,我写文章主要是记录我自己学习的过程,加深自己的理解,另外对自己也是一个督促。如果你对我的文章感兴趣,请关注我,后续会继续给大家介绍推广搜和大模型干货。
前几天我在我的Ryzen AI Max+ 395 128GB笔记本跑通了Qwen3.8-27B。Qwen3.8-flash-next在某些任务上效果会比27B的版本要好。所以我今天尝试跑下Qwen3.8-flash-next模型。

0 笔记本电脑参数

1 Qwen3.8-flash-next模型与Qwen3.8-27B对比
| 项目 | Qwen3.8-27B | Qwen3.8-Flash-Next |
|---|---|---|
| 模型类型 | Dense | MoE |
| 总参数 | 27B | 125B |
| Active Params | 27B | 约 6B |
| N-gram Embedding | ❌ | +51B |
| Expert | ❌ | 512 experts |
| 每 token 激活 Expert | — | 10 routed + 1 shared |
| Layer | 64 | 48 |
| Hidden Size | 5120 | 2560 |
| Attention | Gated DeltaNet + Attention | Gated DeltaNet + QSA |
| Gated Residual | 传统结构 | 4 branches |
| MTP | 1 layer | 1 layer |
| 原生上下文 | 262K | 262K |
| 最大扩展 | — | 1M |
| 多模态 | ✅ | ✅ |
| 定位 | 主力模型 | 下一代架构实验/高效率模型 |
| Qwen3.8-flash-next是Qwen4架构的预览版,采用了MoE架构,总参数量有125B,但每次只激活6B,比较适合共享显存这种架构。 |
2 测试问题
编程任务:实现一个线程安全的 TTL-LRU Cache
https://github.com/xiaoqiao64/qwen3.8_27b_cc/blob/main/task.md
3 各种方法实战对比
因此之前我在qwen3.8-27B测试发现还是ROCmFP4的版本速度比较快,所以我这里主要测相关的版本,其他量化版本并没有测试。
3.1 vulkan + mtp + ROCmFP4-FAST
3.1.1 编译llama.cpp
git clone https://github.com/LaurentZuijdwijk/llama.cpp
git checkout vulkan/qwen4exp-rocmfpx
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release -DLLAMA_BUILD_WEBUI=ON
cmake --build build --target llama-server llama-quantize llama-cli llama-bench -j$(nproc)3.1.2 下载模型
- 主模型:https://huggingface.co/agentionai/Qwen3.8-Flash-Next-ROCmFP4-FAST-imatrix-GGUF
- mtp模型:https://huggingface.co/agentionai/Qwen3.8-Flash-Next-MTP-ROCmFP4-FAST-GGUF
3.1.3 启动脚本
./llama-server \
-m ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-ROCmFP4-FAST-v2-ple16.gguf \
--spec-type draft-mtp \
--model-draft ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-MTP-ROCmFP4-FAST.gguf \
--spec-draft-ngl 99 \
--spec-draft-device Vulkan0 \
--spec-draft-n-max 4 --spec-draft-n-min 0 --spec-draft-p-min 0.0 \
-ngl 999 -fa on -dio --jinja -fit off \
--parallel 1 -dev Vulkan0 \
--reasoning-effort low \
-c 65536 --host 127.0.0.1 --port 88003.1.4 实测速度
- Prefill 1997 tokens 7.8s 256.03 tokens/s
- Decode: 7,495 tokens 4min 33s 27.40 t/s
- draft acceptance = 0.69454 ( 4909 accepted / 7068 generated), mean len = 3.78
3.2 vulkan + ROCmFP4-FAST
跟2.1的唯一区别就是不开mtp,编译llama.cpp和下载模型完全相同。
3.2.1 启动脚本
./llama-server \
-m ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-ROCmFP4-FAST-v2-ple16.gguf \
-ngl 999 -fa on -dio --jinja -fit off \
--parallel 1 -dev Vulkan0 \
--reasoning-effort low \
-c 65536 --host 127.0.0.1 --port 88003.2.2 实测速度
- Prefill:2001 tokens 7.3s 275.77 tokens/s
- Decode:7,045 tokens 4min 54s 23.95 t/s,略微慢一点,但整体任务其实还行
3.3 Uncensored ROCmFP4-FAST
Uncensored表示是解除限制版本,这个模型我没找到合适的mtp头,所以就是不带mtp的版本。
3.3.1 编译llama.cpp
git clone https://github.com/kingjones30/ROCmFPX.git
cd ROCmFPX
cmake -B build -DGGML_HIP=ON -DGPU_TARGETS=gfx1151 -DGGML_NATIVE=ON -DCMAKE_BUILD_TYPE=Release -DLLAMA_BUILD_WEBUI=ON
cmake --build build --target llama-server llama-quantize llama-cli llama-bench -j$(nproc)3.3.2 下载模型
https://huggingface.co/kingjones777/Qwen3.8-Flash-Next-Uncensored-ROCmFP4-FAST-GGUF
3.3.3 启动脚本
./llama-server \
-m ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-Uncensored-Q4_0-ROCmFP4-FAST-00001-of-00003.gguf \
-ngl 999 -fa on -dio --jinja -fit off \
--parallel 1 -dev ROCm0 \
--reasoning-budget 2048 \
-c 65536 --host 127.0.0.1 --port 8800这个llama.cpp没有--reasoning-effort参数,所以用--reasoning-budget 2048来限制,但其实不太能达到--reasoning-effort的效果,但也只能这样。
3.3.4 实测速度
- prefill: 2013 tokens 5.9s 343.75 tokens/s
- Decode: 17,303 tokens 17min 44s 16.25 t/s
比较慢,这个模型的主要价值应该是解禁版,可以问一些正常模型拒绝回答的问题,感觉能力应该有所缩减。
3.4 对比总结
| 方案 | 后端 | MTP | 模型 | Prefill | Decode | Draft 接受率 | Mean Len | 备注 |
|---|---|---|---|---|---|---|---|---|
| Vulkan + MTP + ROCmFP4-FAST | Vulkan | ✅ | ROCmFP4-FAST v2 | 256.03 t/s | 27.40 t/s | 69.45% | 3.78 | 综合表现最好 |
| Vulkan + ROCmFP4-FAST | Vulkan | ❌ | ROCmFP4-FAST v2 | 275.77 t/s | 23.95 t/s | — | — | Prefill 更快,但 Decode 慢约 12.6% |
| Uncensored ROCmFP4-FAST | ROCm/HIP | ❌ | Uncensored ROCmFP4-FAST | 343.75 t/s | 16.25 t/s | — | — | Prefill 最快,但 Decode 明显较慢 |
本文转载自微信公众号「小桥」,仅供学习交流使用。
觉得内容不错?我要