Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-flash-next实战

本文摘要Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-flash-next实战本文来源: 小桥(公众号:小桥) 原文链接: https://mp.weixin.qq.com/s/TnajhXJDW5ux3RV0BZtxfQ 发布时间: 2026-09-05 21:07作者: 小桥  发布时间: 2026-09-05 21:07大家好,我是小桥,算法工程师,我写文章主要是记录我自己学...

Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-flash-next实战

本文来源: 小桥(公众号:小桥)
原文链接: https://mp.weixin.qq.com/s/TnajhXJDW5ux3RV0BZtxfQ
发布时间: 2026-09-05 21:07

Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-flash-next实战

作者: 小桥  发布时间: 2026-09-05 21:07


大家好,我是小桥,算法工程师,我写文章主要是记录我自己学习的过程,加深自己的理解,另外对自己也是一个督促。如果你对我的文章感兴趣,请关注我,后续会继续给大家介绍推广搜和大模型干货。

前几天我在我的Ryzen AI Max+ 395 128GB笔记本跑通了Qwen3.8-27B。Qwen3.8-flash-next在某些任务上效果会比27B的版本要好。所以我今天尝试跑下Qwen3.8-flash-next模型。

0 笔记本电脑参数

1 Qwen3.8-flash-next模型与Qwen3.8-27B对比

项目Qwen3.8-27BQwen3.8-Flash-Next
模型类型DenseMoE
总参数27B125B
Active Params27B约 6B
N-gram Embedding+51B
Expert512 experts
每 token 激活 Expert10 routed + 1 shared
Layer6448
Hidden Size51202560
AttentionGated DeltaNet + AttentionGated DeltaNet + QSA
Gated Residual传统结构4 branches
MTP1 layer1 layer
原生上下文262K262K
最大扩展1M
多模态
定位主力模型下一代架构实验/高效率模型
Qwen3.8-flash-next是Qwen4架构的预览版,采用了MoE架构,总参数量有125B,但每次只激活6B,比较适合共享显存这种架构。

2 测试问题

编程任务:实现一个线程安全的 TTL-LRU Cache

https://github.com/xiaoqiao64/qwen3.8_27b_cc/blob/main/task.md

3 各种方法实战对比

因此之前我在qwen3.8-27B测试发现还是ROCmFP4的版本速度比较快,所以我这里主要测相关的版本,其他量化版本并没有测试。

3.1 vulkan + mtp + ROCmFP4-FAST

3.1.1 编译llama.cpp

git clone https://github.com/LaurentZuijdwijk/llama.cpp
git checkout vulkan/qwen4exp-rocmfpx      
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release -DLLAMA_BUILD_WEBUI=ON
cmake --build build --target llama-server llama-quantize llama-cli llama-bench -j$(nproc)

3.1.2 下载模型

3.1.3 启动脚本

./llama-server   \
    -m ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-ROCmFP4-FAST-v2-ple16.gguf   \
    --spec-type draft-mtp   \
    --model-draft ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-MTP-ROCmFP4-FAST.gguf   \
    --spec-draft-ngl 99 \
    --spec-draft-device Vulkan0   \
    --spec-draft-n-max 4 --spec-draft-n-min 0 --spec-draft-p-min 0.0 \
    -ngl 999 -fa on -dio --jinja -fit off \
    --parallel 1 -dev Vulkan0   \
    --reasoning-effort low \
    -c 65536 --host 127.0.0.1 --port 8800

3.1.4 实测速度

  • Prefill 1997 tokens 7.8s 256.03 tokens/s
  • Decode: 7,495 tokens 4min 33s 27.40 t/s
  • draft acceptance = 0.69454 ( 4909 accepted /  7068 generated), mean len =  3.78

3.2 vulkan + ROCmFP4-FAST

跟2.1的唯一区别就是不开mtp,编译llama.cpp和下载模型完全相同。

3.2.1 启动脚本

./llama-server   \
    -m ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-ROCmFP4-FAST-v2-ple16.gguf   \
    -ngl 999 -fa on -dio --jinja -fit off \
    --parallel 1 -dev Vulkan0   \
    --reasoning-effort low \
    -c 65536 --host 127.0.0.1 --port 8800

3.2.2 实测速度

  • Prefill:2001 tokens 7.3s 275.77 tokens/s
  • Decode:7,045 tokens 4min 54s 23.95 t/s,略微慢一点,但整体任务其实还行

3.3 Uncensored ROCmFP4-FAST

Uncensored表示是解除限制版本,这个模型我没找到合适的mtp头,所以就是不带mtp的版本。

3.3.1 编译llama.cpp

git clone https://github.com/kingjones30/ROCmFPX.git
cd ROCmFPX
cmake -B build -DGGML_HIP=ON -DGPU_TARGETS=gfx1151 -DGGML_NATIVE=ON -DCMAKE_BUILD_TYPE=Release -DLLAMA_BUILD_WEBUI=ON
cmake --build build --target llama-server llama-quantize llama-cli llama-bench -j$(nproc)

3.3.2 下载模型

https://huggingface.co/kingjones777/Qwen3.8-Flash-Next-Uncensored-ROCmFP4-FAST-GGUF

3.3.3 启动脚本

./llama-server   \
    -m ~/models/gguf/qwen3.8/Qwen3.8-Flash-Next-Uncensored-Q4_0-ROCmFP4-FAST-00001-of-00003.gguf   \
    -ngl 999 -fa on -dio --jinja -fit off \
    --parallel 1 -dev ROCm0   \
    --reasoning-budget 2048 \
    -c 65536 --host 127.0.0.1 --port 8800

这个llama.cpp没有--reasoning-effort参数,所以用--reasoning-budget 2048来限制,但其实不太能达到--reasoning-effort的效果,但也只能这样。

3.3.4 实测速度

  • prefill: 2013 tokens 5.9s 343.75 tokens/s
  • Decode: 17,303 tokens 17min 44s 16.25 t/s
    比较慢,这个模型的主要价值应该是解禁版,可以问一些正常模型拒绝回答的问题,感觉能力应该有所缩减。

3.4 对比总结

方案后端MTP模型PrefillDecodeDraft 接受率Mean Len备注
Vulkan + MTP + ROCmFP4-FASTVulkanROCmFP4-FAST v2256.03 t/s27.40 t/s69.45%3.78综合表现最好
Vulkan + ROCmFP4-FASTVulkanROCmFP4-FAST v2275.77 t/s23.95 t/sPrefill 更快,但 Decode 慢约 12.6%
Uncensored ROCmFP4-FASTROCm/HIPUncensored ROCmFP4-FAST343.75 t/s16.25 t/sPrefill 最快,但 Decode 明显较慢

本文转载自微信公众号「小桥」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论