AMD锐龙AI MAX+ 395实测:Qwen3.8-27B-MTP加速升级版部署(26)

本文摘要AMD锐龙AI MAX+ 395实测:Qwen3.8-27B-MTP加速升级版部署(26)本文来源: 虾搞代码(公众号:虾搞代码) 原文链接: https://mp.weixin.qq.com/s/n_syN7ssp0JYaCCPf2hnXw 发布时间: 2026-08-20 08:18作者: 虾搞代码  发布时间: 2026-08-20 08:18同一台 AMD 锐龙 AI MAX+ 395、同...

AMD锐龙AI MAX+ 395实测:Qwen3.8-27B-MTP加速升级版部署(26)

本文来源: 虾搞代码(公众号:虾搞代码)
原文链接: https://mp.weixin.qq.com/s/n_syN7ssp0JYaCCPf2hnXw
发布时间: 2026-08-20 08:18

AMD锐龙AI MAX+ 395实测:Qwen3.8-27B-MTP加速升级版部署(26)

作者: 虾搞代码  发布时间: 2026-08-20 08:18


同一台 AMD 锐龙 AI MAX+ 395、同一个 Qwen3.8-27B 家族,上一篇普速版记录约 7.02 t/s;AMD锐龙AI MAX+ 395实测:Qwen3.8-27B普速版部署(25)这次换成 MTP 头集成的 Q8_0 版本,前端截图出现 18.75 t/s,llama.cpp 日志在短输出阶段记录到 16.25 t/s。它没有把每个请求都变成 2 倍速,却确实把“等待感”压低了一大截。

先给结论:这次的优势,不只是模型更小

这次部署的是 Qwen3.8-27B-MTP-Q8_0.gguf,模型文件约 28G,使用 llama-b10472-bin-win-vulkan-x64。任务管理器显示 GPU 总内存约40/112GB,专用 GPU 内存约36.8/63.8GB,温度约47℃。

模型地址:https://modelscope.cn/models/Jackrong/Qwen3.8-27B-MTP-GGUF。本文只把页面提供的 MTP 特性作为版本说明,速度和内存结论均以本机截图、日志和当前配置为准。

速度有三组值得区分的数字:

  • 前端一次短请求显示 216 tokens、11 秒、18.75 t/s;
  • llama.cpp 日志另一段生成从 

16.25 t/s

 起步,随着输出变长逐步回落到约 12 t/s;

  • 同一日志中,约 21.8K tokens 的长上下文 prompt eval 为 

150.16 t/s

,生成 110 tokens 的 eval 为 

16.33 t/s

上一篇 AMD锐龙AI MAX+ 395实测:Qwen3.8-27B普速版部署(25)在相近平台上记录约

7.02 t/s

。因此可以说:本次 MTP 版的短输出峰值约为普速版的 2 倍以上,稳定生成区间也明显更高;但不能把 18.75 t/s 当成所有任务的固定速度,实际的只大概在14上下。

三张截图,分别说明了什么

前端截图显示 216 tokens、11 秒、18.75 t/s。这类短请求容易受到首 token、界面统计窗口和输出长度影响,更适合说明“响应可以很快”,不适合单独代表长任务吞吐。

任务管理器显示:GPU 总内存40/112GB,专用 GPU 内存36.8/63.8GB,共享 GPU 内存2.8/47.6GB,温度47℃。相比上一篇约 66GB 的运行时占用,这个 MTP-Q8_0 版本给上下文、桌面应用和工具调用留下了更大余量。

日志里最关键的一段是:n_gen = 103, tg = 16.25 t/s,随后另一请求在生成 100—1205 tokens 的过程中,速度大致从 16—17 t/s 逐步回落到约 12 t/s。长上下文、历史消息和输出长度都会改变最终体感。

完整启动命令

llama-b10472-bin-win-vulkan-x64\llama-server.exe 
-m "D:\ChatGPT\llama.cpp.demo\models\MTP\Qwen3.8-27B-MTP-Q8_0.gguf" 
-c 262144 -b 2048 -ub 1024 --flash-attn on  --host 0.0.0.0  
--port 88 --temp 1.0 --repeat-penalty 1.05 --top-p 0.95 
--top-k 64 --n-gpu-layers 999 --no-mmap -np 1  
--cache-type-k q4_0 --cache-type-v q4_0 --ui-mcp-proxy 
--reasoning-preserve --spec-draft-n-max 3 
--spec-type draft-mtp  --timeout 600000

MTP 集成版和单独草稿模型有什么不同?

这次版本的关键卖点,是把 MTP(多 token 预测)头直接放进主模型,不需要再指定一个独立 draft model,比上一篇的预测准确率要高,所以速度提升明显。服务端仍通过:

--spec-draft-n-max 3 --spec-type draft-mtp

启用推测解码路径。模型先提出多个候选 token,再由主模型验证;候选被接受得越多,主模型逐 token 等待就越少。日志中的 draft acceptance = 0.74510,表示 102 个候选中接受了 76 个,平均草稿长度约 3.24。这是本次加速有依据的证据,但不是“固定加速倍数”。

模型说明建议 max draft = 2,而本次命令使用 --spec-draft-n-max 3。这两者并不矛盾:前者是模型方推荐起点,后者是本机实测配置。若要寻找最佳值,建议固定同一提示词,分别测试 2 和 3,记录接受率、decode、总耗时和输出稳定性。

与上一篇普速版放在一起看

项目Qwen3.8-27B 普速版Qwen3.8-27B MTP加速版
量化/文件UD-Q8_K_XL,约 30GMTP-Q8_0,约 28G
llama.cppb10358 Vulkanb10472 Vulkan
前端/日志速度约 7.02 t/s14+ t/s
GPU 总内存约 66/112GB约 40/112GB
专用 GPU 内存约 62.4/63.8GB约 36.8/63.8GB
温度约 54℃约 54℃
cache--cache-type-k q8_0 --cache-type-v q8_0--cache-type-k q4_0 --cache-type-v q4_0
独立草稿模型无需额外草稿模型无需额外草稿模型

这张表能说明三件事:

第一,这个MTP 版在本次环境中的响应速度明显更高;第二,Q8_0 文件更小,运行时内存压力也更低;第三,两次测试的 llama.cpp build、模型文件、请求和日志窗口并不完全相同,所以“约 2 倍”应理解为本次实测的速度级别差异,而不是严格的实验室倍率。

为什么 MTP 版更适合日常工作流?

7 t/s 左右的普速版,更像是“模型能稳定驻留”;12—16 t/s 的 MTP 版,则开始接近“可以持续交互”。在代码修改、文件整理、MCP 工具调用和多轮 Agent 任务里,减少等待会让人更愿意把任务交给模型。

但速度不是唯一指标。模型方还给出了代码、专业工作、科研、长周期智能体、视觉理解和可调 reasoning_effort 等能力方向。对本地用户来说,真正要验证的是:

  • 工具调用是否能正确完成,而不只是输出更快;
  • 复杂代码任务是否少返工;
  • 长上下文增长后,速度是否仍然可接受;
  • 关闭思维或调整 reasoning_effort 后,质量与延迟如何变化;
  • 图像、视频和文档输入是否真的适配当前前端与后端。

这些能力不能从一张 token/s 截图直接推导出来,必须用固定任务集复测。

这次部署的边界与避坑

第一,命令路径要核对。模型文件名、ModelScope 地址和 bat 中 -m 路径必须一致,否则很容易以为自己测的是 MTP 版,实际启动的是上一篇的 UD-Q8_K_XL。

第二,不要把 18.75 t/s 当长任务常数。短输出、短统计窗口更容易出现高数值;长上下文和长输出时,日志已经显示速度会回落。

第三,单并发不等于多人服务。-np 1 只说明本次是单槽位实测。并发增加后,KV Cache、队列等待和共享内存都会变化。

第四,262K 是上限,不是建议每次填满。建议从 8K、32K、64K 逐步测试,记录 prompt eval、首 token、decode 和总耗时。

第五,版本差异会影响结果。本次使用 llama-b10472-bin-win-vulkan-x64,上一篇是 b10358。新 build、MTP 实现和模型格式共同贡献了结果,不能把全部提升只归功于某一个参数。

结语:这次真正加速的,是“愿意把任务交给本地模型”的信心

上一篇普速版告诉我们:Qwen3.8-27B 可以在 AMD 锐龙 AI MAX+ 395 上运行,约 7.02 t/s,GPU 总内存约 66GB。

这次 MTP-Q8_0 版进一步给出另一种答案:模型约 28G,GPU 总内存约 40GB,前端短请求达到 18.75 t/s,日志生成阶段约 12—16.25 t/s,draft acceptance 达到 0.74510。

所以更准确的结论是:MTP 集成版让 Qwen3.8-27B 从“能跑”更接近“愿意长期使用”,但它的真实价值仍要由代码、工具调用和长上下文任务完成率来兑现。

如果你也在 AMD 锐龙 AI MAX+ 395 或其他大内存平台上测试 Qwen3.8-27B,建议先固定一组任务,对比普速版与 MTP 版的总耗时、返工次数和任务完成率。单看峰值速度很刺激,完整工作流数据才真正有参考价值。

AMD锐龙AI MAX+ 395实测:Qwen3.8-27B普速版部署(25)

AMD锐龙AI MAX+ 395实测:Muse-Glimmer-30B普速版部署(23)

AMD NPU 正式觉醒!FastFlowLM 实测:解锁双模型并行(GPU+NPU),整机 AI 生产力翻倍


本文转载自微信公众号「虾搞代码」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论