AMD锐龙AI MAX+ 395实测:Qwen3.8-27B-MTP加速升级版部署(26)
本文来源: 虾搞代码(公众号:虾搞代码)
原文链接: https://mp.weixin.qq.com/s/n_syN7ssp0JYaCCPf2hnXw
发布时间: 2026-08-20 08:18

作者: 虾搞代码 发布时间: 2026-08-20 08:18
同一台 AMD 锐龙 AI MAX+ 395、同一个 Qwen3.8-27B 家族,上一篇普速版记录约 7.02 t/s;AMD锐龙AI MAX+ 395实测:Qwen3.8-27B普速版部署(25)这次换成 MTP 头集成的 Q8_0 版本,前端截图出现 18.75 t/s,llama.cpp 日志在短输出阶段记录到 16.25 t/s。它没有把每个请求都变成 2 倍速,却确实把“等待感”压低了一大截。
先给结论:这次的优势,不只是模型更小
这次部署的是 Qwen3.8-27B-MTP-Q8_0.gguf,模型文件约 28G,使用 llama-b10472-bin-win-vulkan-x64。任务管理器显示 GPU 总内存约40/112GB,专用 GPU 内存约36.8/63.8GB,温度约47℃。

模型地址:https://modelscope.cn/models/Jackrong/Qwen3.8-27B-MTP-GGUF。本文只把页面提供的 MTP 特性作为版本说明,速度和内存结论均以本机截图、日志和当前配置为准。
速度有三组值得区分的数字:
- 前端一次短请求显示 216 tokens、11 秒、18.75 t/s;
- llama.cpp 日志另一段生成从
16.25 t/s
起步,随着输出变长逐步回落到约 12 t/s;
- 同一日志中,约 21.8K tokens 的长上下文 prompt eval 为
150.16 t/s
,生成 110 tokens 的 eval 为
16.33 t/s
。

上一篇 AMD锐龙AI MAX+ 395实测:Qwen3.8-27B普速版部署(25)在相近平台上记录约
7.02 t/s
。因此可以说:本次 MTP 版的短输出峰值约为普速版的 2 倍以上,稳定生成区间也明显更高;但不能把 18.75 t/s 当成所有任务的固定速度,实际的只大概在14上下。
三张截图,分别说明了什么
前端截图显示 216 tokens、11 秒、18.75 t/s。这类短请求容易受到首 token、界面统计窗口和输出长度影响,更适合说明“响应可以很快”,不适合单独代表长任务吞吐。
任务管理器显示:GPU 总内存40/112GB,专用 GPU 内存36.8/63.8GB,共享 GPU 内存2.8/47.6GB,温度47℃。相比上一篇约 66GB 的运行时占用,这个 MTP-Q8_0 版本给上下文、桌面应用和工具调用留下了更大余量。

日志里最关键的一段是:n_gen = 103, tg = 16.25 t/s,随后另一请求在生成 100—1205 tokens 的过程中,速度大致从 16—17 t/s 逐步回落到约 12 t/s。长上下文、历史消息和输出长度都会改变最终体感。
完整启动命令
llama-b10472-bin-win-vulkan-x64\llama-server.exe
-m "D:\ChatGPT\llama.cpp.demo\models\MTP\Qwen3.8-27B-MTP-Q8_0.gguf"
-c 262144 -b 2048 -ub 1024 --flash-attn on --host 0.0.0.0
--port 88 --temp 1.0 --repeat-penalty 1.05 --top-p 0.95
--top-k 64 --n-gpu-layers 999 --no-mmap -np 1
--cache-type-k q4_0 --cache-type-v q4_0 --ui-mcp-proxy
--reasoning-preserve --spec-draft-n-max 3
--spec-type draft-mtp --timeout 600000MTP 集成版和单独草稿模型有什么不同?
这次版本的关键卖点,是把 MTP(多 token 预测)头直接放进主模型,不需要再指定一个独立 draft model,比上一篇的预测准确率要高,所以速度提升明显。服务端仍通过:
--spec-draft-n-max 3 --spec-type draft-mtp启用推测解码路径。模型先提出多个候选 token,再由主模型验证;候选被接受得越多,主模型逐 token 等待就越少。日志中的 draft acceptance = 0.74510,表示 102 个候选中接受了 76 个,平均草稿长度约 3.24。这是本次加速有依据的证据,但不是“固定加速倍数”。
模型说明建议 max draft = 2,而本次命令使用 --spec-draft-n-max 3。这两者并不矛盾:前者是模型方推荐起点,后者是本机实测配置。若要寻找最佳值,建议固定同一提示词,分别测试 2 和 3,记录接受率、decode、总耗时和输出稳定性。
与上一篇普速版放在一起看
| 项目 | Qwen3.8-27B 普速版 | Qwen3.8-27B MTP加速版 |
|---|---|---|
| 量化/文件 | UD-Q8_K_XL,约 30G | MTP-Q8_0,约 28G |
| llama.cpp | b10358 Vulkan | b10472 Vulkan |
| 前端/日志速度 | 约 7.02 t/s | 14+ t/s |
| GPU 总内存 | 约 66/112GB | 约 40/112GB |
| 专用 GPU 内存 | 约 62.4/63.8GB | 约 36.8/63.8GB |
| 温度 | 约 54℃ | 约 54℃ |
| cache | --cache-type-k q8_0 --cache-type-v q8_0 | --cache-type-k q4_0 --cache-type-v q4_0 |
| 独立草稿模型 | 无需额外草稿模型 | 无需额外草稿模型 |
这张表能说明三件事:
第一,这个MTP 版在本次环境中的响应速度明显更高;第二,Q8_0 文件更小,运行时内存压力也更低;第三,两次测试的 llama.cpp build、模型文件、请求和日志窗口并不完全相同,所以“约 2 倍”应理解为本次实测的速度级别差异,而不是严格的实验室倍率。
为什么 MTP 版更适合日常工作流?
7 t/s 左右的普速版,更像是“模型能稳定驻留”;12—16 t/s 的 MTP 版,则开始接近“可以持续交互”。在代码修改、文件整理、MCP 工具调用和多轮 Agent 任务里,减少等待会让人更愿意把任务交给模型。
但速度不是唯一指标。模型方还给出了代码、专业工作、科研、长周期智能体、视觉理解和可调 reasoning_effort 等能力方向。对本地用户来说,真正要验证的是:
- 工具调用是否能正确完成,而不只是输出更快;
- 复杂代码任务是否少返工;
- 长上下文增长后,速度是否仍然可接受;
- 关闭思维或调整
reasoning_effort后,质量与延迟如何变化; - 图像、视频和文档输入是否真的适配当前前端与后端。
这些能力不能从一张 token/s 截图直接推导出来,必须用固定任务集复测。
这次部署的边界与避坑
第一,命令路径要核对。模型文件名、ModelScope 地址和 bat 中 -m 路径必须一致,否则很容易以为自己测的是 MTP 版,实际启动的是上一篇的 UD-Q8_K_XL。
第二,不要把 18.75 t/s 当长任务常数。短输出、短统计窗口更容易出现高数值;长上下文和长输出时,日志已经显示速度会回落。
第三,单并发不等于多人服务。-np 1 只说明本次是单槽位实测。并发增加后,KV Cache、队列等待和共享内存都会变化。
第四,262K 是上限,不是建议每次填满。建议从 8K、32K、64K 逐步测试,记录 prompt eval、首 token、decode 和总耗时。
第五,版本差异会影响结果。本次使用 llama-b10472-bin-win-vulkan-x64,上一篇是 b10358。新 build、MTP 实现和模型格式共同贡献了结果,不能把全部提升只归功于某一个参数。
结语:这次真正加速的,是“愿意把任务交给本地模型”的信心
上一篇普速版告诉我们:Qwen3.8-27B 可以在 AMD 锐龙 AI MAX+ 395 上运行,约 7.02 t/s,GPU 总内存约 66GB。
这次 MTP-Q8_0 版进一步给出另一种答案:模型约 28G,GPU 总内存约 40GB,前端短请求达到 18.75 t/s,日志生成阶段约 12—16.25 t/s,draft acceptance 达到 0.74510。
所以更准确的结论是:MTP 集成版让 Qwen3.8-27B 从“能跑”更接近“愿意长期使用”,但它的真实价值仍要由代码、工具调用和长上下文任务完成率来兑现。
如果你也在 AMD 锐龙 AI MAX+ 395 或其他大内存平台上测试 Qwen3.8-27B,建议先固定一组任务,对比普速版与 MTP 版的总耗时、返工次数和任务完成率。单看峰值速度很刺激,完整工作流数据才真正有参考价值。
AMD锐龙AI MAX+ 395实测:Qwen3.8-27B普速版部署(25)
AMD锐龙AI MAX+ 395实测:Muse-Glimmer-30B普速版部署(23)
AMD NPU 正式觉醒!FastFlowLM 实测:解锁双模型并行(GPU+NPU),整机 AI 生产力翻倍
本文转载自微信公众号「虾搞代码」,仅供学习交流使用。
觉得内容不错?我要