幻X2025-128GB基于Unsloth Studio的本地部署Qwen3.8-27B的选型

本文摘要本文基于 https://hf-mirror.com/unsloth/Qwen3.8-27B-GGUF/tree/main 分析适合幻X2025-128GB基于Unsloth Studio的本地部署Qwen3.8-27B的选型。

image.png

幻 X 2025 · 128GB · Unsloth Studio 部署 Qwen3.8-27B 选型分析

基于真实 Strix Halo / 幻 X 2025 上跑 27B 级 GGUF 的 tok/s 实测,总结如下推荐表格:

你的优势:128GB 统一内存,Strix Halo 核显可分出 ~94–110GB 当显存,27B 全系都能全量进显存,无需 CPU offload。

核心结论(按"质量 + 速度"排序推荐)

  • 🥇 无损首选 → BF16(54.66GB):原精度,显存轻松装下,还能开长上下文。
  • 🥈 近无损首选 → Q8_0(29GB)或 UD-Q8_K_L(28GB):体积减半、质量近无损;Q8_0 开 MTP 实测 22–25 tok/s,体验最佳平衡点。
  • 🥉 高质量&最省显存 → UD-Q6_K(22GB):质量很好,MTP 下实测 18 tok/s,长上下文余量最大。
  • 不推荐 IQ 系列(IQ1~IQ3):质量退化严重,白白浪费你充裕的显存。
  • 关于 MTP:在 Unsloth Studio 里默认自动开启(底层调用仓库的 Q4_0 草稿,无需你手动指定),所以下表"MTP 参数"列在 Studio 语境下即"自动"。

先补一条最终选型结论到今日记忆,再给你完整成品表。
已记录最终选型结论。下面是你要的完整成品。

完整对比表

模型文件全称体积bpw质量档全GPU显存(短)基础 tok/s(无MTP)MTP 参数开启MTP的tok/s128GB适配
Qwen3.8-27B-UD-IQ1_S.gguf6.19 GB~1.56严重退化~8 GB~16–18Studio自动(Q4_0草稿,n-max4)~45–54(推算)✅ 可跑
Qwen3.8-27B-UD-IQ1_M.gguf6.73 GB~1.75严重退化~9 GB~15–17同上~42–50(推算)✅ 可跑
Qwen3.8-27B-UD-IQ2_XXS.gguf7.27 GB~2.06很差~9 GB~14–16同上~40–48(推算)✅ 可跑
Qwen3.8-27B-UD-IQ2_S.gguf8.37 GB~2.35很差~10 GB~13–15同上~36–44(推算)✅ 可跑
Qwen3.8-27B-UD-Q2_K_XL.gguf9.83 GB~2.75~12 GB~13同上~34–40(推算)✅ 可跑
Qwen3.8-27B-UD-IQ3_XXS.gguf10.93 GB~3.06偏差~13 GB~12–13同上~32–38(推算)✅ 可跑
Qwen3.8-27B-UD-IQ3_S.gguf12.04 GB~3.39偏差~14 GB~12同上~30–36(推算)✅ 可跑
Qwen3.8-27B-UD-Q3_K_XL.gguf13.15 GB~3.6中等偏差~15 GB~11–12同上~28–34(推算)✅ 可跑
Qwen3.8-27B-UD-IQ4_XS.gguf14.25 GB~4.25中等~16 GB~11–12同上~26–32(推算)✅ 可跑
Qwen3.8-27B-UD-Q4_K_S.gguf15.36 GB~4.58中等~17 GB~11–12同上~26–32(推算)✅ 可跑
Qwen3.8-27B-Q4_0.gguf16.06 GB~4.55中等~18 GB~11–12同上~26–32(推算)✅ 可跑
Qwen3.8-27B-UD-Q4_K_M.gguf16.46 GB~4.85中等偏好(性价比甜点)~18 GB~11–12同上~34–40(推算,4-bit档实测峰值38)✅ 备选
Qwen3.8-27B-Q4_1.gguf17.54 GB~5.0中等偏好~19 GB~11同上~26–32(推算)✅ 备选
Qwen3.8-27B-UD-Q4_K_XL.gguf17.56 GB~5.0中等偏好~19 GB11.3(实测)同上~28–34(推算)✅ 备选
Qwen3.8-27B-UD-Q5_K_S.gguf18.67 GB~5.4良好~20 GB~10–11同上~24–30(推算)✅ 备选
Qwen3.8-27B-UD-Q5_K_M.gguf19.77 GB~5.7良好(高质量甜点)~21 GB~10–11同上~24–30(推算)✅ 备选
Qwen3.8-27B-UD-Q5_K_XL.gguf20.88 GB~5.9很好~22 GB10.5(实测)同上(或DFlash2草稿)DFlash2实测31(爆发)/26–29(持续);备选内置MTP推算~22
Qwen3.8-27B-UD-Q6_K.gguf21.98 GB~6.59很好(高质量甜点)~24 GB~9.5Studio自动(n-max=2)18(实测,n-max=2)推荐
Qwen3.8-27B-UD-Q6_K_M.gguf23.09 GB~6.8很好~25 GB~9同上~17–20(推算)✅ 备选
Qwen3.8-27B-UD-Q6_K_L.gguf24.19 GB~6.8很好~26 GB~8.7同上~16–19(推算)✅ 备选
Qwen3.8-27B-UD-Q6_K_XL.gguf25.30 GB~6.8很好~27 GB~8.3同上~15–18(推算)✅ 备选
Qwen3.8-27B-UD-Q8_K_L.gguf28.05 GB~8.5近无损~30 GB~7.5同上~15–20(推算)推荐
Qwen3.8-27B-Q8_0.gguf29.05 GB~8.5近无损(经典高质)~31 GB7.5(实测)同上22–25推荐(实测:AMD24.5/lilting22/kingjones25.07;@142K 16–19)
Qwen3.8-27B-UD-Q8_K_XL.gguf31.46 GB~8.6近无损~33 GB~6.7同上~14–18(推算)推荐
BF16/Qwen3.8-27B-BF16-00001-of-00002.gguf (+00002)54.66 GB(2分片:49.99+4.67)16无损(原精度)~57 GB~3.8–4.5同上(草稿占~1.4GB)~13–15(推算,无直接数据)强烈推荐(无损首选)

关键说明

  1. 体积/显存:体积取仓库真实 LFS 大小;全 GPU 显存 ≈ 体积 + 2GB 运行开销(短上下文)。你 128GB 版 GPU 显存可达 ~94–110GB,全部档位都能全量装下。
  2. MTP:Unsloth Studio 中默认自动开启,底层用仓库的 MTP/mtp-Qwen3.8-27B-Q4_0.gguf(1.37GB,Q4_0 草稿)。若改用独立 llama.cpp,等效命令为 --spec-type draft-mtp --spec-draft-model <草稿> --spec-draft-n-max 4(UD-Q6_K 用 2 更优)。实测提速约 2–3.3×。
  3. 速度口径:标「实测」来自 Strix Halo 真实跑分(Q8_0 22–25、UD-Q6_K 18、UD-Q5_K_XL 用 DFlash2 31/26–29、UD-Q4_K_XL 11.3 等);标「推算」按实测锚点(基线×2~3.3)外推。长上下文会显著拉低速度(Q8_0 在 142K 仅 16–19)。
  4. 唯一"标准静态量化":本仓库只有 Q4_0/Q4_1/Q8_0 三个非 UD 档;其余 K_M/K_S/K_XL/IQ 均为 UD- 动态量化(同体积质量更高)。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论