本文摘要本文基于 https://hf-mirror.com/unsloth/Qwen3.8-27B-GGUF/tree/main 分析适合幻X2025-128GB基于Unsloth Studio的本地部署Qwen3.8-27B的选型。

幻 X 2025 · 128GB · Unsloth Studio 部署 Qwen3.8-27B 选型分析
基于真实 Strix Halo / 幻 X 2025 上跑 27B 级 GGUF 的 tok/s 实测,总结如下推荐表格:
你的优势:128GB 统一内存,Strix Halo 核显可分出 ~94–110GB 当显存,27B 全系都能全量进显存,无需 CPU offload。
核心结论(按"质量 + 速度"排序推荐):
- 🥇 无损首选 →
BF16(54.66GB):原精度,显存轻松装下,还能开长上下文。 - 🥈 近无损首选 →
Q8_0(29GB)或UD-Q8_K_L(28GB):体积减半、质量近无损;Q8_0 开 MTP 实测 22–25 tok/s,体验最佳平衡点。 - 🥉 高质量&最省显存 →
UD-Q6_K(22GB):质量很好,MTP 下实测 18 tok/s,长上下文余量最大。 - ❌ 不推荐 IQ 系列(IQ1~IQ3):质量退化严重,白白浪费你充裕的显存。
- 关于 MTP:在 Unsloth Studio 里默认自动开启(底层调用仓库的
Q4_0草稿,无需你手动指定),所以下表"MTP 参数"列在 Studio 语境下即"自动"。
先补一条最终选型结论到今日记忆,再给你完整成品表。
已记录最终选型结论。下面是你要的完整成品。
完整对比表
| 模型文件全称 | 体积 | bpw | 质量档 | 全GPU显存(短) | 基础 tok/s(无MTP) | MTP 参数 | 开启MTP的tok/s | 128GB适配 |
|---|---|---|---|---|---|---|---|---|
| Qwen3.8-27B-UD-IQ1_S.gguf | 6.19 GB | ~1.56 | 严重退化 | ~8 GB | ~16–18 | Studio自动(Q4_0草稿,n-max4) | ~45–54(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-IQ1_M.gguf | 6.73 GB | ~1.75 | 严重退化 | ~9 GB | ~15–17 | 同上 | ~42–50(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-IQ2_XXS.gguf | 7.27 GB | ~2.06 | 很差 | ~9 GB | ~14–16 | 同上 | ~40–48(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-IQ2_S.gguf | 8.37 GB | ~2.35 | 很差 | ~10 GB | ~13–15 | 同上 | ~36–44(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-Q2_K_XL.gguf | 9.83 GB | ~2.75 | 差 | ~12 GB | ~13 | 同上 | ~34–40(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-IQ3_XXS.gguf | 10.93 GB | ~3.06 | 偏差 | ~13 GB | ~12–13 | 同上 | ~32–38(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-IQ3_S.gguf | 12.04 GB | ~3.39 | 偏差 | ~14 GB | ~12 | 同上 | ~30–36(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-Q3_K_XL.gguf | 13.15 GB | ~3.6 | 中等偏差 | ~15 GB | ~11–12 | 同上 | ~28–34(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-IQ4_XS.gguf | 14.25 GB | ~4.25 | 中等 | ~16 GB | ~11–12 | 同上 | ~26–32(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-Q4_K_S.gguf | 15.36 GB | ~4.58 | 中等 | ~17 GB | ~11–12 | 同上 | ~26–32(推算) | ✅ 可跑 |
| Qwen3.8-27B-Q4_0.gguf | 16.06 GB | ~4.55 | 中等 | ~18 GB | ~11–12 | 同上 | ~26–32(推算) | ✅ 可跑 |
| Qwen3.8-27B-UD-Q4_K_M.gguf | 16.46 GB | ~4.85 | 中等偏好(性价比甜点) | ~18 GB | ~11–12 | 同上 | ~34–40(推算,4-bit档实测峰值38) | ✅ 备选 |
| Qwen3.8-27B-Q4_1.gguf | 17.54 GB | ~5.0 | 中等偏好 | ~19 GB | ~11 | 同上 | ~26–32(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q4_K_XL.gguf | 17.56 GB | ~5.0 | 中等偏好 | ~19 GB | 11.3(实测) | 同上 | ~28–34(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q5_K_S.gguf | 18.67 GB | ~5.4 | 良好 | ~20 GB | ~10–11 | 同上 | ~24–30(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q5_K_M.gguf | 19.77 GB | ~5.7 | 良好(高质量甜点) | ~21 GB | ~10–11 | 同上 | ~24–30(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q5_K_XL.gguf | 20.88 GB | ~5.9 | 很好 | ~22 GB | 10.5(实测) | 同上(或DFlash2草稿) | DFlash2实测31(爆发)/26–29(持续); | 备选内置MTP推算~22✅ |
| Qwen3.8-27B-UD-Q6_K.gguf | 21.98 GB | ~6.59 | 很好(高质量甜点) | ~24 GB | ~9.5 | Studio自动(n-max=2) | 18(实测,n-max=2) | ✅推荐 |
| Qwen3.8-27B-UD-Q6_K_M.gguf | 23.09 GB | ~6.8 | 很好 | ~25 GB | ~9 | 同上 | ~17–20(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q6_K_L.gguf | 24.19 GB | ~6.8 | 很好 | ~26 GB | ~8.7 | 同上 | ~16–19(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q6_K_XL.gguf | 25.30 GB | ~6.8 | 很好 | ~27 GB | ~8.3 | 同上 | ~15–18(推算) | ✅ 备选 |
| Qwen3.8-27B-UD-Q8_K_L.gguf | 28.05 GB | ~8.5 | 近无损 | ~30 GB | ~7.5 | 同上 | ~15–20(推算) | ✅推荐 |
| Qwen3.8-27B-Q8_0.gguf | 29.05 GB | ~8.5 | 近无损(经典高质) | ~31 GB | 7.5(实测) | 同上 | 22–25 | ✅推荐(实测:AMD24.5/lilting22/kingjones25.07;@142K 16–19) |
| Qwen3.8-27B-UD-Q8_K_XL.gguf | 31.46 GB | ~8.6 | 近无损 | ~33 GB | ~6.7 | 同上 | ~14–18(推算) | ✅推荐 |
| BF16/Qwen3.8-27B-BF16-00001-of-00002.gguf (+00002) | 54.66 GB(2分片:49.99+4.67) | 16 | 无损(原精度) | ~57 GB | ~3.8–4.5 | 同上(草稿占~1.4GB) | ~13–15(推算,无直接数据) | ✅强烈推荐(无损首选) |
关键说明
- 体积/显存:体积取仓库真实 LFS 大小;全 GPU 显存 ≈ 体积 + 2GB 运行开销(短上下文)。你 128GB 版 GPU 显存可达 ~94–110GB,全部档位都能全量装下。
- MTP:Unsloth Studio 中默认自动开启,底层用仓库的
MTP/mtp-Qwen3.8-27B-Q4_0.gguf(1.37GB,Q4_0 草稿)。若改用独立 llama.cpp,等效命令为--spec-type draft-mtp --spec-draft-model <草稿> --spec-draft-n-max 4(UD-Q6_K 用 2 更优)。实测提速约 2–3.3×。 - 速度口径:标「实测」来自 Strix Halo 真实跑分(Q8_0 22–25、UD-Q6_K 18、UD-Q5_K_XL 用 DFlash2 31/26–29、UD-Q4_K_XL 11.3 等);标「推算」按实测锚点(基线×2~3.3)外推。长上下文会显著拉低速度(Q8_0 在 142K 仅 16–19)。
- 唯一"标准静态量化":本仓库只有
Q4_0/Q4_1/Q8_0三个非 UD 档;其余 K_M/K_S/K_XL/IQ 均为UD-动态量化(同体积质量更高)。
觉得内容不错?我要