Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-27B实测

本文摘要Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-27B实测本文来源: 小桥(公众号:小桥) 原文链接: https://mp.weixin.qq.com/s/WEGr6k1QKAzdRSph8dq9Vw 发布时间: 2026-08-30 20:07作者: 小桥  发布时间: 2026-08-30 20:07大家好,我是小桥,算法工程师,我写文章主要是记录我自己学习的过程,加深...

Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-27B实测

本文来源: 小桥(公众号:小桥)
原文链接: https://mp.weixin.qq.com/s/WEGr6k1QKAzdRSph8dq9Vw
发布时间: 2026-08-30 20:07

Ryzen AI Max+ 395 128GB笔记本跑Qwen3.8-27B实测

作者: 小桥  发布时间: 2026-08-30 20:07


大家好,我是小桥,算法工程师,我写文章主要是记录我自己学习的过程,加深自己的理解,另外对自己也是一个督促。如果你对我的文章感兴趣,请关注我,后续会继续给大家介绍推广搜和大模型干货。

我最近入手了一台基于AMD AI max 395 芯片的128g的笔记本电脑,这两天刚到手就迫不及待来折腾Qwen3.8-27B,主要看看到底能跑到多少tokens/s,到底能不能用来生产?

1 折腾windows 11和ubuntu 26.04 desktop双系统

我买的这个笔记本是自带正版windows 11系统,但我看网上其他同学介绍的安装过程都是在ubuntu系统下。但有正版windows系统,我又不想直接把windows系统给去掉,只装ubuntu系统。因此我考虑装双系统。

我之前折腾过ubuntu系统,但要用来娱乐和办公还是经常出问题,解决起来又比较费事,最后基本上都以失败告终。最近我在一个老的电脑上安装我deepin系统,因为deepin系统有应用商店,而且可以装各种windows应用(基于wine),基本上是能用来办公和娱乐的。Ubuntu系统可能会稍微费事一点,但在2026年的今天,我们有AI和agent,其实很多问题agent都能帮我们解决,我相信还是可以把linux当主力系统的。

说干就干,先在windows下打开磁盘管理工具,把1T的ssd压缩弄出大概500G的空间用来安装linux系统。

制作ubuntu 26.04 desktop安装u盘,先到官网下载系统iso文件,把iso文件写到u盘上。

预装的windows系统是启用了bitlocker磁盘加密的,所以最好是一开始就把bitlocker加密关掉,不然后面会很麻烦,我是踩过坑了的。不过一开始不关闭,后面来关也是可以的,知识麻烦一点就是了。

另外,我们后面要在linux系统安装AMD官方的ROCm驱动,还需要在bios里面关闭安全启动。然而安全启动关闭的情况,windows不能用pin码和人脸登录,而且那时候也不能用微软账号登录。所以最后在一开始的时候也要关闭账号的pin码登录,启用微软账号登录。不然后面会遇到登录不了windows的情况。那时候需要重新开启安全启动,然后再登录windows系统,然后再关闭pin码和人脸登录,最后再关闭掉安全启动。

用u盘启动系统安装ubuntu 26.04比较简单,一步步按照提示即可。中途有提醒我启用bitlocker会导致进不去windows,需要输入密钥,我当时也没管。很快就把ubuntu 26.04安装完成。

然后再进windows系统就提示要密钥,不过好在我按照提示到为微软的网站上找到密钥,成功解锁了电脑,进到系统后再把bitlocker关掉了。最后完美的双系统就安装好了,平时主要用linux系统,windows在需要的时候再用。

2 统一内存调优

这台机器的统一内存是128g,默认是GPU最多可以使用大约一半的内存。但我们要跑更大的模型,就希望GPU可以分到更多的内存。

2.1 基础概念

Strix Halo 是 统一内存架构:CPU 和 iGPU 共用同一块物理 DRAM(最高 128GB LPDDR5X),并不是独显那种“板载 GDDR + 系统内存”两套。

固件菜单、驱动日志和社区讨论里,下面这些词经常混用,含义并不一样:

名称是什么谁来设会不会永久占内存
UMA / GMA / Dedicated VRAM / Carve-outBIOS 开机时划给 GPU 的固定预留BIOS会。CPU/OS 再也看不见这块
GART驱动内部把系统内存映射进内核态 GPU 地址空间驱动一般很小,给驱动自己用
GTT用户进程(PyTorch、llama.cpp、ROCm)最多能映射多少系统内存给GPU内核 TTM不会。只用多少映射多少,不用可还给 OS
  • UMA = 固件给 GPU 的专属预留,数字好看,但会从系统内存里抠走一块。
  • GTT = Linux 上真正决定大模型能用多少显存的上限,这个是动态分配的。

2.2 如何调UMA

在bios里面调即可,按照AMD的推荐,这里设置成512M即可,因为真正的上线由GTT决定。当然windows系统下可能就不一样,因为有一些老的游戏可能只能使用UMA的上线。另外GTT在windows系统里面不好改,所有有的人直接把UMA设置成96G,那这样这96G只能当显存,不能当内存使用,但可能也还够。

总结一下,就是在linux系统下UMA设置成512M应该就是够的。

2.3 GTT调整

GTT是真正显存的上限,这个值默认是整体内存的50%左右。那我们跑大模型的时候,我们可能会用更多的显存,所以我们就需要把GTT调高。

用官方工具 amd-ttm:

sudo apt install pipx
pipx ensurepath
# 重新打开终端,或执行:
source ~/.bashrc
 
pipx install amd-debug-tools

设为 108GB:

amd-ttm --set 108

3 安装AMD官方ROCm 7.2+(Strix Halo / gfx1151)

AMD的ROCm相当于英伟达的CUDA,使用GPU进行通用计算的软件。

AMD Strix Halo 平台(如 Ryzen AI MAX+ 395 + Radeon 8060S)的 GPU 架构为gfx1151。Ubuntu 26.04 官方仓库虽然自带 ROCm,但当前版本为7.1.x,对 gfx1151 的支持不如 7.2+ 完善。

因此,推荐在 Ubuntu 26.04 上通过 AMD 官方 apt 源安装ROCm 7.2.4,同时继续使用系统自带的inbox amdgpu 内核驱动,无需额外安装 DKMS 驱动。

3.1 第一步:添加 AMD ROCm 7.2.4 软件源

# 创建 keyring 目录
sudo mkdir --parents --mode=0755 /etc/apt/keyrings
 
# 导入 AMD GPG 密钥
wget -qO- https://repo.radeon.com/rocm/rocm.gpg.key \
  | gpg --dearmor | sudo tee /etc/apt/keyrings/rocm.gpg > /dev/null
 
# 添加 ROCm 7.2.4 noble 源
echo 'deb [arch=amd64 signed-by=/etc/apt/keyrings/rocm.gpg] https://repo.radeon.com/rocm/apt/7.2.4 noble main' \
  | sudo tee /etc/apt/sources.list.d/rocm.list
 
# 设置 apt 优先级,确保优先使用 AMD 官方源
sudo tee /etc/apt/preferences.d/rocm-pin-600 <<'EOF'
Package: *
Pin: release o=repo.radeon.com
Pin-Priority: 600
EOF
 
# 更新软件包列表
sudo apt update

3.2 第二步:将当前用户加入 GPU 访问组

ROCm 需要访问 /dev/kfd 和 /dev/dri/renderD*,用户需属于 render 和 video 组:

sudo usermod -aG video,render ”$USER”

注意:执行后需要注销并重新登录(或重启),组权限才会生效。

3.3 第三步:安装 ROCm

sudo apt install -y rocm

安装过程会拉取 HIP、rocBLAS、MIOpen、rocprofiler 等大量依赖,耗时取决于网络速度,通常需要数分钟到十几分钟。

4 Qwen3.8-27B实测

4.1 Qwen3.8-27B简介

Qwen3.8-27B是阿里巴巴最近开源的模型,参数量为27B,在某些任务上达到了opus 4.6的水平。该模型由于参数量不大,可以在一些消费级设备上就能跑,甚至是可以用来干活的。

原始模型是BFP16的,模型大小是54.7G,虽然我这个机器分了108G显存,但考虑cache等占用,以及计算量的考虑,一般还是建议用量化版本。

社区比较推荐的Q4_K_M的4bit量化版本,节省了 70% 的显存,但保留了 95%~99% 以上的能力与,原版实测的损耗:

  • Agent / Coding任务,在 Terminal-Bench 2.1,BF16和Q4_K_M表现非常接近;
  • 困惑度(越小越好,衡量模型的预测能力)
模型量化PPL相对变化
Qwen3.8-27B BF1616 bit≈ 6.95基准
Qwen3.8-27B Q8_08 bit≈ 6.95几乎无损
Qwen3.8-27B Q6_K6 bit≈ 6.95~6.96极小损失
Qwen3.8-27B Q5_K_M5 bit≈ 6.96极小损失
Qwen3.8-27B Q4_K_M4 bit≈ 6.96~6.98非常小损失

我们可以看到Q4_K_M是一个比较好的版本,再往下量化损失就会表现得明显。

4.2 Vulkan驱动跑Qwen3.8-27B

在Strix Halo架构下,可以有两种方案来跑qwen3.8-27B,一种是使用第三方驱动VULKAN,另外一种是使用ROCm官方驱动。

Vulkan 是一种跨平台的 GPU 计算和图形 API(Application Programming Interface,应用程序接口)。

下载Vulkan专用的编译好的llama.cpp:https://github.com/ggml-org/llama.cpp/releases,选择最新版本的llama-b10683-bin-ubuntu-vulkan-x64.tar.gz。看到这片文章的读者可以使用更新版的release。

下载下来后,解压之后即可使用。

启动命令:

./llama-server 
-m Qwen3.8-27B-UD-Q4_K_M.gguf \ # unsloth量化的4bit版本
-c 65536 \ # 上下文64k,可以根据实际情况调高
-ngl 99 \ # 所有参数尽量放显存,不进行卸载
--spec-type draft-mtp \ # 开启mtp推测解码
--spec-draft-n-max 4 \ # 一次预测4个token
--jinja \ # Qwen的聊天模板
--cache-type-k q4_0 \ # key cache 4bit(默认16bit)
--cache-type-v q4_0 \ # value cache 4bit(默认16bit)
--reasoning-effort low # think等级,默认的xhigh思考太长,一般采用low和medium,

reasoning-effort按理说应该是交互的时候传入,但我在lamma-ui上并没有找到传入的地方。

效果实测,我准备的测试问题:

# 编程任务:实现一个线程安全的 TTL-LRU Cache
后面有详细的要求和描述

Prefill阶段2001 tokens,221.67 tokens/s,非常快。

Decode阶段:

含思考过程,总共15247 tokens,23.31 tokens/s,速度还基本能接受。代码实现的质量还行,能用。这个速度跟其他人分享的速度差不太多。

4.3 ROCm驱动跑Qwen3.8-27B

直接下载基于ROCm预编译好的llama.cpp:llama-b10683-bin-ubuntu-rocm-7.14-x64.tar.gz。

同样也是解压后即可使用。同样的命令和同样的问题再跑一遍。

Prefill阶段:1997 tokens 7.3s 272.93 tokens/s,比Vulkan要快一点。

Decode阶段:12,071 tokens 10min 57s 18.35 t/s,速度比Vulkan的要慢一点,但最终跑完的时间差不多。

4.4 llama-bench测试

后端模型模型大小KV CachePP512 (tok/s)TG128 (tok/s)相对 Q4_K_M 生成速度
VulkanQ4_K_M15.32 GiB默认246.12 ± 8.2412.39 ± 0.04100%
VulkanQ4_K_M15.32 GiBQ4_0 / Q4_0250.66 ± 8.7412.36 ± 0.0099.8%
VulkanQ4_K_XL16.34 GiB默认234.25 ± 5.8911.80 ± 0.0195.2%
VulkanQ4_K_XL16.34 GiBQ4_0 / Q4_0240.13 ± 11.6311.77 ± 0.0295.0%
VulkanQ6_K20.46 GiB默认195.94 ± 1.409.76 ± 0.0078.8%
ROCmQ4_K_M15.32 GiB默认311.79 ± 6.7211.36 ± 0.0291.7%
ROCmQ4_K_XL16.34 GiB默认313.94 ± 7.6210.78 ± 0.0487.0%
ROCmQ6_K20.46 GiB默认291.91 ± 3.529.01 ± 0.0372.7%
结论:
  • ROCm 的 Prompt Processing 明显强于 Vulkan,生成速度反而 Vulkan 更快,日常使用更看重生成,考虑使用Vulkan
  • Q4_K_M 是明显的甜点位,综合考虑选择Q4_K_XL
  • Q4 KV Cache 基本没影响速度

这个benchmark测试没有开mtp的选项,所以速度不是特别快。


本文转载自微信公众号「小桥」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论