Qwen3.8-27B 本地部署教程(全网最详细版)
本文来源: 知几(公众号:知几)
原文链接: https://mp.weixin.qq.com/s/V2aY68qYGSCv8Q8lmZD4uQ
发布时间: 2026-08-16 23:44

作者: 知几 发布时间: 2026-08-16 23:44

一提到“本地部署大模型”,很多人的第一反应不是兴奋,而是头大。
Linux、CUDA、Docker、Python环境、显卡驱动、量化、GGUF、上下文……
看教程之前,还觉得自己只是想在电脑上装个AI;看完三篇教程以后,感觉自己差一个计算机硕士学位。
但现在,这件事已经没有以前那么难了。
最近 Qwen 发布了Qwen3.8-27B。这是一个270亿参数的稠密视觉语言模型,原生支持文字、图片和视频理解,原生上下文长度达到262,144 Token,同时支持可调节的思考模式。
更关键的是,Unsloth已经提供了适合个人电脑运行的GGUF量化版本。所以这篇文章不讲模型排行榜,也不讨论服务器集群。
我们只完成一件事:
让一个从来没有本地部署过大模型的人,照着文章一步一步操作,最后在浏览器里和自己电脑上的Qwen3.8-27B聊天。
如果你是第一次部署,请不要跳步骤。
【配图1:全文部署路线图】

图注:第一次本地部署,不需要先搞懂几十个概念。沿着这条路线一路往下走即可。
一、先说清楚:我们到底要在电脑里装什么?
平时使用ChatGPT、豆包、Kimi时,你的问题需要发送到厂商服务器,由服务器里的模型计算,再把结果返回给你。
本地部署正好相反。
我们会把一个大约17.9GB的Qwen模型文件直接下载到自己的电脑,再用一个叫llama.cpp的程序运行它。
完成以后,整个结构其实很简单:
你的电脑 → llama.cpp → Qwen3.8-27B → 浏览器聊天界面
模型下载完成以后,普通的本地推理可以直接在你的机器上完成。
这意味着以后你还可以继续把本地模型接到知识库、IDE、Agent或者自己的程序里。
但先别想那么远。
第一次,我们只追求一个目标:
让它说出第一句话。
第一步:先检查你的电脑能不能跑
这是最不能省的一步。
很多教程直接从“下载模型”开始,结果你辛辛苦苦下完18GB,模型一启动,内存爆了。
先按:
Ctrl + Shift + Esc
打开Windows的:
任务管理器
然后点击左侧:
性能
我们只看三个地方。
1. 看内存
点击:
内存
你会看到16GB、32GB、64GB之类的数字。
针对本文使用的17.9GB左右Q4量化版本,我建议这样理解:
| 电脑内存 | 建议 |
|---|---|
| 16GB | 不建议跑27B,换更小模型 |
| 32GB | 可以尝试,但需要控制上下文并关闭其他大型程序 |
| 64GB | 比较适合本文路线 |
| 96GB以上 | 可以进一步尝试更高量化和更长上下文 |
这里需要注意:
模型文件17.9GB,不代表运行模型只需要17.9GB内存。
Windows自己要吃内存,模型运行还需要上下文缓存、计算缓冲区等空间。
Unsloth目前提供的Qwen3.8-27B GGUF从约9GB的2bit版本,到54.7GB的BF16版本都有;本文选择17.9GB的 UD-Q4_K_XL,是质量、体积和个人电脑可运行性之间比较合适的折中。
2. 看GPU
继续点击:
GPU
看看自己的显卡叫什么。
可能是:
NVIDIA GeForce RTX……
也可能是:
AMD Radeon……
如果你使用的是AMD Ryzen AI Max这类统一内存机器,还要特别注意一个误区。
Windows有时会显示“专用GPU内存4GB”,但统一内存机器并不能简单按照传统独立显卡的“4GB显存”来判断模型是否能运行。
我们真正要做的,是后面让llama.cpp自己告诉我们:
它到底有没有识别到你的GPU。
3. 看硬盘
模型本身约17.9GB,再加上缓存、视觉组件以及以后可能下载的其他模型,我建议至少准备:
30GB以上空闲磁盘。
如果C盘只剩十几GB,请先清空间。
如果有D盘,最好预留一个:
D:\AI
专门放AI相关文件。
【配图2:Windows任务管理器性能页面】

图注:第一步不要急着下载模型,先看自己的内存和GPU。
第二步:开始前,先把电脑“清场”
特别是32GB、64GB内存机器,第一次运行模型以前,建议做几件很朴素但非常有效的事:
关闭暂时不用的Chrome、Edge标签页,退出其他本地AI软件,关闭大型游戏、视频剪辑软件,如果开着Docker Desktop也可以先退出。
如果电脑已经运行很多天,最省事的办法就是:
重启一次。
笔记本记得插电。
电源模式可以调成:
最佳性能。
这么做不是玄学。
我们只是尽可能给第一次模型加载留出更多内存和性能余量。
做完以后,正式开始。
第三步:打开Windows PowerShell
点击Windows开始菜单。
搜索:
PowerShell
打开:
Windows PowerShell
你会看到一个蓝色或者黑色窗口。
别紧张。
这篇教程不要求你会编程。
后面看到命令时,只需要做三件事:
复制 → 粘贴 → 回车。
首先输入:
winget --version如果出现类似:
v1.xx.x说明正常。
继续下一步。
如果提示找不到 winget,打开Microsoft Store,搜索:
App Installer
安装或者更新以后,再重新打开PowerShell运行一次。
第四步:安装运行大模型的llama.cpp
现在安装本文最核心的软件:
llama.cpp
它是目前非常成熟的本地大模型推理项目之一,可以在CPU和多种GPU后端上运行模型。
当前官方Windows安装文档已经支持直接使用WinGet:
复制:
winget install llama.cpp按回车。
中间如果询问是否接受协议,根据提示输入:
Y然后等安装完成。
安装结束以后:
把当前PowerShell窗口关掉。
重新打开一个PowerShell窗口。
这是一个很重要的小细节,因为新的程序路径需要重新加载。
接着输入:
llama --help如果出现一大堆帮助信息:
第一关通过。
目前WinGet安装方式可以直接使用统一入口 llama cli 和 llama serve;传统预编译二进制中的 llama-cli、llama-server 仍然存在,本质上对应的是同一套工具。
第五步:先检查GPU,别急着下载18GB模型
这是整个教程里非常重要的一步。
在PowerShell输入:
llama cli --list-devicesllama.cpp官方CLI提供了 --list-devices 参数,用于列出当前能够使用的计算设备。
正常情况下,你应该能看到自己的GPU名称。
例如:
Vulkan0: AMD Radeon(TM) 8060S Graphics或者:
CUDA0: NVIDIA GeForce RTX ...具体显示形式取决于你的硬件和后端。
只要能够看到自己的GPU:
第二关通过。
为什么这一关这么重要?
因为最坑的情况不是模型完全跑不了,而是:
模型能跑,但绝大部分计算全落在CPU上。
然后模型半天蹦几个字,你会误以为“本地大模型根本没法用”。
所以:
看到GPU,再继续。
如果只看到CPU,先跳到文章后面的“常见问题2:为什么只看到CPU”。
不要急着下载模型。
第六步:把模型缓存放到D盘
如果你的C盘空间非常充足,这一步理论上可以跳过。
但为了避免18GB模型把系统盘越塞越满,我还是建议提前规划目录。
先建立文件夹:
New-Item -ItemType Directory -Force -Path 'D:\AI\llama-cache' | Out-Null然后让当前PowerShell使用这个目录:
$env:LLAMA_CACHE = 'D:\AI\llama-cache'再保存成用户环境变量:
[Environment]::SetEnvironmentVariable(
'LLAMA_CACHE',
'D:\AI\llama-cache',
'User'
)关闭PowerShell,再重新打开一个。
输入:
echo $env:LLAMA_CACHE如果返回:
D:\AI\llama-cache就成功了。
llama.cpp当前工具链仍提供 LLAMA_CACHE 环境变量用于控制相关缓存位置。
没有D盘怎么办?
把全文里的:
D:\AI
换成:
C:\AI
即可。
第七步:正式下载Qwen3.8-27B
现在终于轮到模型。
本文不让大家在十几个量化版本里面选来选去。
第一次直接使用:
UD-Q4_K_XL
当前Unsloth页面列出的大小约为:
17.9GB。
复制下面整段:
llama cli `
-hf ”unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL” `
--no-mmproj `
--n-gpu-layers all `
--ctx-size 16384 `
--reasoning-budget 2048 `
--conversation然后回车。
这里解释几个东西。
-hf:
告诉llama.cpp直接从Hugging Face获取指定模型。
UD-Q4_K_XL:
我们指定的Q4量化版本。
--no-mmproj:
第一次先不要加载图片理解模块,只测试纯文字。
--n-gpu-layers all:
尽可能把模型层放到GPU。
--ctx-size 16384:
第一次只开16K上下文。
--reasoning-budget 2048:
限制第一次测试时模型不要无限思考。llama.cpp目前支持通过该参数限制思考Token预算。
--conversation:
进入聊天模式。
第八步:第一次下载时,什么情况算正常?
按下回车以后,电脑不会立刻开始聊天。
因为:
第一次需要先下载约17.9GB模型。
你会看到下载进度。
这个过程快慢完全取决于网络。
这时候最重要的是:
别乱按Ctrl+C。
如果觉得PowerShell半天没有反应,可以打开:
D:\AI\llama-cache
观察里面的文件是不是持续增长。
只要下载进度还在走,或者文件体积还在变大:
就让它继续。
千万别进入这个死亡循环:
怎么没反应?
Ctrl+C。
再运行一次。
又觉得没反应。
再Ctrl+C。
这反而最容易把第一次部署搞乱。
第九步:终于到了最关键的一刻,怎么看是否成功?
下载完成以后,终端会打印很多英文日志。
小白第一次看到这一屏,很容易觉得:
“是不是报错了?”
先别慌。
这些日志大部分不用看懂。
重点寻找两个东西。
第一个:
自己的GPU名字。
第二个:
类似:
offloaded ... layers
或者其他GPU offload相关信息。
这代表模型正在把计算任务交给GPU。
接着,如果终端进入可以输入文字的状态,复制一句:
你好。请用中文回答:你是什么模型?现在是否正在我的本地电脑上运行?按回车。
如果它开始正常回答:
恭喜。
你已经完成了最核心的一步:
一个270亿参数的大模型,真的在自己的电脑上跑起来了。
Qwen3.8-27B官方模型卡确认其参数规模为27B,并原生支持262,144 Token上下文及图像、视频理解。
但第一次看到它在自己的电脑里开始打字,参数表上的“27B”,才第一次变成了一个有感觉的东西。
第十步:顺便看看自己的电脑到底能跑多快
模型回答结束以后,通常会看到运行统计。
其中有一个指标比较有意思:
tokens per second
也就是每秒生成多少Token。
简单理解:
数字越高,生成速度越快。
但这里不要陷入跑分焦虑。
不同机器的:
GPU、内存带宽、功耗、量化方式、上下文长度、思考长度……
都会影响速度。
第一次只做一件事:
记下来。
例如:
Qwen3.8-27B
Q4
16K上下文
未开MTP
XX tokens/s
以后你再开MTP、换量化、调上下文,才知道到底有没有变快。
第十一步:把黑乎乎的命令行,变成真正的网页版AI
到这里,模型已经能用了。
但谁也不想每天对着PowerShell聊天。
按:
Ctrl + C
退出刚才的命令行模型。
然后运行:
llama serve `
-hf ”unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL” `
--alias ”qwen3.8-27b-local” `
--host 127.0.0.1 `
--port 8080 `
--n-gpu-layers all `
--ctx-size 16384 `
--parallel 1 `
--reasoning-budget 4096Unsloth当前针对Qwen3.8-27B的Windows使用说明,也直接给出了 llama serve -hf ... 启动OpenAI兼容本地服务和Web UI的路线。
因为模型已经下载过了,这一次不会重新下载17.9GB。
等PowerShell出现服务启动成功信息以后:
打开Edge或者Chrome。
地址栏输入:
http://127.0.0.1:8080回车。
如果出现聊天页面:
第五关通过。
现在你已经不用盯着黑窗口了。
你拥有了一个:
真正运行在自己电脑上的网页版Qwen。
为什么我一直强调127.0.0.1?
因为:
127.0.0.1
代表只允许当前电脑访问。
对于第一次部署的人来说,这是最省心的方案。
不要看到其他教程以后,顺手把:
127.0.0.1
改成:
0.0.0.0
后者涉及局域网暴露、防火墙和API安全。
我们现在的目标只是:
自己用。
先别给AI开大门。
第十二步:测试本地API,这一步决定它以后能不能接Agent
如果你只是聊天,其实到上一步已经结束了。
但我非常建议再多做一步。
因为这一步完成以后,本地Qwen就不只是一个聊天页面,而是可以被其他程序调用的:
本地AI服务。
先不要关闭运行 llama serve 的PowerShell。
再打开第二个PowerShell。
输入:
(Invoke-RestMethod `
-Uri 'http://127.0.0.1:8080/v1/models' `
-Method Get).data如果里面出现:
qwen3.8-27b-local说明本地API工作正常。
以后第三方工具如果支持OpenAI兼容接口,一般可以填写:
Base URL:
http://127.0.0.1:8080/v1
Model:
qwen3.8-27b-localUnsloth当前给出的Agent工具接入示例,同样使用 http://localhost:8080/v1 这类OpenAI兼容地址。
这一步一旦打通,后面你就可以继续研究:
知识库、IDE、Agent、自动化工作流。
真正好玩的部分才刚刚开始。
第十三步:再试试图片理解
第一次我们故意关闭了图片模块。
因为部署最重要的原则是:
一次只验证一个变量。
文字模型都没跑通,就同时开图片、视频、MTP和64K上下文,最后出错时根本不知道问题在哪。
现在文字已经稳定,可以测试图片。
准备一张图片,例如:
D:\AI\test.jpg停止当前服务以后运行:
llama cli `
-hf ”unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL” `
--n-gpu-layers all `
--ctx-size 16384 `
--reasoning-budget 2048 `
--image ”D:\AI\test.jpg” `
--prompt ”请详细描述这张图片,并指出你不确定的地方。”注意:
这一次没有:
--no-mmprojllama.cpp当前使用 -hf 加载多模态模型时,如果仓库中存在匹配的多模态投影组件,可以自动加载;CLI也已经支持 --image 参数。
如果模型开始正确描述图片:
图片能力也跑通了。
第十四步:为什么明明支持262K,我却一直只让你开16K?
因为这是小白第一次部署最容易掉进去的坑。
Qwen3.8-27B官方原生上下文确实达到:
262,144 Token。
但是:
支持262K,不等于每天都应该开262K。
上下文越长,通常意味着更高的内存占用和更长的提示处理时间。
所以正确顺序应该是:
16K
↓
32K
↓
64K
↓
128K
↓
真的需要,再测试262K16K稳定以后,把启动命令里的:
--ctx-size 16384改成:
--ctx-size 32768跑一段时间。
稳定,再改:
--ctx-size 65536一步一步上。
“机器能分配出来”和“这个配置日常值得使用”,完全是两回事。
第十五步:部署完以后,可以彻底离线吗?
可以让模型推理本身离线运行。
模型和需要的组件都已经下载完成以后,可以在命令里加入:
--offlinellama.cpp当前提供该参数,用于强制使用本地缓存并阻止模型加载阶段访问网络。
比如:
llama serve `
-hf ”unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL” `
--offline `
--host 127.0.0.1 `
--port 8080 `
--n-gpu-layers all `
--ctx-size 16384但是要注意一个边界:
本地模型,不等于整个工作流永远不联网。
如果以后你给它接搜索工具、调用互联网API,或者主动让它读取网络资源,那些部分当然还会联网。
真正处理隐私材料时,可以选择:
本地文件 + 本地模型 + 本地接口。
这才是本地部署最有价值的场景之一。
最常见的6个问题,直接按顺序排查
1. 输入llama提示“不是命令”
先关闭PowerShell。
重新打开。
输入:
winget list llama.cpp如果没有找到,重新安装:
winget install llama.cpp安装完成以后重新打开PowerShell。
2. --list-devices只看到CPU
运行:
llama cli --list-devices如果完全没有GPU,先更新显卡驱动。
然后再重新执行。
如果还是没有,不要急着下载模型。
你需要确认当前llama.cpp是否加载到了适合自己GPU的后端。
llama.cpp支持多种计算后端,而 --list-devices 就是官方提供的设备确认方式。
3. 模型能启动,但是速度特别慢
先看启动日志有没有GPU offload。
如果没有,大概率主要在CPU上跑。
如果已经有GPU参与,再检查:
电脑是否插电;
Windows是否开启最佳性能;
后台是不是还有游戏、剪辑软件和其他AI程序;
是否把上下文一开始就拉得特别长。
第一次请老老实实:
Q4 + 16K。
4. 提示内存不够
按照这个顺序处理。
先关闭其他大型程序。
然后把:
--ctx-size 16384改成:
--ctx-size 8192文字任务继续使用:
--no-mmproj还不行,再考虑换更小量化。
Unsloth当前的Qwen3.8-27B GGUF中,UD-Q3_K_XL 大约13.4GB,而本文使用的 UD-Q4_K_XL 约17.9GB。
如果仍然非常吃力:
换小模型。
千万不要为了“27B”三个字和电脑死磕。
5. 模型一直思考,不肯给最终答案
Qwen3.8默认支持思考模式。官方也明确给出了思考模式相关设置。
所以本文第一次测试加了:
--reasoning-budget 2048日常服务用了:
--reasoning-budget 4096如果只是摘要、改写、格式转换,还可以进一步关闭思考或者减少预算。
不是每个问题都值得模型先写一篇内部论文再回答你。
6. 我能不能现在就开MTP加速?
能。
但我建议:
先不要。
Unsloth当前Qwen3.8-27B GGUF已经标注支持MTP。
正确顺序应该是:
普通Q4跑通
↓
记录速度
↓
测试稳定性
↓
再开MTP
↓
比较速度与回答质量否则模型出了问题,你甚至不知道是基础配置的问题,还是MTP的问题。
第一次部署:
变量越少越好。
为什么我越来越建议普通人至少做一次?
过去几年,我们已经习惯了一件事:
打开一个网站。
输入问题。
等待远处服务器里的AI回答。
所以很多人潜意识里会觉得:
AI就是一个网站。
但当你第一次看到一个接近18GB的模型文件真正躺在自己的硬盘里,启动PowerShell,GPU开始工作,然后浏览器里的AI在断开云端服务以后依然能够回答你,那种感觉完全不一样。
你会第一次直观地意识到:
AI也可以成为电脑本身的一部分。
而本地部署真正有价值的地方,也不只是少交一个会员费。
以后你可以把它接入自己的论文、资料、代码目录、知识库、Agent甚至自动化工作流。
敏感文件可以尽量留在本机,模型也可以按照自己的需求长期运行。
今天我们只是完成了第一步:
让AI在自己的电脑里真正跑起来。
但只要这一关迈过去,后面的本地知识库、本地科研助手、本地Agent,才真正有了一块属于自己的地基。
如果觉得这篇有用,可以点个赞、在看,或者转给那个一直想玩本地AI、又总觉得自己搞不定的朋友。
本文转载自微信公众号「知几」,仅供学习交流使用。
觉得内容不错?我要