Qwen3.8-Flash-Next 在AMD Ryzen AI Max+ 395的Windows 上跑出了新高度
本文来源: 虾搞代码(公众号:虾搞代码)
原文链接: https://mp.weixin.qq.com/s/xNx95360dCDm0ZjQMui5zQ
发布时间: 2026-09-30 18:18

作者: 虾搞代码 发布时间: 2026-09-30 18:18
如果有人告诉你,一台 Windows 机器能把 125B 参数的大模型跑到短上下文
44.4 t/s
你大概会先看他的电脑,再看他的精神状态。
但这次,数字是真的。
Rulith Inference 项目在 AMD Ryzen AI Max+ 395 上,跑起了Qwen3.8-Flash-Next 125B-A6B。模型量化后仍有 93.7GB,却在 128GB 统一内存里实现了:95.6K token 预填充1228 t/s,短上下文解码,86K 长上下文解码
36.7 t/s
注意,这不是“打开任务管理器,发现显存共享了 120GB”式胜利,而是实打实能聊天、能看图、能跑多路智能体的本地推理。
125B 为什么没有把 Windows 当场压扁?
先解释模型名里的“A6B”。
它采用 MoE,也就是“混合专家”架构。模型总参数约 125B,但每次处理 token 时,只激活其中约 6B。可以把它理解为一家拥有 1250 亿“知识库存”的公司,每次开会不用全员到场,只叫最相关的专家进会议室。
这让大模型“装得下”和“跑得动”同时有了可能。
但可能不等于容易。
这台机器使用 Radeon 8060S、128GB 统一内存,并把显存划分到 96GB。项目文档明确写着:64GB 分配不仅装不下模型,解码还会慢 28%。此外,它依赖特定版本的 ROCm SDK 和经过补丁改造的 llama.cpp。
所以,别急着拿办公室那台 Windows 轻薄本祭天。硬件、内存布局和运行时,一个都不能少。
真正厉害的,不是“能跑”,而是把每个卡点都掰开了
项目团队没有发明一块魔法显卡,而是做了 53 个文件的改动,把性能一点点从缝里抠出来。
例如,模型超过一半的主体使用 IQ3_S 格式,原来的计算路径没能充分进入矩阵核心。调整之后,预填充提升 5.6%。他们又针对 gfx1151 重写专家内核,把单层耗时从35.9ms 压到 19.9ms,预填充再涨 10%。
更关键的是长上下文。
过去解码一个 token,注意力机制可能要翻完整个缓存,像为了找一张发票,把三年聊天记录重新读一遍。改成只聚集被选中的单元后,97K 上下文解码从59.0ms/token 降到 49.3ms/token,上下文越长,收益越明显。
再配合 MTP 推测解码——先让小型“草稿员”猜几个 token,再由主模型批量验收——85K 上下文速度从
21.5 t/s 提升到 34.9 t/s
这不是一个炫技补丁,而是一整套对计算、内存、缓存和并发的重新安排。
更有意思的是:它开始认真服务“智能体”
普通聊天是一问一答,智能体却像项目群:主模型、工具调用、子智能体一起说话,还共享一大段系统提示词。
项目专门优化了前缀缓存和多会话调度。一个包含 10K token 系统提示、3 个同时启动会话和3个子智能体的负载,处理量从 73K token 降到 29K,提示耗时从172 秒降到 60 秒。
六智能体场景里,首 token 时间中位数也从
10.1 秒降到 3.4 秒
这意味着本地大模型竞争的下一站,已经不只是“单轮跑分多高”,而是谁能同时养活更多智能体,并且不让它们互相踩掉上下文。
一台 Windows 机器,正在改变什么?
近一点看,本地部署的价值很朴素:隐私数据不出机器、断网也能工作、长对话不用反复上传,开发者还可以自己控制缓存和并发。
再往后看,一旦大模型能在桌面级设备上持续运行,AI 的形态就会变化:它不再只是浏览器里随叫随到的聊天框,而可能变成常驻本机、理解文件、调用工具、并行协作的一组智能体。
当然,这还不是“人人一台 125B”。目前方案只面向 Windows、gfx1151 和特定模型家族;约 95GB 模型下载、96GB 显存划分和定制运行时,也谈不上即装即用。
但它已经把一个问题改写了。
过去我们问:Windows 能不能高速地跑超大模型?
现在更值得问的是:当 125B 模型已经能在桌边以几十 token 每秒工作,我们准备让它做什么?
真正的新高度,不只是 44.4 t/s。而是数据中心与个人电脑之间那堵墙,又矮了一截。
参考文档:
https://github.com/rulith-dev/rulith-inference/blob/main/docs/getting-started.zh.md
https://github.com/rulith-dev/rulith-inference/blob/main/README.zh.md
- AMD 锐龙 AI MAX+ 395 实测:llama.cpp 0.4.0 测 Qwen3.8-Flash-Next Q4 提速版,17+ tok/s 终于像“能用”了(39)
- AMD 锐龙 AI MAX+ 395 实测:103GB 的 Qwen3.8-Flash-Next Q4,普速版也有 16 tok/s(34)
本文转载自微信公众号「虾搞代码」,仅供学习交流使用。
觉得内容不错?我要