《Qwen3.8-27B 遇到对手了:Ornith 1.5-35B 本地实测,速度快 4 倍,代码还更强》
本文来源: 散步银河广场(公众号:散步银河广场)
原文链接: https://mp.weixin.qq.com/s/p1ZcsB5Rzxr1pZr6W-oiOg
发布时间: 2026-08-27 22:43

作者: 散步银河广场 发布时间: 2026-08-27 22:43
小白导读(一句话结论):同一台 M5 Pro,我换了个模型跑。Ornith 1.5-35B 4-bit,生成速度是 Qwen3.8-27B 的 3.4 到 4.4 倍,首 token 延迟只有四分之一。智能测试七项平均 Qwen 87.7%、Ornith 82%,差 5.7 分;但编程基准 LiveCodeBench Ornith 拿 69%,Qwen 只有 43%。结论:要速度要代码选 Ornith,要均衡通才保留 Qwen。
(本地大模型折腾笔记第七篇。前六篇把 Qwen3.8-27B 从安装、加速、智能、Thinking 开关测了个遍。本篇换个模型,看看能不能找到更好的日常搭档。)
同学们,
Qwen3.8-27B 测试了好几天,但真干起活来,速度总上不去,苦恼啊!但 -
山穷水复疑无路,柳暗花明又一村。
前六篇我围着 Qwen3.8-27B 转,测了安装、加速、智能、Thinking 开关,像个痴情前男友。但本地模型圈不止这一棵树。
何不试试MoE模型?每次调用少于10B,宽带大大提速。
有人跟我推荐 Ornith 1.5-35B,说是个 MoE 架构的新秀,速度快得离谱。我这人听不得"快得离谱"四个字,手痒,测了。
同一台 M5 Pro,同一个 oMLX,同一个 4-bit。Qwen 是 27B 密集模型,Ornith 是 35B 总参数、约 2.6B 激活的 MoE。不是同构架构,所以比较不是"谁更优秀",是"谁更适合你的活"。
速度:Ornith 不讲武德
先上硬货。单请求,代码上下文。
| 指标 | Qwen3.8 4-bit(MTP4) | Ornith 1.5 4-bit | Ornith 优势 |
|---|---|---|---|
| TTFT(首 token) | 2,123 ms | 538 ms | 3.9x 更低 |
| Prompt TPS | 482.4 tok/s | 1,905.2 tok/s | 4.0x |
| Generation TPS | 28.2 tok/s | 94.8 tok/s | 3.4x |
| 端到端时间 | 6.674 s | 1.896 s | 3.5x 更快 |
| 峰值内存 | 19.06 GB | 19.39 GB | 基本相当 |
文字处理上下文,Ornith 生成速度 88.9 tok/s,Qwen 20.2 tok/s,差距拉到 4.4 倍。首 token 延迟 531 ms vs 2,126 ms,四倍差距。
小白提示:TTFT(Time To First Token)就是你发完问题后,模型多久开始回答。538 毫秒大概是人眨一次眼的时间。Qwen 的 2 秒多,够你眨四次。这个差距在日常聊天里体感非常明显。
同内存占用,同 4-bit,Ornith 凭什么快这么多?
小白提示(重点,记一下):MoE(Mixture of Experts,混合专家模型)不是把 35B 参数全激活。每次前向传播只激活约 2.6B 参数,但用了一个路由机制动态选择"专家"子网络。所以它的计算量远低于 35B dense 模型,速度自然快。代价是模型文件更大(19 GB vs 15.7 GB),因为所有专家权重都存在硬盘里,只是运行时不全加载到显存。
Qwen 开了 MTP4 加速后从 17.0 提到 28.2 tok/s,已经够香了。但 Ornith 不用 MTP 就 94.8 tok/s,加了 Qwen 的 MTP draft 才升到 95.5,几乎没变化。说明 Ornith 本身已经够快, MTP 这种外挂对它边际收益很小。
Ornith 还测了长上下文和并发。4K 输入下生成速度几乎不变(87.3 tok/s),内存只多 0.84 GB。两路连续批处理总吞吐 158.4 tok/s,是单路的 1.78 倍。这货不仅能自用,还能同时喂几个 agent。
智能:Qwen 仍是均衡通才
速度被碾压,Qwen 在智能上能不能找回场子?
七项共同基准,同样的 100 题抽样,同样的 Thinking 开启。
| 测试 | Qwen3.8 | Ornith 1.5 | 差距 |
|---|---|---|---|
| MMLU(综合知识) | 89% | 85% | -4 |
| HellaSwag(常识推理) | 92% | 78% | -14 |
| TruthfulQA(事实可靠) | 89% | 90% | +1 |
| MMLU-Pro(高难综合) | 77% | 66% | -11 |
| CMMLU(中文知识) | 84% | 80% | -4 |
| ARC-C(科学推理) | 93% | 92% | -1 |
| MathQA(数学应用) | 90% | 83% | -7 |
| 七项等权平均 | 87.7% | 82.0% | -5.7 |
Qwen 赢了六项,输了一项(TruthfulQA +1% 算打平)。七项平均差 5.7 分,不算小。
但这个差距要拆开看。Ornith 在 ARC-C(92% vs 93%)和 TruthfulQA(90% vs 89%)上几乎追平,说明科学推理和事实可靠性不差。真正拉开的是 HellaSwag(-14)和 MMLU-Pro(-11)。HellaSwag 测日常情境常识,MMLU-Pro 测高难专业知识。Ornith 在这两块明显偏弱。
还有个时间维度值。七项测试 Qwen 合计跑了约 12 小时,Ornith 约 2.2 小时。不是 Ornith 质量差,是它生成快、思考链短,测完一套题的时间自然少。
小白提示:每项只有 100 题,小于约 3-4 分的差距宜视为接近,7 分以上的差距更值得关注。所以 MMLU-Pro 的 -11 和 HellaSwag 的 -14 是真实差距,MMLU 的 -4 和 CMMLU 的 -4 算在误差边缘。
编程:Ornith 反杀
智能测试 Qwen 占优,但编程这块剧情反转。
| 测试 | Qwen3.8 | Ornith 1.5 | 结论 |
|---|---|---|---|
| HumanEval | 96% | 92% | 接近;但模式不同(Qwen 非 Thinking,Ornith Thinking) |
| LiveCodeBench | 43% | 69% | Ornith +26 分,且约 7.6x 更快完成 |
| MBPP | 未测 | 92% | Ornith 建立基线;Qwen 可补测 |
LiveCodeBench 是最接近真实编程场景的基准。Ornith 69% vs Qwen 43%,差距 26 分,而且跑完 100 题只要 2.5 小时,Qwen 要 19.1 小时。
HumanEval 两者接近(96% vs 92%),但 Qwen 测的是 Non-thinking,Ornith 是 Thinking,模式不同,不能判定谁更强。LiveCodeBench 才是同模式(都 Thinking)下的严格比较。
Ornith 的 GSM8K(数学文字题)拿了 97%,8.8 分钟跑完。Qwen 现有 GSM8K 结果是 Non-thinking 的 91%。
一张图看速度差距
Generation TPS(代码上下文,越高越好)
Qwen3.8 + MTP4 28.2 ████████████
Ornith 1.5 94.8 ████████████████████████████████████████
TTFT(越低越好)
Qwen3.8 + MTP4 2123 ms ████████████████████████████████
Ornith 1.5 538 ms ████████怎么选:一个务实的建议
测完这些数据,结论不是"谁更好",是"谁更适合你的活"。
选 Qwen3.8-27B,如果你:
- 重视中文知识问答(CMMLU 84% vs 80%)
- 需要复杂知识推理和高难专业题(MMLU-Pro 77% vs 66%)
- 看重日常情境常识(HellaSwag 92% vs 78%)
- 数学应用题是刚需(MathQA 90% vs 83%)
- 想要一个均衡通才,不太愿意折腾多个模型
选 Ornith 1.5-35B,如果你:
- 代码是主要场景(LiveCodeBench 69% vs 43%,快 7.6 倍)
- 受不了等待,想要即问即答(94.8 tok/s,首 token 半秒)
- 有并发需求,一个模型喂多个 agent
- 长上下文任务多(4K 输入速度几乎不掉)
- 愿意用 5.7% 的通用智能差距换 3-4 倍的速度
小白提示:Ornith 模型文件 19 GB,比 Qwen 的 15.7 GB 大。硬盘空间紧张的同学注意一下。另外 MoE 模型在 oMLX 上的表现可能因版本不同而有差异,我测的是 v0.6.3rc2。
边界得守住
几条纪律,别乱解读。
- 不是同构比较。Qwen 是 27B dense,Ornith 是 35B MoE(2.6B 激活)。速度差部分来自架构差异,不是"同一个模型换了优化就快了 4 倍"。
- 100 题抽样,不是完整评测。方向性参考,别当排行榜用。
- HumanEval 模式不同。Qwen Non-thinking 96%,Ornith Thinking 92%,不能判定谁更强。LiveCodeBench 才是同模式严格 A/B。
- 最佳下一步:用同一个真实 WorkBuddy 工作流跑 A/B,比跑分更能说明问题。
收尾
前六篇我把 Qwen3.8-27B 测了个底朝天,从安装到加速到智能到 Thinking 开关。这篇换个模型,发现 Ornith 在速度和编程上确实能打。
本地模型的世界不是单选题。Qwen 是均衡通才,Ornith 是速度型选手。我的 M5 Pro 现在两个都装着,日常代码用 Ornith,复杂知识问答切回 Qwen。
好了,咱们下次再见。
经验教训(第七篇)
- MoE 架构的本地模型速度优势真实存在。Ornith 94.8 tok/s 不是跑分魔术,是激活参数少带来的实际计算量减少。
- 速度和质量不是零和。Ornith 在 ARC-C(92%)和 TruthfulQA(90%)上接近 Qwen,说明快不等于笨,只是能力分布不同。
- HellaSwag -14 和 MMLU-Pro -11 是 Ornith 的真实短板。日常情境常识和高难专业知识偏弱,选模型前先问自己干的是什么活。
- LiveCodeBench 是这轮最鲜明的结果。Ornith +26 分且快 7.6 倍,对代码 agent 和 WorkBuddy 场景的实际价值可能超过通用平均分。
本文转载自微信公众号「散步银河广场」,仅供学习交流使用。
觉得内容不错?我要