《Qwen3.8-27B 遇到对手了:Ornith 1.5-35B 本地实测,速度快 4 倍,代码还更强》

本文摘要《Qwen3.8-27B 遇到对手了:Ornith 1.5-35B 本地实测,速度快 4 倍,代码还更强》本文来源: 散步银河广场(公众号:散步银河广场) 原文链接: https://mp.weixin.qq.com/s/p1ZcsB5Rzxr1pZr6W-oiOg 发布时间: 2026-08-27 22:43作者: 散步银河广场  发布时间: 2026-08-27 22:43小白导读(一句话结论...

《Qwen3.8-27B 遇到对手了:Ornith 1.5-35B 本地实测,速度快 4 倍,代码还更强》

本文来源: 散步银河广场(公众号:散步银河广场)
原文链接: https://mp.weixin.qq.com/s/p1ZcsB5Rzxr1pZr6W-oiOg
发布时间: 2026-08-27 22:43

《Qwen3.8-27B 遇到对手了:Ornith 1.5-35B 本地实测,速度快 4 倍,代码还更强》

作者: 散步银河广场  发布时间: 2026-08-27 22:43


小白导读(一句话结论):同一台 M5 Pro,我换了个模型跑。Ornith 1.5-35B 4-bit,生成速度是 Qwen3.8-27B 的 3.4 到 4.4 倍,首 token 延迟只有四分之一。智能测试七项平均 Qwen 87.7%、Ornith 82%,差 5.7 分;但编程基准 LiveCodeBench Ornith 拿 69%,Qwen 只有 43%。结论:要速度要代码选 Ornith,要均衡通才保留 Qwen。

(本地大模型折腾笔记第七篇。前六篇把 Qwen3.8-27B 从安装、加速、智能、Thinking 开关测了个遍。本篇换个模型,看看能不能找到更好的日常搭档。)

同学们,

Qwen3.8-27B 测试了好几天,但真干起活来,速度总上不去,苦恼啊!但 -

山穷水复疑无路,柳暗花明又一村。

前六篇我围着 Qwen3.8-27B 转,测了安装、加速、智能、Thinking 开关,像个痴情前男友。但本地模型圈不止这一棵树。

何不试试MoE模型?每次调用少于10B,宽带大大提速。

有人跟我推荐 Ornith 1.5-35B,说是个 MoE 架构的新秀,速度快得离谱。我这人听不得"快得离谱"四个字,手痒,测了。

同一台 M5 Pro,同一个 oMLX,同一个 4-bit。Qwen 是 27B 密集模型,Ornith 是 35B 总参数、约 2.6B 激活的 MoE。不是同构架构,所以比较不是"谁更优秀",是"谁更适合你的活"。

速度:Ornith 不讲武德

先上硬货。单请求,代码上下文。

指标Qwen3.8 4-bit(MTP4)Ornith 1.5 4-bitOrnith 优势
TTFT(首 token)2,123 ms538 ms3.9x 更低
Prompt TPS482.4 tok/s1,905.2 tok/s4.0x
Generation TPS28.2 tok/s94.8 tok/s3.4x
端到端时间6.674 s1.896 s3.5x 更快
峰值内存19.06 GB19.39 GB基本相当

文字处理上下文,Ornith 生成速度 88.9 tok/s,Qwen 20.2 tok/s,差距拉到 4.4 倍。首 token 延迟 531 ms vs 2,126 ms,四倍差距。

小白提示:TTFT(Time To First Token)就是你发完问题后,模型多久开始回答。538 毫秒大概是人眨一次眼的时间。Qwen 的 2 秒多,够你眨四次。这个差距在日常聊天里体感非常明显。

同内存占用,同 4-bit,Ornith 凭什么快这么多?

小白提示(重点,记一下):MoE(Mixture of Experts,混合专家模型)不是把 35B 参数全激活。每次前向传播只激活约 2.6B 参数,但用了一个路由机制动态选择"专家"子网络。所以它的计算量远低于 35B  dense 模型,速度自然快。代价是模型文件更大(19 GB vs 15.7 GB),因为所有专家权重都存在硬盘里,只是运行时不全加载到显存。

Qwen 开了 MTP4 加速后从 17.0 提到 28.2 tok/s,已经够香了。但 Ornith 不用 MTP 就 94.8 tok/s,加了 Qwen 的 MTP draft 才升到 95.5,几乎没变化。说明 Ornith 本身已经够快, MTP 这种外挂对它边际收益很小。

Ornith 还测了长上下文和并发。4K 输入下生成速度几乎不变(87.3 tok/s),内存只多 0.84 GB。两路连续批处理总吞吐 158.4 tok/s,是单路的 1.78 倍。这货不仅能自用,还能同时喂几个 agent。

智能:Qwen 仍是均衡通才

速度被碾压,Qwen 在智能上能不能找回场子?

七项共同基准,同样的 100 题抽样,同样的 Thinking 开启。

测试Qwen3.8Ornith 1.5差距
MMLU(综合知识)89%85%-4
HellaSwag(常识推理)92%78%-14
TruthfulQA(事实可靠)89%90%+1
MMLU-Pro(高难综合)77%66%-11
CMMLU(中文知识)84%80%-4
ARC-C(科学推理)93%92%-1
MathQA(数学应用)90%83%-7
七项等权平均87.7%82.0%-5.7

Qwen 赢了六项,输了一项(TruthfulQA +1% 算打平)。七项平均差 5.7 分,不算小。

但这个差距要拆开看。Ornith 在 ARC-C(92% vs 93%)和 TruthfulQA(90% vs 89%)上几乎追平,说明科学推理和事实可靠性不差。真正拉开的是 HellaSwag(-14)和 MMLU-Pro(-11)。HellaSwag 测日常情境常识,MMLU-Pro 测高难专业知识。Ornith 在这两块明显偏弱。

还有个时间维度值。七项测试 Qwen 合计跑了约 12 小时,Ornith 约 2.2 小时。不是 Ornith 质量差,是它生成快、思考链短,测完一套题的时间自然少。

小白提示:每项只有 100 题,小于约 3-4 分的差距宜视为接近,7 分以上的差距更值得关注。所以 MMLU-Pro 的 -11 和 HellaSwag 的 -14 是真实差距,MMLU 的 -4 和 CMMLU 的 -4 算在误差边缘。

编程:Ornith 反杀

智能测试 Qwen 占优,但编程这块剧情反转。

测试Qwen3.8Ornith 1.5结论
HumanEval96%92%接近;但模式不同(Qwen 非 Thinking,Ornith Thinking)
LiveCodeBench43%69%Ornith +26 分,且约 7.6x 更快完成
MBPP未测92%Ornith 建立基线;Qwen 可补测

LiveCodeBench 是最接近真实编程场景的基准。Ornith 69% vs Qwen 43%,差距 26 分,而且跑完 100 题只要 2.5 小时,Qwen 要 19.1 小时。

HumanEval 两者接近(96% vs 92%),但 Qwen 测的是 Non-thinking,Ornith 是 Thinking,模式不同,不能判定谁更强。LiveCodeBench 才是同模式(都 Thinking)下的严格比较。

Ornith 的 GSM8K(数学文字题)拿了 97%,8.8 分钟跑完。Qwen 现有 GSM8K 结果是 Non-thinking 的 91%。

一张图看速度差距

Generation TPS(代码上下文,越高越好)

Qwen3.8 + MTP4    28.2  ████████████
Ornith 1.5        94.8  ████████████████████████████████████████

TTFT(越低越好)

Qwen3.8 + MTP4    2123 ms  ████████████████████████████████
Ornith 1.5         538 ms  ████████

怎么选:一个务实的建议

测完这些数据,结论不是"谁更好",是"谁更适合你的活"。

选 Qwen3.8-27B,如果你:

  • 重视中文知识问答(CMMLU 84% vs 80%)
  • 需要复杂知识推理和高难专业题(MMLU-Pro 77% vs 66%)
  • 看重日常情境常识(HellaSwag 92% vs 78%)
  • 数学应用题是刚需(MathQA 90% vs 83%)
  • 想要一个均衡通才,不太愿意折腾多个模型

选 Ornith 1.5-35B,如果你:

  • 代码是主要场景(LiveCodeBench 69% vs 43%,快 7.6 倍)
  • 受不了等待,想要即问即答(94.8 tok/s,首 token 半秒)
  • 有并发需求,一个模型喂多个 agent
  • 长上下文任务多(4K 输入速度几乎不掉)
  • 愿意用 5.7% 的通用智能差距换 3-4 倍的速度

小白提示:Ornith 模型文件 19 GB,比 Qwen 的 15.7 GB 大。硬盘空间紧张的同学注意一下。另外 MoE 模型在 oMLX 上的表现可能因版本不同而有差异,我测的是 v0.6.3rc2。

边界得守住

几条纪律,别乱解读。

  1. 不是同构比较。Qwen 是 27B dense,Ornith 是 35B MoE(2.6B 激活)。速度差部分来自架构差异,不是"同一个模型换了优化就快了 4 倍"。
  2. 100 题抽样,不是完整评测。方向性参考,别当排行榜用。
  3. HumanEval 模式不同。Qwen Non-thinking 96%,Ornith Thinking 92%,不能判定谁更强。LiveCodeBench 才是同模式严格 A/B。
  4. 最佳下一步:用同一个真实 WorkBuddy 工作流跑 A/B,比跑分更能说明问题。

收尾

前六篇我把 Qwen3.8-27B 测了个底朝天,从安装到加速到智能到 Thinking 开关。这篇换个模型,发现 Ornith 在速度和编程上确实能打。

本地模型的世界不是单选题。Qwen 是均衡通才,Ornith 是速度型选手。我的 M5 Pro 现在两个都装着,日常代码用 Ornith,复杂知识问答切回 Qwen。

好了,咱们下次再见。

经验教训(第七篇)

  1. MoE 架构的本地模型速度优势真实存在。Ornith 94.8 tok/s 不是跑分魔术,是激活参数少带来的实际计算量减少。
  2. 速度和质量不是零和。Ornith 在 ARC-C(92%)和 TruthfulQA(90%)上接近 Qwen,说明快不等于笨,只是能力分布不同。
  3. HellaSwag -14 和 MMLU-Pro -11 是 Ornith 的真实短板。日常情境常识和高难专业知识偏弱,选模型前先问自己干的是什么活。
  4. LiveCodeBench 是这轮最鲜明的结果。Ornith +26 分且快 7.6 倍,对代码 agent 和 WorkBuddy 场景的实际价值可能超过通用平均分。

本文转载自微信公众号「散步银河广场」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论