Workbuddy VS DS Harness 跑相同任务实测

本文摘要Workbuddy VS DS Harness 跑相同任务实测本文来源: 汉堡(公众号:汉堡) 原文链接: https://mp.weixin.qq.com/s/j0HLjFldUgfxD_vXPP292w 发布时间: 2026-08-18 00:38作者: 汉堡  发布时间: 2026-08-18 00:38一份「Agent 工具该怎么选」的真实答案。DeepSeek Harness 开源后,我...

Workbuddy VS DS Harness 跑相同任务实测

本文来源: 汉堡(公众号:汉堡)
原文链接: https://mp.weixin.qq.com/s/j0HLjFldUgfxD_vXPP292w
发布时间: 2026-08-18 00:38

Workbuddy VS DS Harness 跑相同任务实测

作者: 汉堡  发布时间: 2026-08-18 00:38


一份「Agent 工具该怎么选」的真实答案。

DeepSeek Harness 开源后,我一直在想一个问题:它和 WorkBuddy 到底有什么区别?

网上全是「是什么、怎么装」的介绍,真正同场竞技的对比几乎没有。而且大多数对比都不公平——要么任务不同,要么模型不同,比出来的只是噪音。

所以这次我做了一个尽量公平的实验:

同一套 Skill:两边都用 course-ppt-html(做 HTML 网页 PPT 的技能),生成同一个主题的 PPT

同一个模型:两边都用 DeepSeek-V4-Flash

同一个任务:做一份《DeepSeek Harness 5 分钟上手》的 7 页 HTML PPT

结果,差距比我想象中大。

先说结论

WorkBuddy 赢在「快和省心」:75 秒一次成稿,7 页 Swiss 风格 PPT 直接能用。

Harness 赢在「深和严」:65 步工具链自动编排 + 官方校验器 + 像素级渲染自检,质量意识拉满,但花了 16 分钟。

不是替代关系。日常快速产出用 WorkBuddy,复杂工程自动编排交给 Harness,是当前的最优组合。

测试是怎么设计的

统一任务:course-ppt-html 技能,制作《DeepSeek Harness 5 分钟上手》HTML PPT(7 页,可横向翻页,跳过 IP 配图与视频)

统一模型:双方 DeepSeek-V4-Flash(WorkBuddy 侧由用户手动切换确认)

统一环境:Harness 在 ppt-html 工作空间执行;WorkBuddy 在 PPT&HTML 创作空间执行

观察维度:Skill 加载 / 交互过程 / 效率 / 产出质量

第一局:DeepSeek Harness 实测

我通过 Web UI 进入 ppt-html 工作空间,选好 V4-Flash 模型,把任务发了过去。

Harness 配置:ppt-html 工作空间 + V4-Flash 模型

接下来发生的事情,让我重新认识了「自动编排」这四个字:

1.读齐 7 份文档:它把 course-ppt-html 的确认流程、踩坑册、依赖说明、deck 规格、瑞士风布局、检查清单全读了一遍,还分块读完了 2372 行的 guizang 模板。

2.遇到真实环境问题:这台 Mac 上 sandbox-exec 被系统禁用了,Harness 的 bash 沙箱一度全部失效(bash、glob 全挂)。它的应对是——先测试 Write 工具是否可用,确认后改用「复制模板 → 写临时文件 → 程序化替换」的方式继续,全程如实说明受限原因。

3.bash 恢复后继续深挖:复制模板、写入 7 页内容、用 python 精准替换示例区、跑官方 swiss 校验器——一次通过,无错误

4.像素级自检:它发现截图里 p6/p7 文件偏小,怀疑内容缺失。于是做亮度直方图分析、对照实验(静态渲染 vs 注入 JS 抓报错),最终定位是「动画初始态 opacity:0 导致截图时机问题」,deck 本身没问题

Harness 执行中:读取 skill 文档与模板

产出:index.html(112KB,7 页 Swiss 风格)+ 完整项目记录(G0-G3 决策 + 逐页方案对账)。

Harness 侧数据:2 轮 · 65 步 | LLM 13m48s + 工具调用 2m26s | 缓存命中 99% | 输入 9.6M tok / 输出 94.3K tok。

Harness 完整 7 页 PPT

Harness PPT 第 1 页

Harness PPT 第 2 页

Harness PPT 第 3 页

Harness PPT 第 4 页

Harness PPT 第 5 页

Harness PPT 第 6 页

Harness PPT 第 7 页

第二局:WorkBuddy 实测

同样的任务,我在 WorkBuddy(当前这个对话,模型已切换为 V4-Flash)里执行。

过程简单得有点平淡:加载同一套 skill(course-ppt-html + guizang),确认任务参数(主题、受众、7 页、瑞士风、跳过 IP/视频),然后直接写成一个自包含的单 HTML 文件。

75 秒,7 页,18.9KB。渲染截图验证,7 页全部正常。

WorkBuddy 完整 7 页 PPT

WorkBuddy PPT 第 1 页

WorkBuddy PPT 第 2 页

WorkBuddy PPT 第 3 页

WorkBuddy PPT 第 4 页

WorkBuddy PPT 第 5 页

WorkBuddy PPT 第 6 页

WorkBuddy PPT 第 7 页

WorkBuddy 侧数据:1 轮直达 · 墙钟 75 秒 · 产出 18.9KB · 无沙箱/环境问题。

数据对比

Skill 加载:读齐 7 份文档 + 模板 2372 行分块读

交互轮次:2 轮 · 65 步(自动编排)

耗时:LLM 13m48s + 工具 2m26s

缓存命中:99%

输入 / 输出 Token:9.6M / 94.3K

产出文件:112KB(完整 WebGL + Motion One)

质量自检:官方校验器 + 像素级分析 + 对照实验

环境兼容:⚠️ macOS sandbox-exec 失效 → 降级完成

框架对比图

DeepSeek Harness vs WorkBuddy 对比框架

优劣势

DeepSeek Harness

优势
 1. 深度自动编排:65 步工具链一气呵成(复制模板 → 写临时文件 → 程序化替换 → 校验 → 起服 → 截图验证),长任务自主推进。
 2. 严谨自检:官方校验器通过 + 像素级渲染分析 + 对照实验排查根因,质量意识是行业级。
 3. 一切皆插件:模型 / 工具 / 循环 / UI 全可换,二次开发自由度最高。
 4. 成本控制:缓存命中 99%,长会话大量输入只按缓存读计费。

劣势
 1. :LLM 13m48s,是 WorkBuddy 的 10 倍以上。
 2. 环境脆弱:macOS 上 sandbox-exec 被系统禁用 → 需要降级路径,对普通用户不友好。
 3. 上手门槛:Node.js + API Key + 命令行 + 开发者预览版(会变)。
 4. Token 消耗大:输入 9.6M tok(缓存兜底,但无缓存时成本高)。

WorkBuddy

优势
 1. :75 秒交付,一次成稿,零编排摩擦。
 2. 省心:开箱即用(持久会话 + 记忆 + 技能库已装),无沙箱/环境问题。
 3. 对话式协作:跨任务延续上下文,适合日常内容创作。
 4. 轻量产出:18.9KB 自包含,无冗余依赖。

劣势
 1. 自检弱:无官方校验器、无像素级渲染验证,依赖人工/截图确认。
 2. 复杂工程编排弱:多阶段、多工具串联的自主编排不如 Harness。
 3. 可塑性有限:核心逻辑不能像 Harness 那样插件级替换。
 4. 模型绑定:模型由所在环境决定(本次需手动切换为 Flash)。

谁适合用哪个

快速产出(推文配图 / 小工具 / 单页 PPT):WorkBuddy

复杂工程自动编排(大型 PPT 生产线 / 多阶段任务):Harness

学习 Agent 底层 / 二次开发:Harness

日常内容协作(创作 + 归档 + 发布):WorkBuddy

批量重复任务省钱:Harness + Flash

最后一句

这次对比最有价值的发现,不是谁快谁慢,而是两个工具根本不在同一个赛道上

•WorkBuddy 是把「AI 干活」这件事做成对话——你说话,它干完,你验收。

•Harness 是把「AI 干活」这件事做成系统——它有手有脚,还自己检查自己。

模型已经是同一颗大脑了,真正拉开差距的,是大脑外面的那套身体。而你选哪套身体,取决于你想让它干多久的活。

我是汉堡🍔,进来和一杯,我们聊点有趣的。


本文转载自微信公众号「汉堡」,仅供学习交流使用。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论