Workbuddy VS DS Harness 跑相同任务实测
本文来源: 汉堡(公众号:汉堡)
原文链接: https://mp.weixin.qq.com/s/j0HLjFldUgfxD_vXPP292w
发布时间: 2026-08-18 00:38

作者: 汉堡 发布时间: 2026-08-18 00:38
一份「Agent 工具该怎么选」的真实答案。
DeepSeek Harness 开源后,我一直在想一个问题:它和 WorkBuddy 到底有什么区别?
网上全是「是什么、怎么装」的介绍,真正同场竞技的对比几乎没有。而且大多数对比都不公平——要么任务不同,要么模型不同,比出来的只是噪音。
所以这次我做了一个尽量公平的实验:
•同一套 Skill:两边都用 course-ppt-html(做 HTML 网页 PPT 的技能),生成同一个主题的 PPT
•同一个模型:两边都用 DeepSeek-V4-Flash
•同一个任务:做一份《DeepSeek Harness 5 分钟上手》的 7 页 HTML PPT
结果,差距比我想象中大。
先说结论
•WorkBuddy 赢在「快和省心」:75 秒一次成稿,7 页 Swiss 风格 PPT 直接能用。
•Harness 赢在「深和严」:65 步工具链自动编排 + 官方校验器 + 像素级渲染自检,质量意识拉满,但花了 16 分钟。
•不是替代关系。日常快速产出用 WorkBuddy,复杂工程自动编排交给 Harness,是当前的最优组合。
测试是怎么设计的
统一任务:course-ppt-html 技能,制作《DeepSeek Harness 5 分钟上手》HTML PPT(7 页,可横向翻页,跳过 IP 配图与视频)
统一模型:双方 DeepSeek-V4-Flash(WorkBuddy 侧由用户手动切换确认)
统一环境:Harness 在 ppt-html 工作空间执行;WorkBuddy 在 PPT&HTML 创作空间执行
观察维度:Skill 加载 / 交互过程 / 效率 / 产出质量
第一局:DeepSeek Harness 实测
我通过 Web UI 进入 ppt-html 工作空间,选好 V4-Flash 模型,把任务发了过去。

接下来发生的事情,让我重新认识了「自动编排」这四个字:
1.读齐 7 份文档:它把 course-ppt-html 的确认流程、踩坑册、依赖说明、deck 规格、瑞士风布局、检查清单全读了一遍,还分块读完了 2372 行的 guizang 模板。
2.遇到真实环境问题:这台 Mac 上 sandbox-exec 被系统禁用了,Harness 的 bash 沙箱一度全部失效(bash、glob 全挂)。它的应对是——先测试 Write 工具是否可用,确认后改用「复制模板 → 写临时文件 → 程序化替换」的方式继续,全程如实说明受限原因。
3.bash 恢复后继续深挖:复制模板、写入 7 页内容、用 python 精准替换示例区、跑官方 swiss 校验器——一次通过,无错误。
4.像素级自检:它发现截图里 p6/p7 文件偏小,怀疑内容缺失。于是做亮度直方图分析、对照实验(静态渲染 vs 注入 JS 抓报错),最终定位是「动画初始态 opacity:0 导致截图时机问题」,deck 本身没问题。

产出:index.html(112KB,7 页 Swiss 风格)+ 完整项目记录(G0-G3 决策 + 逐页方案对账)。
Harness 侧数据:2 轮 · 65 步 | LLM 13m48s + 工具调用 2m26s | 缓存命中 99% | 输入 9.6M tok / 输出 94.3K tok。
Harness 完整 7 页 PPT







第二局:WorkBuddy 实测
同样的任务,我在 WorkBuddy(当前这个对话,模型已切换为 V4-Flash)里执行。
过程简单得有点平淡:加载同一套 skill(course-ppt-html + guizang),确认任务参数(主题、受众、7 页、瑞士风、跳过 IP/视频),然后直接写成一个自包含的单 HTML 文件。
75 秒,7 页,18.9KB。渲染截图验证,7 页全部正常。
WorkBuddy 完整 7 页 PPT







WorkBuddy 侧数据:1 轮直达 · 墙钟 75 秒 · 产出 18.9KB · 无沙箱/环境问题。
数据对比
Skill 加载:读齐 7 份文档 + 模板 2372 行分块读
交互轮次:2 轮 · 65 步(自动编排)
耗时:LLM 13m48s + 工具 2m26s
缓存命中:99%
输入 / 输出 Token:9.6M / 94.3K
产出文件:112KB(完整 WebGL + Motion One)
质量自检:官方校验器 + 像素级分析 + 对照实验
环境兼容:⚠️ macOS sandbox-exec 失效 → 降级完成
框架对比图

优劣势
DeepSeek Harness
优势
1. 深度自动编排:65 步工具链一气呵成(复制模板 → 写临时文件 → 程序化替换 → 校验 → 起服 → 截图验证),长任务自主推进。
2. 严谨自检:官方校验器通过 + 像素级渲染分析 + 对照实验排查根因,质量意识是行业级。
3. 一切皆插件:模型 / 工具 / 循环 / UI 全可换,二次开发自由度最高。
4. 成本控制:缓存命中 99%,长会话大量输入只按缓存读计费。
劣势
1. 慢:LLM 13m48s,是 WorkBuddy 的 10 倍以上。
2. 环境脆弱:macOS 上 sandbox-exec 被系统禁用 → 需要降级路径,对普通用户不友好。
3. 上手门槛:Node.js + API Key + 命令行 + 开发者预览版(会变)。
4. Token 消耗大:输入 9.6M tok(缓存兜底,但无缓存时成本高)。
WorkBuddy
优势
1. 快:75 秒交付,一次成稿,零编排摩擦。
2. 省心:开箱即用(持久会话 + 记忆 + 技能库已装),无沙箱/环境问题。
3. 对话式协作:跨任务延续上下文,适合日常内容创作。
4. 轻量产出:18.9KB 自包含,无冗余依赖。
劣势
1. 自检弱:无官方校验器、无像素级渲染验证,依赖人工/截图确认。
2. 复杂工程编排弱:多阶段、多工具串联的自主编排不如 Harness。
3. 可塑性有限:核心逻辑不能像 Harness 那样插件级替换。
4. 模型绑定:模型由所在环境决定(本次需手动切换为 Flash)。
谁适合用哪个
快速产出(推文配图 / 小工具 / 单页 PPT):WorkBuddy
复杂工程自动编排(大型 PPT 生产线 / 多阶段任务):Harness
学习 Agent 底层 / 二次开发:Harness
日常内容协作(创作 + 归档 + 发布):WorkBuddy
批量重复任务省钱:Harness + Flash
最后一句
这次对比最有价值的发现,不是谁快谁慢,而是两个工具根本不在同一个赛道上:
•WorkBuddy 是把「AI 干活」这件事做成对话——你说话,它干完,你验收。
•Harness 是把「AI 干活」这件事做成系统——它有手有脚,还自己检查自己。
模型已经是同一颗大脑了,真正拉开差距的,是大脑外面的那套身体。而你选哪套身体,取决于你想让它干多久的活。
我是汉堡🍔,进来和一杯,我们聊点有趣的。
本文转载自微信公众号「汉堡」,仅供学习交流使用。
觉得内容不错?我要