WorkBuddy 保姆级指南(1/N)
一句话:国内 Agent 产品 WorkBuddy 的上手指南,作者是正在与电子工业出版社合作录实战课的 智见 AI-大鹏。值得收的不是产品本身,而是它把「给 Agent 派活」这件事拆成了可选项:三层场景预设、Ask / Plan / Craft 三种派活力度、按任务类型选模型,以及工作目录与权限的取舍。作者自己的判断是"WorkBuddy 是国内目前功能做得最全面、也是上手门槛最低的 Agent 产品"。
文章从 WorkBuddy 左上角的功能区全景入手,厘清了助理、项目、专家、自动化四个入口的用途。助理相当于带人格与记忆的 AI 助手,可接入微信 ClawBot 实现手机遥控电脑;项目支持团队按“项目、任务”两层结构共享上下文;专家是重点模块,包含 subagent、skill、MCP 的配置,分为“专家中心”浏览和自然语言自定义两种方式,专家本质是“人设 + 方法论 + 工具链”的角色切换,专家团则是由团长自动拆解、并行执行的多专家协作体。作者将 Skill、专家、专家团的关系概括为:“Skill 是能力,专家是能力加经验,专家团是多位专家加协作流程”。
新建任务部分是全文最核心的操作解析。WorkBuddy 通过三层场景预设(职场/开发/设计 → 任务分类 → 具体任务)把用户意图选项化,降低提示词门槛。其中“深度调研”背后是名为 deep-research@cb_teams_marketplace 的 Expert Agent 包,本质是“主 Agent 编排 + 子 Agent 执行 + 多工具协作”的 Agent Team 系统。工作模式分为 Ask(问一问)、Plan(想一想)、Craft(做一做),作者建议不确定边界时用 Ask,重要或复杂任务用 Plan,明确生成文件时用 Craft。模型选择上,GLM 5.2 和 Deepseek V4 系列支持 100 万上下文窗口,GLM 5V Turbo 和 Kimi 系列真正支持多模态;其他模型的“图片输入”实际是先 OCR 再传文本。作者日常办公用 Deepseek V4 Pro,复杂开发用 GLM 5.2,视觉审查用 Kimi 2.6 或 Kimi 2.7 Code,并认为若 GLM 5.2V Turbo 推出将是完美选择。
Skill 由工具、使用说明书和最短成功路径组成,可从商店添加或用自然语言通过内置元 Skill“Find-Skills”从 SkillHub 搜索。工作目录方面,作者建议固定使用本地文件夹(如 Obsidian 仓库),并在根目录放置 AGENTS.md 文件作为系统提示词,实现跨 Agent 的静态认知共享。连接器(MCP)作者几乎不再使用,认为 API + Skill 即可替代。权限上作者选择完全开放,以避免频繁中断,并建议开完全访问时选顶级模型。最后通过一个调研 Loop Engineering 的真实任务展示了 Plan 模式下的并行调用、子 Agent 调用以及关键决策点对齐机制,并强调用好 WorkBuddy 的核心是理解功能选项背后的逻辑,而非记忆按钮位置。
正在与电子工业出版社合作录制 WorkBuddy 实战课程,并将文字版内容公开发布。他长期使用 WorkBuddy,将其作为主力 Agent 工具,在模型选择、Skill 配置、权限管理等方面形成了一套实操方法论,并明确推荐 WorkBuddy 为国内新手和知识工作者的首选 Agent 产品。
最近在和电子工业出版社合作录一门 WorkBuddy 的实战课,我会持续把文字版本分享出来。这篇文章出自其中一节「初识 WorkBuddy」。如果你正在用 WorkBuddy 或者打算用,这篇能帮你省掉大量瞎摸的时间。
先给个判断:WorkBuddy 是国内目前功能做得最全面、也是上手门槛最低的 Agent 产品。我推荐所有想尝试 Agent 的小白和知识工作者,首选它。
下面我把打开 WorkBuddy 之后你需要搞清楚的每一件事,从头到尾走一遍。
功能区全景:左上角四个入口
WorkBuddy 界面左上角是功能配置区域,核心入口都在这:助理、项目、专家、自动化。
助理,就是 WorkBuddy 版本的龙虾。有人格、有记忆,可以配置到微信的 ClawBot 里,这样以后直接从手机微信就能操控电脑。这个功能我用了段时间,确实方便:在外面跑的时候,手机发一句话,电脑上的 WorkBuddy 就开始干活了。
主要是在微信里面使用 clawbot 可以生活场景和工作场景不分开,之前想用 Hermes 总是要额外打开飞书。
项目,是团队协作能力。通过「项目」和「任务」两层结构,让团队成员共享上下文、标准与知识。如果是个人用,这个功能暂时不用管。
专家,这个是重点。里面包含了 subagent、skill、MCP 的配置。
专家分两种:「专家中心」里可以按行业分类浏览,也可以用自然语言描述创建自己的专家。这里需要调用一个内置的「设计 subagent」的 skill,叫做 expert-manager。
专家是「角色切换」机制:以「人设 + 方法论 + 工具链」让 WorkBuddy 用特定领域专家身份执行任务。专家团更进一步,由多位专家分工协作,由团长自动拆解、并行执行并整合交付。
专家、专家团、Skill 三者的关系:Skill 的本质是工具能力,让 AI 能做某件事,适用于需要 AI 具备某种工具能力时;专家是 Agent 型,本质是 AI 顾问、懂某个领域的角色,适用于有一个明确的单点问题时;专家团是 Team 型,本质是 AI 协作团队,自动拆解、并行、完整交付,适用于任务复杂、需要多角色配合时。
一句话:Skill 是能力,专家是能力加经验,专家团是多位专家加协作流程。
自动化,就是定时任务。按固定周期把预设好的提示词发给 WorkBuddy 执行,成果还能推送到小程序。逻辑简单,但用好了很省事。
以上先建立个全局意识就行,后面结合实操展开。
新建任务:每个选项该怎么选
新建任务栏是 WorkBuddy 最重要的界面。它解决一个问题:这次任务,要让哪个 Agent、带着哪些材料、用什么权限、在哪个目录里干活。
很多人一上来就输入一句话让 AI 开干,能出结果,但结果散、文件乱、权限风险高。下面逐项说清楚。
场景选择:三层预设
WorkBuddy 把上手门槛做得非常低,通过三层预设把用户的提示词门槛大大降低。
第一层,按工作场景分:职场、开发、设计。日常默认选「日常办公」就行,也能做开发任务,这是 WorkBuddy 的主推场景。
第二层,场景下的任务分类。比如选了日常办公,下面就是文档处理、数据可视化、深度调研这些。选中一个分类,底层会自动路由到某个专家团或者 skill 包,确保任务质量更高。
这里有个值得拆一下的东西:「深度研究」。
深度研究既不是单一 Skill,也不是 MCP,更不是一段 Prompt。它是 WorkBuddy Teams Marketplace 里的一个 Expert Agent 包(deep-research@cb_teams_marketplace),本质是「主 Agent 编排 + 子 Agent 执行 + 多工具协作」的 Agent Team 系统。
这个设计是 WorkBuddy 的一个亮点。它不是简单地在提示词里说"你是一个调研专家",而是真正拆成了多个子 Agent 各干各的,有编排层、有执行层。后面实操部分你会看到它并行干活的效果。
第三层,具体任务。比如竞品对比分析。选完之后输入框自动填入提示词模板,改一改就能用。
三层的作用就是把用户原本需要通过提示词表达的意图给选项化了。这是 WorkBuddy 相对于黑黢黢终端里的 CLI Agent 最大的优势:上手门槛低很多。
工作模式:Ask、Plan、Craft
三种模式,理解成三种「派活力度」。Ask / 问一问,用在只想了解、分析、确认,不希望它改文件的时候,先问清楚;Plan / 想一想,用在长线程复杂任务、需要先制定计划的时候,先让它说怎么做;Craft / 做一做,用在目标明确、可以直接生成或修改文件的时候,让它开始干活。
我的习惯:不确定任务边界时用 Ask,重要文件或复杂任务用 Plan,明确要生成文件时用 Craft。
这不是保守,是稳定。Agent 能干活,也可能理解错任务。让它先解释计划,是把控制权留在人手里。
模型选择:按任务类型匹配
第一个要关注的是上下文窗口。目前只有 GLM 5.2 和 Deepseek V4 系列支持 100 万上下文窗口,适合长线程任务或者你想长期使用某个对话 session。
多模态这块要注意:目前只有 GLM 5V Turbo 和 Kimi 系列是真正支持多模态的,也就是能像人眼一样看到并理解图片。理论上你可以给它传网页截图让它复刻,它做前端任务时也能自己截图、自己评估结果。
其他模型的「图片输入」功能,是 WorkBuddy 预制了 OCR 工具:上传图片后先 OCR 提取文本,再把文本传给模型。不是真的多模态。
每个模型后面标了积分消耗比率,数值越大消耗越多,其他意义我也不确定,简单理解就行。
综合来说,我日常怎么选模型:日常办公任务默认 Deepseek V4 Pro,能力强、上下文空间大、性价比最高;复杂开发任务、Skill 设计直接用 GLM 5.2,整体能力水平跟 Claude Opus 4.6 差不多;视觉审查任务(网页复刻、做 PPT 等)用 Kimi 2.6 或 Kimi 2.7 Code。
如果哪天 GLM 5.2V Turbo 出了,那就是最完美的选择:顶级智力 + 100 万上下文 + 视觉能力 + 高输出速度。
技能:给 WorkBuddy 拓展能力边界
Skill 大部分由三部分组成:工具本身、使用工具的说明书、做成功某件事的最短成功路径。
举个例子。最近 Seedance 2.5 很火,如果想让 Agent 制作宣传视频,就得设计一个 Skill:包含 Seedance 2.5 的 API 和 Key,让它有调用权限;说清楚 API 怎么用;再把宣传视频制作的方法论打包进去。这样就能全流程制作出高质量视频。
用 Skill 有两种方式:点技能按键直接选,或者在输入框打斜杠输入前几个字母匹配。
初始状态下 WorkBuddy 已经内置了几个官方 Skill,确保高频场景不额外配置也能用。
想加新 Skill 也简单,两种方法。方法一:从 Skill 商店添加。商店里的 Skill 基本是 WorkBuddy 官方一对一邀约上传的,安全和质量没问题。比如卡兹克开源的「卡兹克公众号写作」,点个加号就加了。方法二:用自然语言让 WorkBuddy 帮你找。直接在输入框说需求就行。底层原理是 WorkBuddy 内置了一个叫 Find-Skills 的元 Skill,通过关键词去 SkillHub(腾讯官方的 Skill 社区)上搜索。
还有个细节:WorkBuddy 把一些热门 Skill 预制到了本地文件夹里,查找时先从本地找,更快。有些 Skill 需要特定网络环境安装,预制到本地就绕过了这个问题。
工作目录:先给 Agent 一个干净房间
新建任务时,默认不会选择本地工作空间。
不选的话,系统每次会自动划定一个临时目录,命名规则是 WorkBuddy/YYYY-MM-DD-HH-MM-SS。
我的建议是:下达任何任务之前,提前选好自己本地的文件夹作为工作空间。我自己是把所有任务都放到 Obsidian 仓库里,这样个人上下文归集起来,以后 Agent 可以随时调用。
打开新文件夹作为工作空间时,首次交互会触发初始化:WorkBuddy 会问你一些问题来了解你,形成自己的身份认知。
固定使用一个文件夹还有个好处:你可以在根目录放一个 AGENTS.md 文件。目前除了 Claude Code 不支持,其他任何 Agent 都支持这个文件作为系统提示词,任何对话中都会初始加载。所以在这个文件夹里跑的 Agent,比如 Claude Code、比如 Codex,都会加载这个文件来获得对你的静态认知和运行规则。
独立工作目录的好处:材料清楚、文件不乱、风险可控。
连接器:能不用就不用
连接器本质就是 MCP,用于把 WorkBuddy 和外部服务连起来:邮箱、腾讯文档、乐享知识库、会议工具等。
去 WorkBuddy 商店一键添加,简单授权就能用。比如授权完乐享之后,WorkBuddy 就能读取、编辑、管理乐享知识库的内容。
但我的判断是:现在任何 MCP 能实现的功能,几乎都可以通过 API + Skill 实现。不建议折腾 MCP,占用上下文空间大,我现在已经几乎不用了。
权限:我的选择是完全开放
WorkBuddy 能读写文件、整理目录、生成文档,也可能执行脚本或调用外部程序。两种权限模式:默认权限下,危险操作(比如删文件)会被拦截,系统发权限申请让你确认;完全访问则跳过所有权限申请,确保任务连贯性。
我是任何 Agent 产品都默认开放最高权限。原因很简单:Agent 任务通常时间很长,开默认权限会频繁弹出权限申请,而大多数权限申请对普通用户来说根本看不懂。我选择完全相信 Agent,到现在没遇到过误删文件的情况。模型智力越来越强,这种极端边界情况会越来越少。
不过有一点:开完全访问权限时,建议选最顶级的模型,比如 GLM 5.2。选个垃圾模型,它真有可能做出比较呆的事情。
跑一个真实任务:让 WorkBuddy 调研 Loop Engineering
还是用我的 Obsidian 仓库作为工作空间,日常办公模式,选深度调研任务类型。让 WorkBuddy 调研最近火爆的 Loop Engineering,产出一个白皮书。
这是个比较长线程的复杂任务,所以我开了 Plan 模式。
任务一开始,WorkBuddy 就体现出了非常强的并行能力:同时调用多个工具,还额外调了一个 Explorer 的 subagent。
我不确定是 WorkBuddy 的 Harness 工程做得好,还是 GLM 5.2 这个模型本身就强,大概率是两者综合的效果。
Plan 模式的好处是在关键决策点,WorkBuddy 会用 Ask user question 工具向你提问,而且是选择题,确保跟你对齐需求。
计划产出一个 Markdown 格式的详细方案,你审核没问题后点「确认计划」,WorkBuddy 自动退出 Plan 模式进入 Craft 模式开始执行。
有新产物的时候它会在右侧直接打开。有时候不打开也没关系,直接去工作空间里按路径找就行。
用好 WorkBuddy 的核心不是「会用每个按钮」,是知道每个功能选项背后意味着什么。界面会更新,按钮会变化,但「给 Agent 派活」这件事的逻辑是稳定的。