
折腾了一圈 Hermes我最后还是选了 WorkBuddy 来搭我的“AI 视频专家团”。说实话我不是那种见一个新工具就立马换血的人但这次的情况不太一样我独立做视频内容长期被“一个人活成一个团队”这事压得喘不过气所以当我发现可以用 AI Agent 把策划、脚本、分镜、解说、剪辑建议这些岗位全部虚拟化之后就彻底坐不住了。我最初看好的是 Hermes在 agent 框架里它的自由度非常高几乎什么都能自己定义。但实际操作下来它对一个“只想快速产出视频方案”的内容创作者来说工程成本确实有点高。后来我换到了 WorkBuddy一个把多智能体协同和工作流编排做得非常顺手的智能体工作台才真正把“AI 视频专家团”从概念跑成了每天都能用的生产线。这篇博文我会完整记录我的需求拆解、选型对比、踩坑过程以及最终用 WorkBuddy 搭起整套视频专家团的实操步骤希望能帮到正在纠结同类工具的人。1. 先说清楚我要的“AI 视频专家团”到底是什么1.1 做视频最大的痛点不是没有灵感而是没有团队我做视频内容的节奏大概是周更 2 到 3 条听起来不多但每一条背后都是完整的内容生产链路先要判断热点和选题方向再写脚本、拆镜头、写旁白后期还要想清楚什么地方加字幕、配什么 BGM、开场怎么留钩子。一个人做这些事最耗的其实不是点击鼠标的时间而是“在不同思维方式之间反复横跳”的脑力消耗。比如上午还在用创作者视角看选题下午就得切到编剧视角写脚本晚上还要变成剪辑师去思考节奏和转场。每个角色需要的知识结构、语言风格、判断标准都不一样切换几次之后人就会变得很疲惫效率断崖式下跌。所以我需要的不是“一个更强的助手”而是“一整套能各司其职的虚拟团队”。这里的核心思路就是让不同的 AI Agent 分别扮演不同岗位每个 Agent 只负责自己那一亩三分地最后再把所有人的工作成果拼接成一份完整的视频方案。1.2 用 AI Agent 把每个岗位“物化”出来把岗位“物化”成 AI Agent好处是很直接的。第一每个 Agent 可以拥有独立的上下文不会因为聊了选题就把脚本风格带偏第二每个 Agent 的能力是封装的可以像积木一样复用下次换个平台、换个品类只要替换其中一两个模块就行第三Agent 之间的协作顺序可以固化下来形成一整套流程从输入一个关键词到最后输出完整方案中间不需要我反复复制粘贴。听起来很理想但真要在工具层面落地问题就来了不是所有 Agent 平台都支持“多角色协同”。很多 AI 工具本质上只支持“单角色对话”你让它扮演策划它就只能以策划身份一直聊下去你让它同时扮演策划、编剧、分镜师它就很容易“串戏”回答一会像编剧、一会像剪辑师。所以我选型的时候特别关注一件事这个工具能不能让我很清晰地定义多个角色并且让这些角色之间有固定的协作流程。这个诉求最后成了我从 Hermes 换到 WorkBuddy 的直接原因。1.3 我挑选工具时的五个硬性标准为了不让选型变成纯粹的“新玩具体验”我先把自己的硬性标准列了出来基本上就是这几个维度维度我的具体要求原因多角色协同能独立定义多个 Agent且角色之间能按固定顺序协作视频生产天然是多工种流水线可视化编排流程要能看得见、改得动最好拖拽就能调整我不想像写代码一样维护一个消息路由技能复用每个岗位的能力要封装成可复用模块换了账号、换类目时不用从头写 Prompt模型接入能接 DeepSeek 这类中文效果好的大模型中文脚本、中文解说词是刚需调试成本出问题要容易定位最好有日志和重试机制内容生产节奏快没时间天天修链路把标准写下来之后我对 Hermes 的期待和失望就都变得很清晰了。它并不是不好而是在这几个标准里有几个关键项确实不太满足我这种“非程序员”的日常使用场景。2. 折腾 Hermes 的那一圈优点明显成本也很明显2.1 Hermes 是什么我最初为什么被它吸引先说清楚这里的 Hermes 指的是一个开源、可本地部署的 AI Agent 智能体项目不是某家大厂的那个同名模型。它最吸引我的地方一是完全本地可控二是有 WebUI三是我在社区里看到不少人用它接 DeepSeek说中文效果不错。当时我的想法是既然要搭“AI 视频专家团”那我要的应该就是一个能完全自定义的 agent 框架这样所有角色和逻辑都能攥在自己手里。我对开源工具一直有天然好感尤其是它能本地部署这点意味着我的对话记录、生成结果、角色 Prompt 都放在自己的机器里心里踏实。而且 Hermes 的社区讨论量不小搜“Hermes agent”能看到大量安装部署、扩展玩法的教程我当时觉得自己捡到宝了。但后来的实际情况是这个“宝”对有一定编程基础的朋友来说是神器对我这种“会用命令行但不想天天写代码”的视频创作者来说它的自由反而是一种负担。2.2 部署 Hermes 的实操记录第一步得先把环境准备好。Hermes 一般是基于 Python 和 Node.js 的所以得先装好这两个运行时然后拉代码、装依赖、跑起来。我当时大概操作步骤是这样的git clone https://github.com/example/hermes-agent.git cd hermes-agent pip install -r requirements.txt npm install npm run dev这几行跑完浏览器里就会出现 Hermes 的 WebUI。第一次看到界面时我是挺兴奋的因为可以直接在页面上创建 Agent、设置它的角色 Prompt还能给单个 Agent 绑定工具和模型。我当时甚至觉得这不就是我要的专家团了嘛。接着要接入 DeepSeek。具体做法是找到配置文件在模型配置那一栏填上 DeepSeek 的接口地址和 API Key然后在创建 Agent 时把模型指定为 DeepSeek。这里需要提一下DeepSeek 对中文内容的理解和生成质量在同等量级模型里是很能打的尤其是解说词这种口语化文本语感比很多英文模型默认输出要自然得多所以我在后续所有工具里都优先用 DeepSeek 当底层模型。不过装好、配好只是万里长征第一步。真正让我头皮发麻的是让多个 Agent 真正协作起来。2.3 想让 Hermes 扮演“一个团队”意味着什么理论上我可以在 Hermes 里创建六个 Agent策划、编剧、分镜师、旁白、剪辑助理、复盘分析师。但问题在于Hermes 本质上是“一个 Agent 可以调用工具”的单 Agent 运行逻辑它并没有内置一套“多 Agent 流水线”的编排机制。我想让策划 Agent 的输出自动传给编剧 Agent让编剧 Agent 的输出再自动传给分镜师这一步在 Hermes 里得自己做。这就意味着我至少要解决三件事消息路由我需要写逻辑把 A Agent 的最终输出作为 B Agent 的输入状态管理整个流程跑到中间如果某个 Agent 失败或结果不对我得知道目前整个“团队”的状态停在哪上下文传递每个 Agent 只能拿到它该看到的信息不能让它读到前面所有对话不然会串味。这些对程序员来说也许不算什么但对我来说本质上是在用代码重新实现一套业务流程管理系统。我尝试过用 Python 脚本调度 Agent也试过给每个 Agent 配系统 Prompt 让它“把结果存成文件供下一个 Agent 读取”效果都很勉强。最难受的是调试一个环节出问题整条链路的日志分散在各个终端窗口里很难快速定位是模型返回格式不对还是某个字段传丢了。2.4 放弃它当主力的四个理由我很想把 Hermes 用下去毕竟它的灵活度和社区生态都让我印象深刻但四个现实问题让我不得不重新评估。第一多角色协作的工程成本太高。我不是做软件开发而是做内容生产我不想在“让 Agent 之间握手”这件事上投入太多精力。第二本地部署的资源占用很夸张。在跑本地模型时显存和内存很快就吃满了我电脑的散热风扇全程像起飞一样。后来改接云端 API资源问题缓解了但流程编排的短板依然在。第三没有可视化工作流。所有协作关系都藏在脚本和配置里一旦隔几天没碰我再看那段代码都要重新回忆半天。第四Agent 的“记忆”和“知识库”能力偏弱。我有很多历史脚本、过往选题库和平台调性资料在 Hermes 里要维护一个长期有效的知识库需要额外做不少技术适配。所以我并不是说 Hermes 差而是它的核心定位是“技术型自定义 Agent 框架”适合有编程能力、愿意维护代码的人去研究对“快速产出视频方案”这个业务场景来说作业成本太高了。也就是在这个时候我把目光转向了 WorkBuddy。3. 转投 WorkBuddy它在“团队协作”上做对了什么3.1 WorkBuddy 到底定位在哪儿WorkBuddy 和我之前接触过的 AI 工具都不太一样。它的定位更像一个“智能体工作台”核心就是把 AI 能力变成一个个可以编排、复用、协同的工作单元。很多人会把它和 CodeBuddy 混淆其实两者的分工很明确CodeBuddy 面向的是软件开发者重点在代码生成、代码理解、工程辅助这一类场景而 WorkBuddy 覆盖面更广它允许普通用户创建面向具体业务场景的 Agent并且把多个 Agent 串成一套自动化流程。我自己用下来的感觉是如果说 Hermes 是“给开发者准备的 Agent 开发框架”那 WorkBuddy 就是“给业务人员准备的 Agent 操作系统”。它不一定给你那种“什么都能自己写”的底层自由但它把“让多个 AI 角色在一个项目里高效协作”这件事做成了开箱即用的能力。对我这种业务驱动、技术为辅的用户来说这个取舍非常划算。另外我还注意到WorkBuddy 有金融版之类的行业版本这说明它确实在往“行业工作台”的方向走。虽然我做的是视频内容和金融不太沾边但这个信息侧面也印证了它的技能包机制足够通用换一个行业场景只需要替换 Skill 和知识库就能支撑完全不同的业务。3.2 Skill把专家能力封装成“标准工位”WorkBuddy 最打动我的概念是 Skill。你可以把 Skill 理解成一个“标准工位”每个工位都写清楚了它的岗位职责、需要接收什么材料、输出什么格式的成果以及面对异常时该怎么处理。这样一来“让 AI 扮演策划”就不再是一句空泛的 Prompt而是一个可以被反复调用、独立升级的模块。我在实际使用中会把同一个 Skill 复用到多个项目里。比如“脚本 Skill”今天给科技类视频用明天给生活类视频用只需要在 Skill 内部把行业背景和语料换成对应领域的知识库就行对外暴露的输入输出接口完全不用变。这比在 Hermes 里直接写一大堆系统 Prompt 要清晰得多因为它有明确的输入输出契约管理起来非常流畅。Skill 还支持配置不同的模型、参数和引用资料。这意味着我可以让策划 Skill 用一个更偏创意的大模型让分镜 Skill 用一个更偏结构化的大模型不同的工位用不同的人在团队管理上是很自然的事。3.3 工作流让专家团按流程自动运转如果说 Skill 是“工位”那 WorkBuddy 的工作流就是把工位连起来的“生产线”。我在 WorkBuddy 里可以画一张流程连线图把策划 Skill 的输出接到脚本 Skill 的输入上再把脚本 Skill 的输出接到分镜 Skill 的输入上每一步用什么参数、要不要人工确认都可以在节点上配置。这种可视化编排带来的好处是只有真正操作过才体会得到的。以前我在 Hermes 里写代码人物关系、数据流向全得靠脑子想象而在 WorkBuddy 里整个专家团的协作关系一眼就能看全。某个环节不满意我直接改那个节点的 Skill 配置或者换一个节点就行不需要动其他部分。它还不只是简单的先后串联。我可以在流程里加分支条件比如“如果选题热度低于某个阈值就自动跳到备选选题”也可以加汇合节点把不同角色的输出汇总成一份最终报告还可以设置“人工确认”中断点比如在分镜生成完之后先让我过目再继续生成旁白。这些能力对于视频生产的品控来说非常实用。3.4 模型接入让 WorkBuddy 配上 DeepSeekWorkBuddy 本身不是一个模型它更像是一个“调度平台”所以它需要接入一个大模型作为智力引擎。我选择的是 DeepSeek主要原因还是中文内容质量。做视频脚本、解说词中文语感太重要了如果模型的中文表达能力不行后面再怎么调 Prompt 都别扭。配置过程比 Hermes 还要简单只需要在设置里找到模型接入填上接口地址、API Key、模型名称然后测试连通就行。我一般会把 DeepSeek 设置为默认模型这样创建出来的 Skill 在没有特殊指定时都会自动使用这个模型省去了每个节点单独配置的麻烦。有一点建议是如果你的视频内容涉及大量专业领域知识最好再挂一个知识库。WorkBuddy 支持在 Skill 或工作流中引用知识库我会把自己过往的爆款脚本、选题库、BGM 库都放进去让模型在生成建议时有据可依而不是全靠通用常识硬编。4. 实操从 0 到 1 搭一个“AI 视频专家团”4.1 先给专家团定岗6 个角色和交付物清单搭建之前我做的第一件事不是打开 WorkBuddy而是在纸上列了一份“岗位说明书”。我的专家团最终定了 6 个角色每个角色的职责和交付物都很明确角色核心职责主要输入交付物热点策划判断选题价值给出内容方向热点关键词、账号定位选题报告脚本编剧写出完整的视频口播文案选题报告视频脚本分镜师将脚本拆成可拍摄的镜头序列视频脚本分镜表旁白配音将脚本改写为口语化解说词视频脚本、分镜表解说词剪辑助理提供后期剪辑和包装建议分镜表、素材描述剪辑建议复盘分析师根据播放数据给出优化建议视频数据、脚本方案复盘报告这 6 个角色不是一开始就全上的。我建议你先跑通 2 到 3 个角色的最小闭环比如先做“热点策划 → 脚本编剧 → 分镜师”等流程稳定了再逐步加入其他角色。一上来就铺 6 个如果某一步出错排查范围会大很多。4.2 安装 WorkBuddy 并配置模型WorkBuddy 的安装相对友好直接从官网下载对应操作系统的安装包就行Windows、macOS、Linux 都有相应的版本。安装完成后注册账号进入工作台第一件事就是配置模型。我这里给出我常用的配置路径和参数进入“设置” → “模型接入”选择 DeepSeek填写接口地址和 API Key在 DeepSeek 开放平台获取填写默认模型名称比如deepseek-chat设置默认参数temperature0.7、max_tokens2048点击“测试连接”确认返回正常。temperature这个参数值得单独说一下。做创意型内容比如选题和脚本我会把它调到 0.8 左右让输出更有发散性做分镜表、复盘报告这类结构化内容我会调到 0.3保证输出稳定、格式准确。如果一个 Skill 同时承担多个任务我一般会在工作流的节点级别单独配置参数而不是全局统一这样更精细。4.3 创建“策划专家”Skill 的完整示例配置完模型接下来就是创建 Skill。以“热点策划”为例我会在 WorkBuddy 里新建一个 Skill然后把岗位职责、输入、输出都定义清楚。下面是一个我在实际使用时高度简化的结构示例name: 热点策划 description: 根据热点关键词和账号定位输出选题报告 model: deepseek-chat temperature: 0.8 input: hot_keywords: type: string description: 用户提供或上游传入的热点关键词列表 account_position: type: string description: 短视频账号的定位和风格说明 prompt: | 你是一名有十年经验的短视频内容策划。 请基于以下热点关键词和账号定位输出一份选题报告 - 热点关键词{{hot_keywords}} - 账号定位{{account_position}} 选题报告要求 1. 给出 3 个可行的选题方向 2. 每个方向需要包含目标观众、核心观点、情绪钩子、预计完播率 3. 至少有一个选题要有明显的差异化角度 4. 必须用中文输出且以 Markdown 表格呈现。 output: type: markdown_table fields: - 选题方向 - 目标观众 - 核心观点 - 情绪钩子 - 预计完播率你可能注意到了这个 Skill 的 prompt 写得特别具体甚至连“必须用中文输出”和“以 Markdown 表格呈现”都写进去了。这是我踩了很多次坑之后学到的经验AI 不是你肚子里的蛔虫你不把输出格式定死它就会给你各种乱七八糟的格式最后人工整理的成本反而更高。4.4 用工作流把 6 个角色串成一条生产线Skill 都建好之后下一步就是建工作流。我在 WorkBuddy 里新建了一个叫“AI 视频专家团·标准流程”的工作流然后在画布上依次放上 6 个 Skill 节点按照业务顺序连线工作流入口接收“热点关键词”和“账号定位”热点策划节点接收入口参数输出选题报告脚本编剧节点接收选题报告输出视频脚本分镜师节点接收视频脚本输出分镜表旁白配音节点接收视频脚本和分镜表输出解说词剪辑助理节点接收分镜表和素材描述输出剪辑建议复盘分析师节点可选接收最终方案和后续视频数据输出复盘报告。连线的时候WorkBuddy 会自动识别 Skill 的输入输出字段只要字段名对得上就能把上一个节点的输出直接映射到下一个节点的输入。我建议你在每个节点上开启“运行日志”开关这样每一步的输入输出都能看到一旦内容跑偏马上就能知道是哪一步出了问题。在实际运行过程中我会在“分镜师”和“剪辑助理”之间加一个人工确认点。因为分镜内容是视频质量的核心我不想让它完全无人值守地流转到后期环节。WorkBuddy 允许在节点上设置“暂停等待人工确认”这对我这种“既要效率又想把控质量”的内容创作者来说是一个很好的平衡。4.5 跑一趟全程从“一个关键词”到“一整套视频方案”配置完成后我顺手做了一次完整测试。入口只填了一个热点关键词比如“AI 视频工具测评”账号定位写的是“面向普通职场人的 AI 效率工具分享”。点了运行之后几个节点按顺序跑了起来前前后后大概几分钟就输出了完整的视频策划包包含选题报告、完整脚本、分镜表、解说词和剪辑建议。我作为内容创作人的体感是这套流程最大的价值不是“快”而是“稳定”。以前我靠人肉切换角色状态差的时候写出来的脚本和分镜会明显不在一个频道上现在流程固定下来每一个环节都由同一个经过优化的 Skill 来干质量下限被拉得很高。即便某一次输出不尽如人意我只需要改对应节点的 Skill 配置重新跑一次就行完全不用推翻重来。而且跑通一次之后我把这个工作流存成了模板。以后做任何新视频我都直接复制模板改一改输入关键词就能在同一个框架下快速产出新方案。这个“可复制性”对我来说比任何一个单次爆款都重要。5. 常见问题与排查手册看完能少踩一半坑5.1 DeepSeek 接入失败怎么办很多人第一次配置模型时会遇到连不通的情况我也遇到过。当时第一反应是代码写错了其实大部分问题都出在下面几个地方排查时先看 API Key 是否正确有没有多复制了空格然后看模型名称是不是填成了deepseek-chat之外的未知名称部分接口对模型名非常敏感再看接口地址是否填写正确我见过有人把官方文档里的示例地址原样复制结果 URL 末尾多了一个斜杠导致 404最后看账户余额或配额有时候免费额度用完了接口会直接返回鉴权失败或欠费提示。我把这些信息整理成了一张小表方便快速对照报错现象可能原因处理方式401 UnauthorizedAPI Key 错误重新复制密钥检查空格404 Not Found接口地址错误或多了斜杠对照官方文档检查 base_url模型不存在模型名称填错改为 deepseek-chat余额不足配额耗尽到开放平台充值或更换 Key超时网络或参数过大调大超时时间降低 max_tokens5.2 Skill 输出格式一直不稳这个问题在我刚开始用 WorkBuddy 时非常折磨人。我明明在 Prompt 里写了“输出 Markdown 表格”它有时候输出还是变成了大段文字有时候甚至自己加了一大段开场白比如“好的下面是我为你准备的选题报告”。后来我的解决办法是双管齐下第一在 Prompt 里用“负向指令”做约束明确告诉它“不要输出任何与交付物无关的内容不要写开场白和结束语”。第二在 Skill 的 output 定义里指定输出格式和字段让 WorkBuddy 在模型返回后做一次格式化校验不合规就重试一次。这个方法非常管用基本把输出格式问题解决了七八成。还有一个小技巧在 Prompt 的末尾给一个“输出示例”最好是带具体字段的 Markdown 表格空壳。模型的 few-shot 能力很强你把样板给它看它比看十条抽象要求都听话。5.3 上下文太长角色开始“串味”多角色协同跑久了最容易出现的问题是上下文变得越来越长然后后面的 Agent 会被前面 Agent 的输入输出带偏。比如分镜师明明只该看脚本结果把它之前生成的选题报告也一起读进去了最后分镜表里莫名其妙出现了“选题背景分析”这种不该有的内容。解决这个问题我通常有三个手段。一是在编排上做“字段裁剪”每个节点只把上游输出中真正需要用到的字段传给下一个节点而不是把整个上一步输出全部塞进去。二是在工作流中开启“上下文压缩”WorkBuddy 会自动把冗余历史摘要成一小段背景信息而不是把原始全部文本一直带着跑。三是给每个 Skill 写清楚“你只需要关注以下输入”主动隔离干扰信息。做到这三点基本不会再串味。5.4 内容看起来很全实际很空这是很多 AI 生成内容的通病。一篇选题报告看着有五个部分每个部分都有小标题但具体内容全是正确的废话。我印象最深的一次它给出的“核心观点”是“AI 工具能提升效率”这谁不知道根本没法用来指导拍摄。我后来的调整思路是在 Skill 的 Prompt 里加入“必须给出可执行、可落地的建议拒绝空泛表述”这种硬性要求同时增加一个“审核人”节点。所谓审核人其实也是一个 Skill它的工作是对前面所有输出做一轮质量检查如果发现空泛内容就返回重新生成。相当于给专家团加了一个质检岗位虽然多跑一步但内容质量提升非常明显。另外我会要求模型在产出内容时给出具体的事实、数据或案例。比如策划报告里必须写“参考某个具体账号的某条视频作为对标”剪辑建议里必须写“在哪个时间点加入哪个具体音效”哪怕模型编的例子我需要核实也比一句抽象的“增加节奏感”有价值。5.5 再说三个容易被忽略的小经验最后分享几个我实际用下来觉得特别容易被忽略的点。第一给每个 Skill 写“版本号”和“备注”。我自己经常改 Skill 配置改完过两周就忘了最初的版本是什么出了问题都不知道是从哪一次改动开始的。现在我每次调整都会在备注里写清楚改了哪里、为什么改类似代码提交记录排查问题会轻松很多。第二先用小数据测试再跑全流程。不要一上来就塞一大堆真实选题进去先用一条测试性的输入把流程节点逐个验证一遍确认每个节点的输出都符合预期再跑真实数据。省下来的调试时间远多于测试时间。第三把“人工确认节点”当成管理工具而不是妥协。有人觉得加了人工环节就不“AI”了但在我看来对于内容生产这种质量敏感的场景关键节点的人工介入恰恰是保证下限的手段。WorkBuddy 的人工确认不只是“暂停”它还能让我在确认时补充修改意见意见会作为下一阶段的输入继续往下传这比生成完之后再手动改稿要自然得多。如果你也准备折腾一套自己的“AI 视频专家团”我的建议是从小处开始别一上来就追求六七个角色的豪华阵容。先挑出两个最影响你内容质量的岗位把它做成 Skill跑通一条最简流程再去扩展其他角色。工具永远在迭代今天值得折腾的 Hermes 和 WorkBuddy明天可能又会有新的替代者但“多角色协同 可复用技能 可视化工作流”这套方法论在任何工具上都通用这才是最值得你花时间沉淀的东西。