十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

cwc-workshops评测驱动开发方法论:从Vibed到Measured的Agent迭代范式

cwc-workshops评测驱动开发方法论:从Vibed到Measured的Agent迭代范式 cwc-workshops评测驱动开发方法论从Vibed到Measured的Agent迭代范式【免费下载链接】cwc-workshops项目地址: https://gitcode.com/GitHub_Trending/cw/cwc-workshops如果你正在用大模型构建 Agent却发现改提示词全靠感觉、效果好坏无法量化那么cwc-workshops中的「评测驱动 Agent 开发」工作坊值得精读。它是 Anthropic 官方 Code with Claude 工作坊的开源材料核心就一件事先给 Agent 建一套可量化、可复现的评测Eval体系再让每一次迭代都有分数说话——从 Vibed凭感觉走向 Measured有数据。 什么是评测驱动开发传统做法是改完看一眼感觉不错就上线。评测驱动开发Eval-Driven Development则反其道而行先写测试集准备一组固定任务类似单元测试用例再建评分器用确定性代码 LLM 裁判两层机制给输出打分最后改 Agent每次改动提示词、工具或模型都跑一遍评测看分数变化 一句话总结改 Agent 之前先让 Agent 能被考试。 项目全景8 个 Workshop 各管一摊cwc-workshops 仓库收录了 8 个完整工作坊评测驱动开发是其中最成体系的一个Workshop主题eval-driven-agent-development/⭐ 评测驱动开发PPT 生成 Agent 的量化迭代agent-decomposition/用 Skills 与 MCP 组合多 Agent 系统agent-battle/45 分钟 Agent 配置竞赛agents-that-remember/为 Agent 叠加记忆能力ship-your-first-managed-agent/从零交付第一个托管 Agentproduction-ready-agent/多 Agent 并购研究团队Deal Deskhow-we-claude-code/AI 辅助产品开发的三阶段流程rightmodel/用评测选择性价比最优的模型本文章聚焦 ⭐ 标记的评测驱动开发工作坊。 评测闭环三件套任务集 双层评分 一键跑分1️⃣ 固定测试集5 个跨领域任务评测的第一块基石是 tasks.json——5 个互不相关的 PPT 生成任务薪资谈判、微塑料、酸面团烘焙、TikTok 涨粉、Transformer 原理。任务集固定不变保证每次分数可比这正是Measured的前提。2️⃣ 双层评分器代码判硬指标LLM 判审美评分器定义在 src/graders.ts分两层、共 12 项指标第一层确定性代码评分解析 .pptx 的 XML零成本、可复现指标检查什么Produced result是否产出了合法的 .pptx 文件Slide count / Cluttered slides页数是否正确、单页图形是否超过 20 个杂乱风险Text-heavy slides是否整页堆满文字Emoji countAI 味浓不浓——是否乱撒 emojiSlides with image每页是否含真实图片第二层LLM-as-Judge把幻灯片渲染成 JPG交给视觉模型按 0-5 分打分text、image、layout、color、title-body coherence 五个维度裁判提示词与结构化打分逻辑见 src/graders/judge/judge.ts 和 src/graders/judge/layout-judge.ts。⚖️ 双层设计的妙处代码判客观事实字号、形状数、emoji 数绝不冤枉人LLM 判主观体验配色、留白、图文协调各干各的活。3️⃣ 一键跑分三步命令评测运行器 src/eval-runner.ts 把生成 → 渲染 → 评分串成流水线日常只需三条命令npm run create-slides -- technology # Agent 生成 PPT npm run render -- technology # PPT 渲染成逐页 JPG npm run eval -- --all # 全量评分输出记分卡首次运行加--baseline记录基线分之后每次评测都会自动显示相对基线的增量——改一处提示词涨了几分一目了然。 五轮迭代实录提示词杠杆 vs 模型杠杆solutions/ 目录保存了工作坊沉淀的 4 个进化版本加上 resources/agent.yaml 的朴素基线构成一条完整的迭代路径轮次文件改了什么对应评测目标00 基线agent.yaml朴素提示词给主题就生成 PPT记录基线分01 排版01-polish.agent.yaml字号层级标题 36-44pt、单页 ≤50 词、禁用AI 味装饰线文本密度、emoji 数02 图表02-diagram.agent.yaml每页必须插入 matplotlib 真实图片纯文字色块不合格图片出现率、image 裁判03 QA 循环03-qa-loop.agent.yaml强制自查渲染成图 → 逐页找重叠/溢出 → 修复 → 再渲染验证版式裁判、对齐与边距04 换模型04-model-swap.agent.yaml提示词退回朴素版只把模型换成更强的 Opus回答改提示词还是换模型每一轮只动一个变量然后跑npm run eval -- --all看分数——这正是每次改动都被测量的字面含义。其中 03 轮最值得品味提示词里写了一句假设一定有问题你的工作是找到它们Assume there are problems. Your job is to find them把 QA 从确认步骤变成找 bug。这种让 Agent 自己当自己的评审的模式是评测思想向内延伸到 Agent 工作流的高阶玩法。 新手上手三步走环境准备Node.js ≥ 22、antCLI、Docker 与 Anthropic API Key详见 eval-driven-agent-development/README.md部署 Agent用ant beta:agents create把 YAML 定义推到云端环境再跑通一次npm run eval -- --all --baseline开始迭代只改 resources/agent.yaml 的 system prompt每改一处就跑一次评测对比增量 小提示CLAUDE.md 里写明了仓库约定——solutions/是参考答案迭代时应把改动落到resources/agent.yaml上评测运行器本身不要动。✅ 带走这份方法论原则在本项目中的体现固定测试集5 个跨领域任务永不改动分数永远可比双层评分代码判硬指标 LLM 判审美各取所长单变量迭代每轮只动一个变量排版/图表/QA/模型基线 增量--baseline让每次改动看得见答案外置评分器与被测 Agent 解耦谁都可以复用当你能对 Agent 说这版比上一版版式裁判高 0.4 分、emoji 数降到 0而不是感觉这版更顺眼时你的 Agent 开发就真正从 Vibed 跨进了 Measured。【免费下载链接】cwc-workshops项目地址: https://gitcode.com/GitHub_Trending/cw/cwc-workshops创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表