
Superpowers 如何用 drill 快速运行技能行为 eval 并指定被测代理【免费下载链接】superpowersAn agentic skills framework software development methodology that works.项目地址: https://gitcode.com/GitHub_Trending/su/superpowers如果你要给 Superpowers 的某个技能如 test-driven-development、writing-plans写行为验证需要驱动真实的 LLM 会话跑一遍场景并拿到 pass/fail 结论而不是只检查插件基础设施代码。Superpowers 的技能行为 eval 由 drill 承担它是一个 Python 评测框架通过 tmux 驱动真实会话由 LLM actor 扮演用户、LLM verifier 判定技能合规性按场景输出通过/失败。drill 框架本体不在本仓库内而是从 superpowers-evals Contributing 一节与 docs/testing.md 均指向evals/README.md做详细 setup。本文只覆盖一条最短路径装好框架、跑一个指定场景、用-b参数指定被测代理并判断结果。准备条件把 drill 框架放进 evals/ 并装好环境drill 的完整源码drill/Python 包、scenarios/场景 YAML、backends/后端配置、fixtures/测试夹具位于evals/目录Python 包名仍叫drill所以命令都是uv run drill ...。前提仓库中已存在evals/目录来源是 superpowers-evals 的克隆evals/README.md有具体安装说明本机可用uvdrill 使用 Python 3.11 uv 工具链至少有一个被测代理的凭据跑claude后端需要ANTHROPIC_API_KEY跑codex后端需要OPENAI_API_KEY见 docs/superpowers/specs/2026-05-06-lift-drill-into-evals-design.md 中 README 更新要求唯一必须的环境变量是ANTHROPIC_API_KEY或OPENAI_API_KEY/ Gemini 认证。进入evals/后同步依赖cd evals uv sync --extra dev export ANTHROPIC_API_KEYsk-...uv sync只做依赖安装不触发任何 LLM 调用sk-...替换为你自己的 Anthropic API key。SUPERPOWERS_ROOT不需要手动导出drill 的drill/cli.py在启动时会把它默认设为evals/的父目录即 superpowers 仓库根只有当你要针对另一个 superpowers checkout 跑 drill 时才需要显式覆盖这个变量。装完可以先确认框架可用cd evals uv run drill list预期输出为场景名列表且不再报缺少SUPERPOWERS_ROOT的错误。运行单个技能行为场景并指定被测代理指定被测代理靠-b参数它选择backends/下对应的一份 YAML 配置claude*.yaml、codex.yaml、gemini.yaml等配置里定义该代理 CLI 的启动参数与所需环境变量例如 claude 系后端会把${SUPERPOWERS_ROOT}插值进--plugin-dir参数。drill 支持 Claude Code、Codex、Gemini CLI 后端近期提交还加入了 OpenCode 与 Copilot CLI见设计文档背景一节。跑一个场景的完整命令docs/testing.md 给出的 quick startcd evals uv run drill run triggering-test-driven-development -b claude第一个位置参数是场景名场景文件集中在evals/scenarios/*.yaml-b claude即指定被测代理为 Claude Code换用 Codex 或 Gemini CLI 就传对应后端名。这个场景名对应的技能行为验证包括triggering-skill系列覆盖 dispatching-parallel-agents、executing-plans、requesting-code-review、systematic-debugging、test-driven-development、writing-plans 等技能以及mid-conversation-skill-invocation、sdd-go-fractals、sdd-svelte-todo、worktree-creation-under-pressure等更完整的场景可用uv run drill list查看当前全部场景。跑完后看最后几行输出即可判断uv run drill run triggering-test-driven-development -b claude 21 | tail -3文档示例输出设计文档中作为冒烟检查的预期值claude: 1 passed, 0 failed, 0 errors上面是文档示例结果格式为后端名: N passed, M failed, K errors具体场景的通过数取决于场景内断言数量不要把这个数字当成固定预期。0 failed 且 0 errors 表示该场景在你的代理上通过。验证框架本身没跑偏跑场景之外drill 自带 pytest 套件验证后端配置、路径默认值等框架行为。改动evals/内任何文件后先用它确认框架正常再跑真实场景cd evals uv run pytest预期全部通过。设计文档把pytest 通过 一个便宜场景通过一起作为从新位置验证 drill 的两道检查两者都绿才说明环境可用。限制与注意事项drill 场景较慢每个 3-30 分钟且跑的是真实 LLM 会话消耗 API 配额目前不接入 CIdocs/testing.md所以本地按需单跑场景不要无差别全量刷。行为类测试drill与插件基础设施测试tests/下的 bash/node/python 测试分工不同drill 只判技能行为不覆盖tests/里的断言如 commit 计数、token 遥测、Haiku 专项、多轮测试后者仍走各目录的run-*.sh或npm test见 docs/testing.md 的 Plugin tests 一节。跑claude后端时--plugin-dir指向的 superpowers checkout 由SUPERPOWERS_ROOT决定默认即evals/的父目录如果你验证的是另一份 checkout 的技能改动显式export SUPERPOWERS_ROOT/path/to/superpowers覆盖它。场景跑通且pytest通过后框架层面的下一步见 docs/superpowers/plans/2026-05-06-lift-drill-into-evals.md 与evals/README.md要为某个技能新增场景则按 skills/writing-skills/SKILL.md 的技能测试流程编写。【免费下载链接】superpowersAn agentic skills framework software development methodology that works.项目地址: https://gitcode.com/GitHub_Trending/su/superpowers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考