十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SuperClaude Framework Self Review Agent 实战指南:实现后自检、证据校验与 Reflexion 错误学习

SuperClaude Framework Self Review Agent 实战指南:实现后自检、证据校验与 Reflexion 错误学习 SuperClaude Framework Self Review Agent 实战指南实现后自检、证据校验与 Reflexion 错误学习【免费下载链接】SuperClaude_FrameworkA configuration framework that enhances Claude Code with specialized commands, cognitive personas, and development methodologies.项目地址: https://gitcode.com/gh_mirrors/su/SuperClaude_Framework本指南以 SuperClaude Framework 的 Self Review Agent位于 plugins/superclaude/agents/self-review.md源码同版位于 src/superclaude/agents/self-review.md为核心讲解如何在每次实现波次implementation wave结束后用四项强制自检问题确认交付物是否达到生产就绪标准并通过 Reflexion 模式沉淀错误经验防止复发。读完本文你将掌握一套可复制的实现后验证 教训沉淀闭环流程以及它在框架源码SelfCheckProtocol、ReflexionPattern与 pytest 插件中的落地实现。Self Review Agent 的角色定位在 SuperClaude Framework 中Self Review Agent 是一个post-implementation validation and reflexion partner实现后验证与反思伙伴类别归属为quality。它的触发时机非常明确在一次实现波次implementation wave结束后立即启用用于确认结果是否生产就绪production-ready并捕获本次实现产生的经验教训。它与 PM Agent见 plugins/superclaude/agents/pm-agent.md形成互补PM Agent 负责把实现过程中的模式、决策与错误沉淀为知识库而 Self Review Agent 专注于验收环节——核实 SuperClaude Agent 声称完成的测试与工具链结果输出简洁的清单式报告并把残余风险与后续动作交还给 SuperClaude Agent 进行最终用户回复。核心职责一核实测试与工具链证据Self Review Agent 的首要职责是Verify tests and tooling reported by the SuperClaude Agent即逐条核对 SuperClaude Agent 上报的测试和工具执行结果而不是照单全收。这里的核心理念是证据优先一个声称测试通过的结论必须附带实际的命令与输出否则不能视为有效证据。这一要求在框架源码中被硬编码为校验规则详见下文源码级支撑一节SelfCheckProtocol._check_tests_passing()会同时要求tests_passedTrue与test_output非空且输出中必须包含passed、OK、✓、✅等通过标志仅有断言而无真实输出时直接判定为不通过。核心职责二运行四项强制自检问题这是 Self Review Agent 的方法论骨架。在原文档 plugins/superclaude/agents/self-review.md 中规定了四项强制问题它们与源码 src/superclaude/pm_agent/self_check.py 中SelfCheckProtocol注释里记载的 The Four Questions 一一对应但在表述上略有差异Agent 文档侧重验收视角源码侧重防幻觉视角维度Agent 文档的四问源码SelfCheckProtocol的四问测试Tests/validation executed?附带命令与结果Are all tests passing?要求展示真实结果边界Edge cases covered?列出有意遗漏项No assumptions without verification?假设必须核对官方文档需求Requirements matched?回连验收标准Are all requirements met?逐条对比 ✅/❌收尾Follow-up or rollback steps needed?Is there evidence?测试结果、代码变更、lint/类型检查从源码结构看这四项问题被映射为validate()中的四次独立检查# 摘自 src/superclaude/pm_agent/self_check.py#L64-L107结构示意 issues [] # Question 1: Tests passing? if not self._check_tests_passing(implementation): issues.append(❌ Tests not passing - implementation incomplete) # Question 2: Requirements met? unmet self._check_requirements_met(implementation) if unmet: issues.append(f❌ Requirements not fully met: {, .join(unmet)}) # Question 3: Assumptions verified? unverified self._check_assumptions_verified(implementation) if unverified: issues.append(f❌ Unverified assumptions: {, .join(unverified)}) # Question 4: Evidence provided? missing_evidence self._check_evidence_exists(implementation) if missing_evidence: issues.append(f❌ Missing evidence: {, .join(missing_evidence)})其中证据维度进一步细化为三类硬性要求见_check_evidence_exists()src/superclaude/pm_agent/self_check.pytest_results测试实际输出code_changes变更文件清单validationlint、类型检查、构建等静态校验结果。三者缺一即记为Missing evidence问题。测试夹具 tests/conftest.py 中的sample_implementation展示了满足全部四问的完整数据结构含tests_passed、test_output、requirements、requirements_met、assumptions、assumptions_verified、evidence、status而failing_implementation则演示了典型的失败形态测试未过、需求仅完成 1/3、假设未全部核实、证据为空、状态却声称 complete。核心职责三汇总残余风险与缓解思路四项自检全部通过并不意味着零风险。Self Review Agent 还需Summarize residual risks and mitigation ideas——把明知存在但不影响本次验收的风险显式列出来并给出缓解方向。例如原文档报告示例中的⚠️ Edge cases: concurrency behaviour not exercised就属于此类并发行为未被覆盖需要在后续迭代中补测。这对应报告中的⚠️级条目与✅级已通过和级后续动作共同构成三层状态标注。在源码侧SelfCheckProtocol用标注幻觉告警、❌标注硬性问题见format_report()src/superclaude/pm_agent/self_check.py两者语义层级互补。核心职责四记录 Reflexion 模式避免同类缺陷复发当缺陷出现时Self Review Agent 要Record reflexion patterns让 SuperClaude Agent 后续不再重复犯错。这正是框架中ReflexionPattern类src/superclaude/pm_agent/reflexion.py的职责把错误转化为可检索、可复用的知识。ReflexionPattern的工作流程分为两条路径命中已知错误0 token 成本构造错误签名error_type | 去数字化的 error_message 前 100 字符 | test_name先尝试 mindbase 语义检索http://localhost:18003/api/search相似度阈值 0.73 秒超时失败自动降级再回退到本地 JSONL 文件做词重叠匹配默认阈值 0.7见_search_mindbase()与_search_local_files()。新错误1-2K token 调研成本调用record_error()将错误信息追加写入docs/memory/solutions_learned.jsonl追加式日志若带root_cause或solution分析还会生成结构化错误文档docs/mistakes/[test_name]-YYYY-MM-DD.md见_create_mistake_doc()src/superclaude/pm_agent/reflexion.py。该文档固定包含七个板块## ❌ What Happened → 现象描述 ## Root Cause → 根本原因 ## Why Missed → 为何此前未被发现 ## ✅ Fix Applied → 实际修复方案 ## ️ Prevention Checklist → 防复发清单 ## Lesson Learned → 经验教训仓库中已有真实产出可对照docs/memory/solutions_learned.jsonl120 行 JSONL 记录如{error_type: ConnectionError, solution: Ensure database is running and credentials are correct, timestamp: ...}与 docs/mistakes/test_database_connection-2026-03-22.md按上述模板生成的错误记录。get_statistics()还能统计total_errors、errors_with_solutions与solution_reuse_rate用于量化知识库的学习效果。操作流程How to Operate原文档给出了四步操作法这里结合框架源码补充每一步的落地细节Step 1审查任务摘要与实现 diffSuperClaude Agent 会提交任务摘要task summary与实现差异implementation diffSelf Review Agent 据此还原声称做了什么。Step 2确认测试证据缺失则要求重跑这是先证据后放行的硬门槛。对应源码中_check_tests_passing()的两条规则tests_passed必须为True且test_output必须含真实通过标志。单测 tests/unit/test_self_check.py 中的test_check_tests_passing_with_output明确验证了有输出通过 / 无输出判失败两种分支。Step 3输出简短的清单式报告原文档报告模板原文如下字段格式可照搬✅ Tests: uv run pytest -m unit (pass) ⚠️ Edge cases: concurrency behaviour not exercised ✅ Requirements: acceptance criteria met Follow-up: add load tests next sprint在源码侧format_report()提供程序化版本通过时输出✅ Self-Check PASSED - Implementation complete with evidence失败时逐条列出❌问题项。Step 4剩余问题给出定向行动建议When issues remain, recommend targeted actions rather than reopening the entire task——只针对具体问题开处方而不是推翻整个任务重来这保证了修复成本可控。源码级支撑7 个幻觉红旗检测SelfCheckProtocol除了四问校验还内置了一套幻觉检测机制这是它区别于普通 checklist 的关键。HALLUCINATION_RED_FLAGS常量与_detect_hallucinations()src/superclaude/pm_agent/self_check.py实现了 7 类红旗的自动识别声称测试通过但未附输出tests_passedTrue且test_output为空声称一切正常但无任何证据statuscomplete且evidence为空测试失败却声称实现完成statuscomplete且tests_passedFalse跳过错误信息skip error messages忽略警告ignore warnings——4、5、6 合并为存在 errors/warnings 却标记 complete隐瞒失败hide failures使用不确定措辞描述中出现probably、maybe、should work、might work。对应单测覆盖齐全tests/unit/test_self_check.py 中的test_detect_hallucinations_tests_without_output、test_detect_hallucinations_complete_without_evidence、test_detect_hallucinations_complete_with_failing_tests、test_detect_hallucinations_ignored_errors、test_detect_hallucinations_uncertainty_language分别验证上述场景。测试与工具链集成pytest 插件如何挂钩自审框架通过 pytest 插件把自审与反思流程嵌入日常测试src/superclaude/pytest_plugin.py入口注册于 pyproject.toml 的pytest11注册自定义 markerself_check要求证据的实现后验证、reflexion错误学习与预防、confidence_check执行前置信度评估、complexity(level)提供 fixturesself_check_protocol、reflexion_pattern、token_budget、pm_context等测试中可直接注入使用pytest_runtest_makereport钩子带reflexionmarker 的测试失败时自动构造error_info测试名、文件、异常类型、消息、traceback并调用reflexion.record_error()实现测试失败即自动沉淀教训。集成测试示例可见 tests/unit/test_self_check.py 的test_self_check_marker_integration与 tests/unit/test_reflexion.py 的test_reflexion_marker_integrationtests/unit/test_reflexion.py 的test_reflexion_with_real_exception则演示了真实异常如ZeroDivisionError下的完整记录路径。运行示例命令为uv run pytest -m unituv 环境或pytestpip 环境需先安装本项目。与相关 Agent / 命令的协作边界Self Review Agent 并非孤立运作。在原文档约束下它把结果交还给 SuperClaude Agent 做最终用户回复即它只做验收与证据核验不直接向用户汇报。与之配套的还有/sc:reflect命令plugins/superclaude/commands/reflect.md提供--type task|session|completion三种反思模式依赖 Serena MCP 的think_about_task_adherence、think_about_collected_information、think_about_whether_you_are_done等工具做任务贴合度、信息完整性与完成度评估可作为 Self Review Agent 验证环节的深度分析后端PM Agentplugins/superclaude/agents/pm-agent.md其 PDCA 周期中的 Check 阶段think_about_whether_you_are_done与 Act 阶段错误沉淀到docs/mistakes/、成功模式沉淀到docs/patterns/与 Self Review Agent 的 reflexion 记录职责形成互补。最佳实践总结结合原文档与源码可将 Self Review Agent 的用法浓缩为以下要点时机固定每次实现波次结束立即启用不拖延、不跳步证据硬约束测试必须附命令与输出lint/类型检查等 validation 证据缺一不可杜绝凭感觉放行四问全过才放行测试、需求、假设、证据四项校验任何一项缺失都标记为未完成主动暴露残余风险用⚠️显式列出未覆盖的边界与缓解方向而非隐藏错误即知识缺陷出现时立即通过record_error()写入solutions_learned.jsonl与mistakes/文档让错误签名在未来命中时零成本复用解决方案定向修复剩余问题只给针对性动作不整单重开控制修复成本。这套实现后自检 证据校验 反思沉淀的闭环正是 SuperClaude Framework 把 AI 编码助手从能干活推进到可验收、可复盘、可进化的工程化基础设施之一。【免费下载链接】SuperClaude_FrameworkA configuration framework that enhances Claude Code with specialized commands, cognitive personas, and development methodologies.项目地址: https://gitcode.com/gh_mirrors/su/SuperClaude_Framework创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表