十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

评测prompt效果

评测prompt效果 可以把评测拆成三件事是否遵守提示词要求是否忠实于原始文档周报本身是否完整、清晰、可用不要只用“整体看起来不错”这种单一主观评分。更可靠的方法是规则检测 LLM 裁判 人工抽检。一、先把提示词转成可检查项假设提示词是根据文档生成周报包含本周完成、问题风险、下周计划不超过 800 字不得编造使用简洁正式的中文风险必须注明负责人。可以拆成维度检查项检查方式结构遵循是否包含三个指定章节程序规则 / LLM长度遵循是否不超过 800 字程序规则内容忠实事项是否都能在文档中找到依据LLM 引用核验信息完整文档中的重要事项是否被覆盖LLM风险格式每项风险是否包含负责人程序规则 / LLM表达风格是否简洁、正式、像周报LLM / 人工无编造是否出现原文没有的人名、数字、日期、结论LLM 实体比对关键点是先把自然语言提示词原子化。每条要求都要变成一个尽量独立、可以判定“通过/不通过”或打分的检查项。推荐评分体系可以采用 100 分制1. 提示词遵循度30 分检查格式和章节是否符合要求字数、语言、语气是否符合要求是否遗漏提示词中的明确指令是否违反禁止项是否满足特殊格式要求例如表格、负责人、时间范围其中“硬性要求”建议直接做门槛判断。例如超过字数不合格缺少必需章节不合格使用了禁止内容不合格2. 事实忠实度30 分把周报中的每个事实性陈述拆出来检查能否被原文支持。可以使用事实忠实度 有原文依据的事实数量 / 周报中的事实总数重点检查人名日期数字项目状态完成情况原因和结论风险判断下周计划“下周计划”比较特殊如果原文没有计划但模型自行推导了计划应标为无依据推断除非提示词明确允许模型给建议。3. 关键信息覆盖率20 分忠实度高不代表周报好因为模型可能只写原文中少量安全信息。先从原文提取“应当进入周报的关键事实”再检查生成结果覆盖了多少信息覆盖率 已覆盖的关键事实数量 / 原文中的关键事实总数例如原文中有完成 5 个事项2 个延期事项1 个高风险问题3 个下周计划生成结果只写了完成事项即使没有编造覆盖率也很低。4. 周报质量15 分建议评价信息是否按主题归类是否突出结果而不是流水账是否简洁是否存在重复风险和计划是否具体、可执行阅读者能否快速理解本周状态5. 可追溯性5 分理想情况下让生成结果中的关键事项附带来源例如- 完成支付接口联调。[来源文档第 3 节]最终展示给用户时可以隐藏来源但评测阶段保留引用可以显著提高事实核验可靠性。推荐的自动评测流程原始文档 ↓ 提取关键事实和证据 ↓ 解析提示词生成检查清单 ↓ 生成周报 ↓ 规则检测字数、章节、格式、必填字段 ↓ LLM 逐项判断忠实度、覆盖率、风格、可用性 ↓ 人工抽检与校准建议不要直接让一个 LLM 回答“这篇周报打多少分”。更可靠的方式是分步骤从提示词提取约束清单。从原文提取关键事实。从周报提取事实性陈述。逐条验证事实是否有来源支持。逐条检查关键事实是否被覆盖。最后计算总分。LLM 裁判提示词示例你是周报质量评测员。 输入包括 1. 原始文档 2. 生成周报时使用的提示词 3. 待评测周报 请严格基于原始文档进行评测不要使用外部知识。 评测步骤 一、提示词遵循 - 将提示词拆解成独立要求。 - 对每项要求判断通过、部分通过、不通过。 - 给出对应证据。 二、事实忠实度 - 提取周报中的所有事实性陈述。 - 对每条判断 - supported原文明确支持 - partially_supported原文部分支持但表述扩大或过度确定 - unsupported原文没有依据 - contradicted与原文冲突 - 引用原文证据。 - 不得因为内容“看起来合理”就判定为 supported。 三、信息覆盖率 - 提取原始文档中的关键完成事项、问题、风险和计划。 - 检查周报是否覆盖。 - 区分关键遗漏和次要遗漏。 四、表达质量 - 评价结构、简洁性、重复、可读性和行动明确性。 输出必须为 JSON { instruction_checks: [ { requirement: , status: pass|partial|fail, evidence: } ], claims: [ { claim: , status: supported|partially_supported|unsupported|contradicted, source_evidence: } ], missing_key_facts: [], scores: { instruction_following: 0, faithfulness: 0, coverage: 0, writing_quality: 0, traceability: 0, total: 0 }, fatal_issues: [], summary: }让裁判输出 JSON方便批量统计、排序和回归测试。如何验证评测本身是否可靠LLM 裁判也会误判因此需要建立一小批人工标注集。建议准备 50200 个样本并人为制造不同类型的问题缺少章节超出字数编造数字把“进行中”写成“已完成”漏掉重大风险添加原文没有的下周计划负责人写错时间范围写错内容正确但过于冗长格式正确但事实错误由至少两名人工评审独立评分再比较自动评测结果硬性要求准确率幻觉识别准确率关键遗漏识别率与人工总分的相关性不同裁判模型之间的一致率对于“是否编造”“是否违反硬约束”这类关键指标应关注精确率和召回率而不只是总分。实际落地建议最实用的质量门槛可以设置为硬性格式检查全部通过 事实忠实度 95% 关键信息覆盖率 85% 不存在 contradicted 事实 不存在重大风险遗漏 综合得分 80同时保留分项结果。因为同样是 80 分一个可能是内容很好但格式略有问题另一个可能是格式完美但编造了事实。这两类结果的风险完全不同不应该只看综合分。最终建议把指标分为两层准入指标无事实冲突、无严重编造、满足硬性提示词要求。质量指标覆盖率、简洁度、结构、可读性、行动明确性。事实正确性应该拥有最高优先级不能被文笔或格式得分抵消。
返回列表