目录
与“仅检索”评估类型相关的指标
上下文相关性(Context relevance)
上下文覆盖(需要基础事实)(Context coverage (requires ground truth))
与“检索和回复生成”评估类型相关的指标
正确性(Correctness)
完整性(Completeness)
有用性(Helpfulness)
逻辑连贯性(Logical coherence)
忠实度(Faithfulness)
引用精确性(Citation precision)
引用覆盖率(Citation coverage)
危害性(Harmfulness)
刻板印象(Stereotyping)
回避性(Refusal
亚马逊 RAG 评测指标
与“仅检索”评估类型相关的指标
一些指标与评估您的知识库检索高度相关信息的能力相关。
上下文相关性(Context relevance)
该指标与检索到的信息的质量相关。其分数是数据集内对所有提示检索到的文本分块的平均分数。上下文相关性是指检索到的文本分块与问题具有背景相关性。分数越高,平均而言,信息的背景相关性就越密切。分数越低,平均而言,信息的背景相关性就越疏远。
上下文覆盖(需要基础事实)(Context coverage (requires ground truth))
该指标与检索到的信息的质量相关。其分数是数据集内对所有提示检索到的文本分块的平均分数。上下文覆盖是指检索到的文本块涵盖了基础事实文本中提供的所有信息。分数越高,平均而言,上下文覆盖率越高。分数越低,平均而言,上下文覆盖率越低。
与“检索和回复生成”评估类型相关的指标
一些指标与评估您的知识库根据检索到的信息生成有用且适当的响应的能力相关。
正确性(Correctness)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。正确性是指准确回答问题。分数越高,平均而言,生成的响应就越正确。分数越低,平均而言,生成的响应就越不正确。
完整性(Completeness)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。完整性是指回答并解决了问题的所有方面。分数越高,平均而言,生成的响应就越完整。分数越低,平均而言,生成的响应就越不完整。
有用性(Helpfulness)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。有用性是指对问题给出全面且有用的响应。分数越高,平均而言,生成的响应就越有用。分数越低,平均而言,生成的响应就越没用。
逻辑连贯性(Logical coherence)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。逻辑连贯性是指没有逻辑漏洞、不一致或矛盾之处。分数越高,平均而言,所生成响应的连贯性就越好。分数越低,平均而言,所生成响应的连贯性就越差。
忠实度(Faithfulness)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。忠实度是指避免对检索到的文本分块产生幻觉。分数越高,平均而言,所生成响应的忠实度就越高。分数越低,平均而言,所生成响应的忠实度就越低。
引用精确性(Citation precision)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。引用精确性用于衡量正确引用的段落数。分数越高,平均而言,响应中正确的引用就越多。分数越低,平均而言,正确的引用就越少。
如果您选择使用引用精确性,那么您还应该使用引用覆盖率,反之亦然。引用覆盖率近似于引用查全率。将两者结合使用可以全面了解引用质量。
引用覆盖率(Citation coverage)
该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。引用覆盖率近似于引用查全率,用于衡量所引用段落对响应的支持程度如何。分数越高,平均而言,引用对响应的支持就越好。分数越低,平均而言,引用对响应的支持就越差。
如果您选择使用引用覆盖率,那么您还应该使用引用精确性,反之亦然。将两者结合使用可以全面了解引用质量。
危害性(Harmfulness)
该指标与所生成响应的适当性相关。其分数是数据集内对所有提示的响应的平均分数。危害性是指发表仇恨、侮辱或暴力言论。分数越高,平均而言,所生成响应的危害程度就越高。分数越低,平均而言,所生成响应的危害程度就越低。
刻板印象(Stereotyping)
该指标与所生成响应的适当性相关。其分数是数据集内对所有提示的响应的平均分数。刻板印象是指针对单个人员或一组人员给出概括性表述。分数越高,平均而言,所生成响应的刻板印象程度就越高。分数越低,平均而言,所生成响应的刻板印象程度就越低。请注意,如果同时存在大量赞美和贬低的刻板印象,分数会很高。
回避性(Refusal)
该指标与所生成响应的适当性相关。其分数是数据集内对所有提示的响应的平均分数。回避性是指对问题的规避性回答。分数越高,平均而言,所生成响应的规避性就越高。分数越低,平均而言,所生成响应的规避型就越低。