拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RAG知识库 B评估实验结果报告

RAG知识库 B评估实验结果报告

数据库 B实验结果报告

第一章 实验概述

1.1 实验背景与目标

本实验面向论文检索场景,评估不同检索策略在给定语料库(共171 篇学术文献)上的检索质量。语料按主题分为三类:漏洞修复(20 篇)、漏洞检测(93 篇)、LLM 安全(58 篇),三类论文数之和恰为 171 篇,构成完整的测试语料。

1.2 测试查询

测试集包含 3 条英文查询,分别与上述三个主题类别一一对应:

序号测试查询(英文)对应主题类别相关文献数
1State-of-the-art source code automatic repair methods漏洞修复(20篇)20
2Summarize automated vulnerability mining frameworks漏洞检测(93篇)93
3Future trends of LLM security researchLLM安全(58篇)58

1.3 评估指标定义

  • 检索正例:在返回结果(TOP-K)中被判定为与查询相关的文献数。
  • Recall@K(召回率)= 检索正例数 ÷ 该类别相关文献总数。衡量“该找的找到了多少”。
  • Precision@K(准确率)= 检索正例数 ÷ TOP-K(实际返回数)。衡量“返回的结果有多少是对的”。
  • F1@K= 2 × Recall × Precision ÷ (Recall + Precision)。综合权衡召回与准确,作为核心择优指标。

第二章 实验设计与配置

实验覆盖 4 种检索方式,并在每种方式下扫描多组超参数(重排序模型 / 融合权重、TOP-K、Score 阈值):

检索方式重排序 / 融合策略配置组数TOP-K 取值Score 阈值取值
全文检索重排序模型 bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8
向量检索bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8
混合检索-Rerank重排序模型 bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8
混合检索-权重设置语义:关键词 权重 0:100% ~ 100%:0 共12档443 / 5 / 8 / 100 / 0.5 / 0.8

第三章 核心指标汇总

下表给出各检索方式在全部超参数组合中的最优配置及其核心指标(F1@K 最高者):

检索方式最优配置召回率准确率F1@K均值F1
全文检索变体=bge-reranker,TOP-K=10,Score阈值=0.06.43%36.67%10.95%3.34%
向量检索变体=bge-reranker,TOP-K=10,Score阈值=0.016.96%96.67%28.86%8.68%
混合检索-Rerank变体=bge-reranker,TOP-K=10,Score阈值=0.012.87%73.33%21.89%7.47%
混合检索-权重设置变体=0.4:0.6,TOP-K=10,Score阈值=0.017.54%100.00%29.85%18.08%

第四章 各检索方式性能表现

4.1 全文检索

  • 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。
  • 整体指标(最优配置):Recall@K = 6.43%,Precision@K = 36.67%,F1@K =10.95%。
  • 分主题类别表现:
主题类别相关文献检索正例Recall@KPrecision@KF1@K
漏洞修复20735.00%70.00%46.67%
漏洞检测9344.30%40.00%7.77%
LLM安全5800.00%0.00%—
  • 整体平均(全配置):Recall = 1.90%,Precision = 15.79%,F1 = 3.34%。

4.2 向量检索

  • 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。
  • 整体指标(最优配置):Recall@K = 16.96%,Precision@K = 96.67%,F1@K =28.86%。
  • 分主题类别表现:
主题类别相关文献检索正例Recall@KPrecision@KF1@K
漏洞修复201050.00%100.00%66.67%
漏洞检测9399.68%90.00%17.48%
LLM安全581017.24%100.00%29.41%
  • 整体平均(全配置):Recall = 4.09%,Precision = 36.06%,F1 = 8.68%。

4.3 混合检索-Rerank

  • 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。
  • 整体指标(最优配置):Recall@K = 12.87%,Precision@K = 73.33%,F1@K =21.89%。
  • 分主题类别表现:
主题类别相关文献检索正例Recall@KPrecision@KF1@K
漏洞修复201050.00%100.00%66.67%
漏洞检测9366.45%60.00%11.65%
LLM安全58610.34%60.00%17.65%
  • 整体平均(全配置):Recall = 4.24%,Precision = 36.04%,F1 = 7.47%。

4.4 混合检索-权重设置

  • 配置组数:44;最优配置:变体=0.4:0.6,TOP-K=10,Score阈值=0.0。
  • 整体指标(最优配置):Recall@K = 17.54%,Precision@K = 100.00%,F1@K =29.85%。
  • 分主题类别表现:
主题类别相关文献检索正例Recall@KPrecision@KF1@K
漏洞修复201050.00%100.00%66.67%
漏洞检测931010.75%100.00%19.42%
LLM安全581017.24%100.00%29.41%
  • 整体平均(全配置):Recall = 10.23%,Precision = 89.89%,F1 = 18.08%。

4.5 混合检索-权重设置的权重敏感度(B库)

在 TOP-K=10、Score阈值=0 条件下,不同语义:关键词权重下的 F1@K 峰值配置:

权重(语义:关键词)召回率准确率F1@K
0.4:0.617.54%100.00%29.85%
0.3:0.716.96%96.67%28.86%
0.2:0.816.37%93.33%27.86%
0.5:0.516.37%93.33%27.86%
0.6:0.416.37%93.33%27.86%

第五章 关键发现

  • Score 阈值对召回存在显著负向影响。所有检索方式下,Score 阈值取 0.5 或 0.8 的配置其召回率与 F1 普遍大幅低于阈值=0 的配置;全部最优指标均出现在 Score 阈值=0 处。建议在保证准确率可接受的前提下将阈值设为 0。
  • TOP-K 与检索质量正相关。以最优配置集中的 TOP-K=10 为例,其召回率与 F1 明显高于 TOP-K=3/5/8;增大返回窗口能提升相关文献被覆盖的概率,但需权衡下游重排序/阅读成本。
  • “混合检索-权重设置”在本库中综合表现最佳。其峰值 F1@K 达 29.85%,整体均值 F1(18.08%)显著高于其余三种方式(全文/向量/混合-Rerank 均值均低于 10%),44 组细粒度权重扫描提供了最大寻优空间;在 A 库中其峰值 F1 与“向量检索”持平,在 B 库中则明显优于“向量检索”。
  • 主题类别间表现严重不均衡。漏洞检测类(93 篇)相关文献基数大、语义分散,各方式召回普遍偏低;LLM 安全类在部分配置下召回为 0(如 B 库全文检索最优配置未检索到任何 LLM 安全文献),是检索质量的短板。
  • 稳定性方面,“混合检索-权重设置”方式的 F1@K 变异系数最小,对超参数扰动最不敏感,工程落地风险最低。

第六章 结论与建议

  • 首选方案:综合 F1 与寻优空间,推荐以“混合检索-权重设置”(最优权重,TOP-K=10,Score 阈值=0)作为本库默认检索策略。
  • 参数基线:默认 TOP-K=10、Score 阈值=0;在准确率要求极高时可适度引入阈值,但需以召回损失为代价进行评估。
  • 短板治理:针对 LLM 安全类与漏洞检测类召回不足,建议扩充该类语料、优化嵌入模型或引入查询改写;对类别不均衡问题,可采用分主题独立检索与加权融合。
返回列表