数据库 B实验结果报告
第一章 实验概述
1.1 实验背景与目标
本实验面向论文检索场景,评估不同检索策略在给定语料库(共171 篇学术文献)上的检索质量。语料按主题分为三类:漏洞修复(20 篇)、漏洞检测(93 篇)、LLM 安全(58 篇),三类论文数之和恰为 171 篇,构成完整的测试语料。
1.2 测试查询
测试集包含 3 条英文查询,分别与上述三个主题类别一一对应:
| 序号 | 测试查询(英文) | 对应主题类别 | 相关文献数 |
|---|
| 1 | State-of-the-art source code automatic repair methods | 漏洞修复(20篇) | 20 |
| 2 | Summarize automated vulnerability mining frameworks | 漏洞检测(93篇) | 93 |
| 3 | Future trends of LLM security research | LLM安全(58篇) | 58 |
1.3 评估指标定义
- 检索正例:在返回结果(TOP-K)中被判定为与查询相关的文献数。
- Recall@K(召回率)= 检索正例数 ÷ 该类别相关文献总数。衡量“该找的找到了多少”。
- Precision@K(准确率)= 检索正例数 ÷ TOP-K(实际返回数)。衡量“返回的结果有多少是对的”。
- F1@K= 2 × Recall × Precision ÷ (Recall + Precision)。综合权衡召回与准确,作为核心择优指标。
第二章 实验设计与配置
实验覆盖 4 种检索方式,并在每种方式下扫描多组超参数(重排序模型 / 融合权重、TOP-K、Score 阈值):
| 检索方式 | 重排序 / 融合策略 | 配置组数 | TOP-K 取值 | Score 阈值取值 |
|---|
| 全文检索 | 重排序模型 bge-reranker-v2-m3 | 12 | 3 / 5 / 8 / 10 | 0 / 0.5 / 0.8 |
| 向量检索 | bge-reranker-v2-m3 | 12 | 3 / 5 / 8 / 10 | 0 / 0.5 / 0.8 |
| 混合检索-Rerank | 重排序模型 bge-reranker-v2-m3 | 12 | 3 / 5 / 8 / 10 | 0 / 0.5 / 0.8 |
| 混合检索-权重设置 | 语义:关键词 权重 0:100% ~ 100%:0 共12档 | 44 | 3 / 5 / 8 / 10 | 0 / 0.5 / 0.8 |
第三章 核心指标汇总
下表给出各检索方式在全部超参数组合中的最优配置及其核心指标(F1@K 最高者):
| 检索方式 | 最优配置 | 召回率 | 准确率 | F1@K | 均值F1 |
|---|
| 全文检索 | 变体=bge-reranker,TOP-K=10,Score阈值=0.0 | 6.43% | 36.67% | 10.95% | 3.34% |
| 向量检索 | 变体=bge-reranker,TOP-K=10,Score阈值=0.0 | 16.96% | 96.67% | 28.86% | 8.68% |
| 混合检索-Rerank | 变体=bge-reranker,TOP-K=10,Score阈值=0.0 | 12.87% | 73.33% | 21.89% | 7.47% |
| 混合检索-权重设置 | 变体=0.4:0.6,TOP-K=10,Score阈值=0.0 | 17.54% | 100.00% | 29.85% | 18.08% |
第四章 各检索方式性能表现
4.1 全文检索
- 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。
- 整体指标(最优配置):Recall@K = 6.43%,Precision@K = 36.67%,F1@K =10.95%。
- 分主题类别表现:
| 主题类别 | 相关文献 | 检索正例 | Recall@K | Precision@K | F1@K |
|---|
| 漏洞修复 | 20 | 7 | 35.00% | 70.00% | 46.67% |
| 漏洞检测 | 93 | 4 | 4.30% | 40.00% | 7.77% |
| LLM安全 | 58 | 0 | 0.00% | 0.00% | — |
- 整体平均(全配置):Recall = 1.90%,Precision = 15.79%,F1 = 3.34%。
4.2 向量检索
- 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。
- 整体指标(最优配置):Recall@K = 16.96%,Precision@K = 96.67%,F1@K =28.86%。
- 分主题类别表现:
| 主题类别 | 相关文献 | 检索正例 | Recall@K | Precision@K | F1@K |
|---|
| 漏洞修复 | 20 | 10 | 50.00% | 100.00% | 66.67% |
| 漏洞检测 | 93 | 9 | 9.68% | 90.00% | 17.48% |
| LLM安全 | 58 | 10 | 17.24% | 100.00% | 29.41% |
- 整体平均(全配置):Recall = 4.09%,Precision = 36.06%,F1 = 8.68%。
4.3 混合检索-Rerank
- 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。
- 整体指标(最优配置):Recall@K = 12.87%,Precision@K = 73.33%,F1@K =21.89%。
- 分主题类别表现:
| 主题类别 | 相关文献 | 检索正例 | Recall@K | Precision@K | F1@K |
|---|
| 漏洞修复 | 20 | 10 | 50.00% | 100.00% | 66.67% |
| 漏洞检测 | 93 | 6 | 6.45% | 60.00% | 11.65% |
| LLM安全 | 58 | 6 | 10.34% | 60.00% | 17.65% |
- 整体平均(全配置):Recall = 4.24%,Precision = 36.04%,F1 = 7.47%。
4.4 混合检索-权重设置
- 配置组数:44;最优配置:变体=0.4:0.6,TOP-K=10,Score阈值=0.0。
- 整体指标(最优配置):Recall@K = 17.54%,Precision@K = 100.00%,F1@K =29.85%。
- 分主题类别表现:
| 主题类别 | 相关文献 | 检索正例 | Recall@K | Precision@K | F1@K |
|---|
| 漏洞修复 | 20 | 10 | 50.00% | 100.00% | 66.67% |
| 漏洞检测 | 93 | 10 | 10.75% | 100.00% | 19.42% |
| LLM安全 | 58 | 10 | 17.24% | 100.00% | 29.41% |
- 整体平均(全配置):Recall = 10.23%,Precision = 89.89%,F1 = 18.08%。
4.5 混合检索-权重设置的权重敏感度(B库)
在 TOP-K=10、Score阈值=0 条件下,不同语义:关键词权重下的 F1@K 峰值配置:
| 权重(语义:关键词) | 召回率 | 准确率 | F1@K |
|---|
| 0.4:0.6 | 17.54% | 100.00% | 29.85% |
| 0.3:0.7 | 16.96% | 96.67% | 28.86% |
| 0.2:0.8 | 16.37% | 93.33% | 27.86% |
| 0.5:0.5 | 16.37% | 93.33% | 27.86% |
| 0.6:0.4 | 16.37% | 93.33% | 27.86% |
第五章 关键发现
- Score 阈值对召回存在显著负向影响。所有检索方式下,Score 阈值取 0.5 或 0.8 的配置其召回率与 F1 普遍大幅低于阈值=0 的配置;全部最优指标均出现在 Score 阈值=0 处。建议在保证准确率可接受的前提下将阈值设为 0。
- TOP-K 与检索质量正相关。以最优配置集中的 TOP-K=10 为例,其召回率与 F1 明显高于 TOP-K=3/5/8;增大返回窗口能提升相关文献被覆盖的概率,但需权衡下游重排序/阅读成本。
- “混合检索-权重设置”在本库中综合表现最佳。其峰值 F1@K 达 29.85%,整体均值 F1(18.08%)显著高于其余三种方式(全文/向量/混合-Rerank 均值均低于 10%),44 组细粒度权重扫描提供了最大寻优空间;在 A 库中其峰值 F1 与“向量检索”持平,在 B 库中则明显优于“向量检索”。
- 主题类别间表现严重不均衡。漏洞检测类(93 篇)相关文献基数大、语义分散,各方式召回普遍偏低;LLM 安全类在部分配置下召回为 0(如 B 库全文检索最优配置未检索到任何 LLM 安全文献),是检索质量的短板。
- 稳定性方面,“混合检索-权重设置”方式的 F1@K 变异系数最小,对超参数扰动最不敏感,工程落地风险最低。
第六章 结论与建议
- 首选方案:综合 F1 与寻优空间,推荐以“混合检索-权重设置”(最优权重,TOP-K=10,Score 阈值=0)作为本库默认检索策略。
- 参数基线:默认 TOP-K=10、Score 阈值=0;在准确率要求极高时可适度引入阈值,但需以召回损失为代价进行评估。
- 短板治理:针对 LLM 安全类与漏洞检测类召回不足,建议扩充该类语料、优化嵌入模型或引入查询改写;对类别不均衡问题,可采用分主题独立检索与加权融合。