十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

《大模型总一本正经地胡说?我给电气手册装了三层防线》》

《大模型总一本正经地胡说?我给电气手册装了三层防线》》 价值体现如果你也想给自己的专业资料——不只是电气论文、规范、产品手册都行——做一个“问什么都能答、还告诉你答案在第几页”的本地问答系统这个系列你会带走三样东西1. 一套可以直接抄的检索配方怎么让 AI 搜得到 NSX250N 这种它从没见过的型号——实测把型号类召回从 80% 拉到 100%2. 一个反直觉的实测结论业内都推崇的“重排模型”在我这套系统里慢了 28 倍还更不准——你会看到“理论上更好的组件”是怎么被评测数据当场否决的3. 三个最阴险的静默 bug它们不报错、不警告只让系统悄悄变笨任何一个都可能正藏在你自己的项目里。三层防线1. 底层双通道混合检索 RRF融合提升召回准确率​2. 中层Rerank重排序过滤无关文档​3. 顶层答案校验信息不足时直接返回“不知道”拒绝编造答案先看三个实测数字这套系统的能力不靠形容词靠三个可以复现的数字评测集 60 条固化在仓库里任何人跑都是同样的结果① 检索召回率 Recall10 98.3%。​ 60 条评测问题里98.3% 的正确答案片段出现在检索结果前 10 条中。最难的型号类问题——语义模型眼里的“生词”——从纯向量检索的 80% 提到了 100%。② 单次检索延迟 P95 ≈ 22 毫秒。​ 用户点下提问后等答案的绝大部分时间花在大模型生成上检索环节快到无感。这个数字后来还帮我识破了一个“优化陷阱”第四篇细说。③ 支持 6 类文件格式全链路可离线。​ PDF、Word、Markdown、HTML 都能吃模型权重全部缓存在本地断网照样演示。答辩现场没有网它也没掉过链子。对电气这个领域第 ① 条和“不编数”尤其重要查询里高频出现型号、标准号NSX250N、GB/T 14048.2、YJV这类精确符号是纯语义检索的天敌而编造一个额定电流比答不出来危险得多。所以这套系统被设计成查不到时明确说查不到——宁可拒答不肯胡说。它是怎么工作的一张图说清数据怎么流入库文件 → 解析(docling等) → 分块 → ┬→ ChromaDB向量路 ├→ BM25 索引关键词路 └→ 登记簿哈希记账重复上传自动跳过 问答问题 ─┬→ 语义向量检索 ─┐ └→ 关键词检索 ─┴→ RRF 按排名融合 → top 5 → 拼上下文每段带文件名页码 → 大模型生成 → 流式返回 来源两条检索通道各管一半向量路懂“意思相近”你换个说法问它也能找到关键词路管“一字不差”型号、标准号这类查询一击即中。两路结果用 RRF 按排名融合不用调任何权重参数。最后生成的每条答案都能核对到原文某文件某页。技术栈一行带过FastAPI docling ChromaDB bge-m3 BM25/RRF DeepSeek单卡 RTX 5080全链路可离线。细节留给后面几篇。一段最值得先看的实测重排模型被数据开除了做检索的人都听过一句话交叉编码重排是精度的“最后一块拼图”。我确实接了 bge-reranker-v2-m3然后用同一套 60 条评测题实测了三种模式模式Recall10MRR10NDCG10P95 延迟纯向量93.3%0.74520.791122.4ms混合检索98.3%0.82250.862822.1ms混合 重排98.3%0.73380.7945633.1ms结论很粗暴重排让排序质量变差了MRR 0.82 → 0.73让延迟涨了 28 倍。于是生产配置里它被明确关闭——这个决定不是拍脑袋是评测数据背书的。为什么会这样剧透一句重排只能重排“已召回的”它治“排错序”不治“压根没找到”。当上游召回已经到 98.3%它能改善的空间本来就薄。完整分析在第四篇这里只留这个钩子。这个系列会讲什么篇内容你能带走什么① 本篇系统总览 实测效果知道这套东西值不值得追② 文档解析docling 吃 PDF表格、页码、幂等上传脏文档解析的通用套路③ 混合检索型号召回 80% → 100% 的完整配方可直接抄的双路检索方案④ 评测与重排重排为什么被关 一套可复用的评测方法用数字做技术决策的能力⑤ 并发加固两人同时上传会写坏数据吗小项目的并发安全最低配置⑥ 踩坑合集三个不报错、只变笨的静默 bug一份检索系统排障清单代码全部写完、评测数字全部落盘所以不会鸽。完整实现已开源https://gitee.com/you-fuming/elec--rag下一篇《docling 吃 PDF表格、页码和幂等上传》。
返回列表