十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Ontology Learning and Knowledge Graph Construction: A Comparison of Approaches and Their Impact on R

Ontology Learning and Knowledge Graph Construction: A Comparison of Approaches and Their Impact on R 这篇文章系统地研究了不同知识图谱KG构建策略对检索增强生成RAG系统性能的影响并重点探索了本体Ontology的自动化学习如何优化这一过程。以下是核心内容的全面总结1. 研究背景与问题RAG的局限性传统RAG依赖向量检索忽略实体间关系导致推理能力弱而基于图的RAG如GraphRAG虽能编码关系但高质量KG的构建和维护成本高。研究空白本体引导的KG尤其是从关系数据库提取本体在RAG中的潜力尚未被充分探索。2. 研究目标对比六种RAG方法标准向量RAG基线GraphRAG微软开源框架文本本体对齐KG含/不含文本块关系数据库RDB本体对齐KG含/不含文本块核心问题本体来源文本 vs 数据库和是否包含文本块如何影响检索准确性和生成质量3. 方法论亮点本体学习从RDB提取改进RIGOR方法直接解析DDL语句利用LLM生成OWL本体基于稳定数据库模式。从文本提取采用Bakker等人的方法从非结构化文本逐句生成Turtle格式本体。KG构建使用LangChain模块将本体约束类、关系实例化为图并特意增加“含文本块”变体将原始文本片段作为节点属性。检索器设计基于启发式非GNN的Prize-Collecting Steiner Tree算法提取与查询最相关的连通子图确保性能差异主要源于KG质量。4. 实验设置数据一份真实的、已获批的葡萄牙创业资助申请Granter.ai翻译为英文。评估20个领域问题覆盖公司、技术、财务等多维度人工分类为“正确/不完整/错误/我不知道”。5. 主要结果方法正确率关键表现向量RAG60%可靠但缺乏推理深度GraphRAG90%最佳之一但计算成本高文本本体KG含块90%与GraphRAG持平RDB本体KG含块90%与GraphRAG持平不含块的KG两种≤20%表现极差凸显文本块整合至关重要核心发现文本块是性能跃升的关键单纯实体-关系图无法提供足够上下文整合原始文本片段后效果突飞猛进。RDB本体 文本本体性能从静态数据库提取的本体检索效果与从动态文本提取的相当。6. 实践优势RDB本体方法一次投入长期收益数据库模式稳定本体学习仅需执行一次避免反复调用LLM。免于本体合并烦恼文本新文档会引入冗余/冲突实体需复杂融合而RDB模式统一维护简单。成本效率显著大幅降低LLM推理开销适合工业级应用。7. 局限与未来方向当前局限仅基于单一小规模数据集20个问题需验证泛化性。未来计划在更大、更动态的语料库中对比两类本体。探索不同行业如金融、医疗中的稳定与动态数据环境。深化RDB本体学习方法使之标准化并适配更多RAG场景。从稳定关系数据库提取本体并将原始文本块嵌入知识图谱节点能媲美最先进GraphRAG的性能同时大幅降低成本与维护复杂度为工业级RAG系统提供了一种实用、高效的符号-向量混合解决方案。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要检索增强生成系统将大型语言模型与外部知识相结合其性能在很大程度上取决于知识的表示方式。本研究探讨了不同的知识图谱构建策略如何影响RAG的性能。我们比较了多种方法标准的基于向量的RAG、GraphRAG以及基于从关系数据库或文本语料库中导出的本体构建的知识图谱上的检索。结果表明结合了文本块信息的本体引导型知识图谱在性能上与最先进的框架具有竞争力并显著优于向量检索基线。此外研究结果揭示从关系数据库构建的本体引导型知识图谱其性能与从文本中提取的本体构建的知识图谱相当并且具有双重优势它们仅需进行一次性的本体学习过程大幅降低了LLM的使用成本同时避免了基于文本的方法所固有的本体合并复杂性。1 引言大型语言模型在各类领域均展现出强大的生成和推理能力但其对静态训练数据的依赖限制了对未见领域和特定领域知识的访问。检索增强生成通过将模型输出基于外部来源减少了幻觉现象从而缓解了这些限制。然而RAG的性能取决于外部知识的组织和检索方式。传统的RAG系统依赖于向量数据库这些数据库索引文本嵌入以进行语义相似性搜索。虽然高效但这种表示方式忽略了实体之间的关联结构可能导致检索冗余和推理能力受限。基于图的RAG方法通过利用知识图谱编码显式关系来解决此问题从而实现结构化和可解释的检索。尽管如此构建和维护高质量的知识图谱仍然是一项艰巨的任务 [4, 9, 10]。本体学习的最新进展为自动化知识图谱构建开辟了新途径。本体以正式形式捕捉领域概念和关系充当图构建的蓝图。LLM还支持从结构化和非结构化数据中提取本体。尽管取得了这些进展但本体引导型知识图谱尤其是从关系数据库派生的那些在RAG背景下的潜力在很大程度上仍未得到探索。本研究通过系统比较不同知识图谱构建策略如何影响RAG性能来弥补这一空白。使用一个真实世界的数据集来自Granter.ai的资助申请我们评估了标准向量RAG、GraphRAG微软研究院的GraphRAG系统以及在从关系数据库或直接从文本中提取的本体所构建的多个知识图谱上的检索。通过控制语料库、检索方法、知识图谱构建流程和评估框架我们的分析隔离了本体来源和结构对检索准确性和推理质量的影响。我们工作的贡献是双重的首先我们展示了将文本块直接整合到图结构中超越了传统的仅含实体和关系的知识图谱通过丰富上下文和实现更深层次的推理提高了检索准确性和生成质量。其次我们证明了从静态关系数据库中提取的本体其性能与从文本语料库中提取的本体相当同时更具成本效益且更易于维护。由于数据库模式往往随时间保持稳定本体学习过程只需执行一次避免了重复LLM推理的高昂计算成本以及基于文本的方法中所需的本体合并复杂性。总之这些发现突显了构建可扩展和可解释的基于图的RAG系统的实用策略。2 相关工作2.1 RAG检索增强生成已成为一种广泛采用的范式用于增强大型语言模型的外部知识解决幻觉和缺乏领域特定意识等局限性。[13]在这些流程中文档被嵌入到向量空间中并检索语义上相似的块以增强LLM的提示从而允许更准确的响应。虽然对许多应用有效但基于向量的检索具有固有局限性例如忽略文本语料库中的关系和产生过长的上下文 [13, 15]。为了克服这些挑战基于图的RAG流程利用结构化图来捕获数据中的关系。最近的调查强调使用图可以提高可解释性减少检索冗余并支持需要多跳推理和全局总结的任务这些是基于向量的方法难以处理的领域 [13, 16, 4]。结合向量检索和基于图的检索的混合方法也日益突出。例如HybridRAG [14] 整合了知识图谱和向量数据库进行文档分析在检索准确性和答案质量方面优于单独使用基于向量或基于图的方法。实证研究也强调了评估的重要性。例如Han等人 [7] 直接比较了这些方法表明基于图的RAG在可解释性和推理方面表现更优而向量RAG在详细的单跳查询中仍具竞争力。同样Myers等人 [11] 探索了用于RAG的多种知识图谱构建选项得出结论认为混合方法可能是最佳方法。2.2 知识图谱知识图谱KGs提供了一种结构化的知识表示通常表示为实体、关系和语义描述。通过以这种方式组织信息知识图谱支持语义查询、推理以及跨异构来源的集成 [10, 12]。它们已成为捕获领域知识的基本数据结构支持语义搜索、推荐系统和问答等应用 [4]。知识图谱的构建过程可以使用基于规则、统计或LLM驱动的方法自动化每种方法在精确性和可扩展性之间都有不同的权衡 [16]。Choi和Jung [4] 将知识图谱构建总结为三个阶段提取来自结构化、半结构化或非结构化数据、学习嵌入和推理技术和评估准确性、覆盖范围和一致性度量。尽管最近取得了进展但一些问题仍然存在。研究一致指向两个广泛的挑战构建复杂性因为高质量的知识图谱需要整合多样化的数据源以及维护因为知识图谱必须适应新数据 [4, 16]。2.3 本体学习本体是知识的形式化表示定义了特定领域内的概念、关系和约束。当用于指导知识图谱构建时它们能够实现更一致、层次化的知识表示并支持多跳推理、消歧和上下文感知检索等复杂任务 [13, 11]。最近LLM在从结构化和非结构化数据中自动化本体学习方面显示出巨大潜力。例如Nayyeri等人 [12] 和 Bakker等人 [1] 提出的方法使用基于提示的方法直接从关系数据库或文本中提取本体元素绕过了传统的手动和基于规则的系统。其他研究如Chepurova等人 [2] 和 Doumanas等人 [5]表明整合本体验证或在本体工程语料库上微调LLM可提高领域对齐的精确性允许“在本体管理中实现更智能和自动化的系统” [5]。即便如此在确保逻辑一致性、减少幻觉以及将生成的本体与既定词汇和模式标准对齐方面仍然存在挑战 [1, 4]。在我们的研究中本体用于指导构建作为所测试RAG系统基础的知识图谱。2.3 本体学习本体是知识的形式化表示定义了特定领域内的概念、关系和约束。当用于指导知识图谱构建时它们能够实现更一致、层次化的知识表示并支持多跳推理、消歧和上下文感知检索等复杂任务 [13, 11]。最近LLM在从结构化和非结构化数据中自动化本体学习方面显示出巨大潜力。例如Nayyeri等人 [12] 和 Bakker等人 [1] 提出的方法使用基于提示的方法直接从关系数据库或文本中提取本体元素绕过了传统的手动和基于规则的系统。其他研究如Chepurova等人 [2] 和 Doumanas等人 [5]表明整合本体验证或在本体工程语料库上微调LLM可提高领域对齐的精确性允许“在本体管理中实现更智能和自动化的系统” [5]。即便如此在确保逻辑一致性、减少幻觉以及将生成的本体与既定词汇和模式标准对齐方面仍然存在挑战 [1, 4]。在我们的研究中本体用于指导构建作为所测试RAG系统基础的知识图谱。3 方法论本节描述了用于比较不同知识图谱构建方法及其与RAG集成的实验流程。我们评估了六种方法一个基线基于向量的RAG、GraphRAG以及在四种不同知识图谱上的检索。图1比较向量RAG、GraphRAG和本体引导型知识图谱的实验设置。3.1 RAG基线3.1.1 向量RAG第一个基线遵循传统的基于向量的RAG范式。语料库中的文档使用LangChain的RecursiveCharacterTextSplitter分割成重叠的文本块随后使用Ollama的nomic-embed-text: v1.5模型进行嵌入。这些嵌入使用FAISS进行索引并通过余弦相似度进行检索以识别最近邻。此配置代表了向量RAG的规范流程并作为评估图增强方法附加价值的参考点。3.1.2 GraphRAG我们实现了微软的GraphRAG框架 [6]该框架通过基于图的摘要和检索扩展了RAG。GraphRAG从语料库构建实体图并利用社区结构实现语义相关子图的检索。实现依赖于官方Python包graphrag并使用其默认设置运行包括用于检索的本地搜索方法。这提供了一个开箱即用的参考系统无需手动调整。3.2 本体驱动的知识图谱3.2.1 关系数据库本体学习第一种本体驱动的知识图谱构建方法基于RIGOR检索增强的迭代式关系数据库本体生成[12]该方法直接从关系数据库模式生成本体。我们实现了RIGOR的改编版本并引入了以下更改我们没有利用多个外部本体存储库而是将外部参考本体限制为DINGO [3]这是一个提供关于项目、资助、参与者和资助政策上下文的本体。在我们的实现中DINGO被手动转换为OWL 2 Manchester语法以便更容易地词汇提取本体约束与原始RIGOR流程不同我们没有依赖RDB的词汇视图。相反输入给LLM的信息直接包含了表的DDL语句及其列和主键/外键注释除了通用模式描述外没有可用的表级文档因此我们未在此过程中包含任何表级文档Delta本体和最终本体均以Turtle格式生成这便于通过RDFLib Python库进行迭代合并LLM推理在温度0下运行优先考虑严格的指令遵循提示策略经过调整以强制执行严格的命名约定确保语义相同的元素不会以不同名称冗余生成。此外我们指示LLM为所有本体元素生成标签和注释以支持可解释性这些修改产生了一个与数据库模式对齐且冗余和噪音最小化的、一致的本体提取过程。这些修改产生了一个与数据库模式对齐且冗余和噪音最小化的、一致的本体提取过程。图2实现的RIGOR流程概览。3.2.2 文本本体学习第二种本体驱动方法直接从文本语料库中导出本体遵循Bakker等人 [1] 提出的第三种提取方法并做了少量调整调整提示以强制执行严格的命名约定并提高解析可靠性对于每个句子系统尝试生成有效的Turtle语法。如果解析失败则触发辅助LLM检查以修复语法并输出修正版本。这种方法能够直接从非结构化文本中自动归纳出特定领域的本体。3.2.3 知识图谱构建框架为了将本体与RAG流程集成我们开发了一个基于LangChain实验库中LLMGraphTransformer模块的知识图谱构建框架。该流程从本体中提取规则和约束并利用文本语料库将它们实例化为图结构。关键实现细节包括一个提取本体约束以允许的类和关系列表形式的流程测试包含和不包含块信息的变体以检查信息粒度如何影响图形成和下游检索将输出存储为CSV文件确保与检索过程的兼容性。此框架为基于图的检索提供了统一的接口。3.3 检索器对于在所构建图上的检索我们实现了一个受G-Retriever [8] 启发的自定义检索器。与使用图神经网络来建模检索子图结构的原始方法不同我们的版本依赖于一种简化的基于启发式的方法没有使用GNN。知识图谱从CSV格式导入并分割为节点带有文本属性和边带有标记关系。2. 每个节点的文本描述使用SentenceTransformer模型进行嵌入生成用于相似性匹配的语义向量空间。用户查询随后被嵌入到同一空间检索器计算余弦相似度以识别最相关的前k个节点。3. 为了整合关系上下文流程构建一个无向边集并分配统一成本。4. 在相似性搜索中排名靠前的节点被分配与其相似性得分和排名成正比的奖励。5. 使用“奖赏收集斯坦纳树”优化提取一个由相关节点和边组成的连通子图最大化节点数量并最小化检索到的边数。6. 选定的子图被转换为人类可读的上下文字符串其中节点用其属性标记边表示为三元组。此字符串构成传递给LLM的上下文。此设计的目标是特别是检索器采用了以下步骤知识图谱从CSV格式导入并分割为节点带有文本属性和边带有标记关系。2. 每个节点的文本描述使用SentenceTransformer模型进行嵌入生成用于相似性匹配的语义向量空间。用户查询随后被嵌入到同一空间检索器计算余弦相似度以识别最相关的前k个节点。3. 为了整合关系上下文流程构建一个无向边集并分配统一成本。4. 在相似性搜索中排名靠前的节点被分配与其相似性得分和排名成正比的奖励。5. 使用“奖赏收集斯坦纳树”优化提取一个由相关节点和边组成的连通子图最大化节点数量并最小化检索到的边数。6. 选定的子图被转换为人类可读的上下文字符串其中节点用其属性标记边表示为三元组。此字符串构成传递给LLM的上下文。此设计的目标是此设计的目标是保持不同图变体之间的一致性确保性能差异反映底层知识图谱的质量而非检索器的复杂性保持可解释性和可重复性同时最小化潜在混淆因素。虽然先前的研究表明微调可能改善检索性能 [11]但我们的重点是比较知识图谱质量而非最大化检索器性能。通过采用这种结构化但简单的检索过程我们保证性能差异主要源于底层知识图谱的质量而非复杂的检索启发式方法。图3自定义检索器流程。4 实验设置4.1 语料库描述实验是在Granter.ai向葡萄牙“创业券 - 新数字/科技产品”征集活动中提交的一份真实资助申请上进行的该申请已成功获批。原始文件为葡萄牙语已翻译成英文并进行了最低限度的匿名化处理。选择此文档是因为它提供了一个具有代表性的真实世界示例该文档既包含公司级别的上下文使命、商业模式、技术和管 capacity也包含机会特定内容目标、类型理由、创新潜力和影响。此结构为评估知识检索和推理性能提供了一个丰富且一致的数据集因为它包含了与Granter运营多个维度相关的详细事实和上下文信息。4.2 问题集和真实答案为了评估每种方法我们手动创建了一组20个领域特定问题以反映在Granter工作流程中实际任务预期检索到的信息类型。这些问题涵盖五个主要类别公司和上下文信息例如“Granter.ai的主要业务活动是什么”技术和方法论方面例如“Granter.ai使用哪些AI方法论”战略和管理细节例如“哪位团队成员负责AI Agent的国际扩展”财务和运营指标例如“Granter.ai筹集了多少资金”可扩展性和影响例如“是什么让Granter.ai的解决方案可扩展到不同行业”每个问题都配有一个从申请文档中提取的参考答案形成一个真实答案数据集。此真实答案用于定性比较完整性和事实性和定量评估。4.3 评估流程每种检索方法都在第4.2节描述的同一组20个问题上进行了评估。为了评估响应质量采用了手动分类评估框架。对于每个生成的答案将输出与真实答案进行比较并分为以下四类之一正确答案在事实内容和完整性上完全匹配真实答案不完整答案包含部分但准确的信息遗漏了真实答案中存在的相关细节错误/错误答案包含语料库不支持的不正确或误导性信息“我不知道”模型明确表示信息不足或拒绝回答。这种定性评估准确地捕捉了RAG系统在知识密集型任务中的性能特征特别是当输出可能部分正确或选择不作答时。所测试检索方法的结果在第5节中报告。5 结果5.1 概述六种配置的结果汇总于图4。该表报告了每个评估类别正确、不完整、错误/错误和“我不知道”中的答案数量。图4结果概览5.2 关键见解与比较评估GraphRAG方法以及包含块信息的两种本体引导型知识图谱均达到了最高准确率各正确回答了20个问题中的18个90%且各仅有1个错误和1个“我不知道”的响应。这表明当文本片段被直接整合到图结构中时在本体约束的知识图谱上进行检索可以达到与最先进框架相当的性能。相比之下不含块信息的基于本体的图谱表现明显较差。文本本体知识图谱仅达到15%的准确率3/20和30%的不完整答案而关系数据库本体知识图谱达到20%的准确率4/20和45%的未回答问题。这些结果表明将文本块添加到图节点中显著提高了事实基础和完整性且未增加实现复杂性。基线向量RAG达到了60%的准确率12/20和20%的不完整答案证实了传统的基于嵌入的检索仍然可靠但缺乏基于图方法的关系推理能力。总体而言块信息整合一致地提高了所有配置中的答案准确性和完整性。符号结构与上下文文本片段的结合被证明对于准确推理至关重要突显了本体引导的混合图表示在RAG系统中的价值。结论本研究比较了多种知识图谱构建策略并检验了它们对RAG性能的影响。结果表明知识图谱的构建方式显著影响检索准确性和生成质量。本体驱动的方法特别是那些包含文本块信息的方法达到了最高性能同时保持了高可解释性和极少的幻觉。一个关键发现是将知识图谱与从静态关系数据库中提取的本体对齐其性能与从动态文本语料库中衍生的本体相当。这种方法具有两个主要的实际优势首先从关系数据库进行本体学习只需执行一次因为关系模式往往随时间保持稳定这显著降低了与重复LLM推理相关的计算成本。其次这种方法消除了对复杂的本体合并框架的需求。在基于文本的本体学习中每新增一个文档都可能引入冗余或冲突的实体需要复杂的合并和对齐流程。相比之下数据库派生的本体提供了一个稳定的模式简化了领域本体的维护和更新。总之这些发现表明从关系数据库提取本体为将符号结构整合到RAG流程中提供了一种可扩展、成本高效的解决方案特别适用于拥有稳定和结构化数据源的行业。需要指出的是这些结论基于一个有限数据集的实证研究。虽然结果令人鼓舞但应在不同领域和更大数据集上进一步验证以评估所提出方法的普适性。我们将此留作未来工作的方向。未来工作虽然本研究为本体引导的知识图谱及其在RAG系统中的集成提供了有价值的见解但仍有几个领域有待未来探索。列举我们认为最相关的几个在更大语料库上测试文本本体与关系数据库本体未来的研究可以通过在更大、更多样化的语料库上测试文本派生的本体与关系数据库派生的本体的性能来扩展本研究。这将允许更精确地量化基于关系数据库本体的成本优势特别是在计算成本方面同时确保在更复杂的数据集上保持性能。跨不同行业的可扩展性未来的工作可以探索在文本数据更加动态且持续增长的背景下基于关系数据库本体的知识图谱与基于文本本体的知识图谱之间的性能是否仍然相似。这将更清晰地理解稳定和动态数据环境如何影响不同行业的检索性能。为RAG系统从关系数据库进行本体学习一个特别有前景的未来工作方向在于深化对专门用于RAG系统的从关系数据库进行本体学习的研究。虽然本研究证明了其效率和稳定性但进一步的工作应研究如何针对不同的工业环境优化和泛化此过程巩固其作为可扩展和可解释RAG流程基础的作用。
返回列表