十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

利用LLM构建非结构化文本的知识图谱

利用LLM构建非结构化文本的知识图谱 前言非结构化数据如文本文档和网页蕴藏着大量有价值的信息。挑战在于如何挖掘这些见解并连接分散来源之间的点。知识图谱将这些非结构化数据转化为结构化表示。它们绘制出关键实体、关系和模式支持高级语义分析、推理和推断。但是如何从一堆非结构化文本文档构建一个有组织的知识图谱呢以前这需要耗时的手动工作但大型语言模型LLM使得自动化大部分过程成为可能。在这篇博客中我们将探讨一种简单但强大的方法通过使用LLM从非结构化数据构建知识图谱步骤如下使用LLM从文本中提取节点和边。执行实体消歧以合并重复的实体。将数据导入Neo4j以存储和分析知识图谱。1. 提取节点和关系我们采用最简单的方法将输入数据传递给LLM让它决定提取哪些节点和关系。我们要求LLM以特定格式返回提取的实体包括名称、类型和属性。这使我们能够从输入文本中提取节点和边。然而LLM存在一个被称为上下文窗口的限制大多数LLM的上下文窗口在4000到16000个token之间这个限制可能会因较大输入而导致处理受阻。为克服这一限制我们将输入文本划分为适合上下文窗口的更小、更易处理的块。确定文本的最佳分割点本身就是一个挑战。为了简化操作我们选择将文本划分为尽可能大的块以充分利用每个块的上下文窗口。我们还引入了一些来自前一块的重叠部分以应对某些句子或描述跨越多个块的情况。这种方法使我们能够从每个块中提取节点和边表示其中包含的信息。为了在不同块中保持对不同类型实体的标签一致性我们向LLM提供了从前几块中提取的节点类型列表。这些类型开始形成提取的“模式”。我们发现这种方法增强了最终标签的一致性。例如LLM不再为“公司”和“游戏公司”生成单独的类型而是将所有类型的公司统一为“公司”标签。在我们的方法中一个显著的障碍是重复实体的问题。由于每个块是半独立处理的在组合结果时不同块中相同实体的信息会创建重复的实体。显然这一问题引出了我们的下一个步骤。2. 实体消歧现在我们有了一组实体。为了解决重复问题我们再次使用LLM。首先我们根据实体类型将其组织成集合。随后我们将每个集合提供给LLM使其在合并重复实体的同时整合它们的属性。我们使用LLM来完成这一任务因为我们无法确定每个实体的名称是什么。例如最初的提取可能生成了两个节点Alice {name: “Alice Henderson”}和Alice Henderson {age: 25}。这些引用相同的实体应合并为一个包含名称和年龄属性的节点。我们使用LLM来完成这一任务因为它们擅长快速理解哪些节点引用相同的实体。通过对所有实体组重复这一过程我们获得了一个结构化的数据集准备进一步处理。3. 将数据导入Neo4j在最后一步中我们将LLM的结果导入Neo4j数据库。这需要将生成的文本解析并转换为Neo4j可以理解的格式。为此我们将LLM生成的文本解析为对应不同节点和关系类型的独立CSV文件。这些CSV文件随后映射为与Neo4j数据导入工具兼容的格式。通过这种转换我们可以在导入Neo4j数据库之前预览数据利用Neo4j导入工具的功能。最终我们完成了一个由三部分构成的应用程序一个用于输入文件的用户界面、一个执行上述过程的控制器以及一个与控制器通信的LLM。源码可在 GitHub(https://github.com/neo4j/NaLLM)上找到。我们还创建了一个基本相同但带有模式选项的管道版本。此模式就像一个过滤器用户可以限制LLM在结果中包含哪些类型的节点、关系和属性。演示我通过给应用程序提供詹姆斯·邦德系列的维基百科页面并检查它生成的知识图谱来测试该应用程序。该图谱子集展示了生成的内容我认为它合理准确地反映了维基百科文章。图谱主要由代表书籍及与这些书籍相关的个人如作者和出版商的节点组成。然而图谱中存在一些问题。例如伊恩·弗莱明在他所写的大部分书中被标记为出版商而非作者。这种差异可能归因于语言模型在理解维基百科文章的这一特定方面时遇到的困难。另一个问题是书籍节点与同名电影导演之间的关系得到了包括而没有为电影创建单独的节点。最后值得注意的是LLM在解读关系时显得非常字面化。例如使用“使用”这个关系类型来连接詹姆斯·邦德角色与他驾驶的汽车。这种字面化的方式可能源于文章中使用了动词“使用”而非“驾驶”。挑战这种方法在演示中效果相当不错我们认为它表明使用LLM创建知识图谱是可行的。然而这种方法也面临一些问题•不可预测的输出这是LLM的固有特性。我们无法预知LLM将如何格式化其结果。即使我们要求其以特定格式输出它也可能不遵循。这可能在解析生成内容时导致问题。我们在数据分块时曾遇到过一个例子大多数情况下LLM生成了一个简单的节点和边列表但有时LLM会对列表编号。像Guardrails和OpenAI的函数API等工具正在发布旨在解决这个问题。虽然LLM工具的发展还处于早期阶段但我们预计这不会成为长期问题。•速度这种方法较慢处理单个较大的网页通常需要几分钟。可能存在一种从根本上不同的方式来加快提取过程。•缺乏可追溯性我们无法知道LLM为什么从源文档中提取了某些信息或者这些信息是否真的存在于源文档中。因此使用LLM生成的知识图谱的数据质量远低于未使用LLM的流程生成的图谱。从非结构化数据中解锁见解通过将原始文本转化为结构化的知识图谱表示我们可以揭示隐藏的联系和模式。通过这种三步法任何人都可以使用LLM构建知识图谱并有效分析大量非结构化数据。无论是处理文档、网页还是其他形式的文本我们都可以利用自动化的知识图谱构建方法轻松发现新的见解。我们也应注意这种方法的挑战如LLM输出格式不可预测、速度限制以及潜在的可追溯性问题。最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表