
R2R 知识图谱10 分钟把散落文档变成可查询的关系网络【免费下载链接】R2RSoTA production-ready AI retrieval system. Agentic Retrieval-Augmented Generation (RAG) with a RESTful API.项目地址: https://gitcode.com/GitHub_Trending/r2/R2R合同条款散在几百页 PDF 里关键词搜索只能给你孤立片段。R2R 知识图谱解决的就是这个问题从文档里抽出实体和关系连成网络让检索能顺着关系跳转。按这篇走一遍你会在本地跑起 R2R 服务对一份真实文档完成摄取、抽取和建图。三步启动拿到第一份实体列表装包并启动pip install r2r设置好OPENAI_API_KEY运行python -m r2r.serve。服务监听http://localhost:7272Dashboard 自动打开。摄取文档client.documents.create(file_path合同.pdf)返回文档 ID。txt、pdf、png 等格式都支持。触发抽取client.documents.extract(document_id)。LLM 逐段扫描大文档要等几分钟。# 仅展示关键配置 from r2r import R2RClient client R2RClient(http://localhost:7272) doc client.documents.create(file_path合同.pdf) client.documents.extract(doc[results][document_id])跑完后Dashboard 的文档表格里状态会变为成功。这时调用client.documents.list_entities(document_id)实体和关系清单就列出来了。数据怎么流转的输入、处理、输出输入文档进集合你摄取的每份文档都会进入一个集合Collection。集合是文档和图谱的共同容器一份文档可以挂在多个集合下。处理LLM 抽取实体与关系抽取由模型驱动识别文本中的实体再判断实体之间是否构成关系。这一步最耗时也容易产出大量重复实体。输出pull 进图谱聚类成社区调用client.graphs.pull(collection_id...)把抽取结果汇入集合图谱。接着client.graphs.build(collection_id...)构建社区聚出更高层的概念。打开 Dashboard实体、集合与图谱搜索集合页可以编辑集合描述也能让 LLM 自动生成。描述会参与建图写清楚能提升抽取质量。图谱建好后带图检索才真正好玩。普通搜索只匹配文本片段打开 graph 设置后答案可以跨文档顺着关系跳转。# 仅展示关键配置 client.retrieval.search( Della 和 Jim 各自给了对方什么, search_settings{graph_settings: {enabled: True}}, )对话界面里连续追问时它会基于同一份知识库回答引用来源清晰可见。提速与避坑3 个容易踩的坑坑表现解法抽取没跑完就建图图谱缺实体关系断链等文档状态完成后再 pull实体大量重复一篇故事抽出 120 个去重后只剩 20 个pull 前先调用documents.deduplicate抽取了但搜索不到关系没有进集合图谱抽取不等于建图graphs.pull要单独执行还有一个提速点本地跑模型时Ollama 默认上下文只有 2048 token长文档抽取容易截断建议把num_ctx调到 16k。接下来去哪R2R 把文档检索做成了可以持续维护的资产而不是一次性的问答。抽取、去重、社区聚类的每一步细节从 graphs 实操文档 开始看混合检索的调参逻辑docs/documentation/ 里有完整说明。【免费下载链接】R2RSoTA production-ready AI retrieval system. Agentic Retrieval-Augmented Generation (RAG) with a RESTful API.项目地址: https://gitcode.com/GitHub_Trending/r2/R2R创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考