
一、研究背景与问题痛点关系数据库应用广泛但其模式缺乏语义难以支持语义查询、跨源数据集成、知识图谱构建等任务。将其转换为OWL本体可以解锁这些能力。现有方法局限传统自动化方法如W3C直接映射仅基于表/列名、数据类型、外键等结构线索生成的是“浅层本体”缺乏类层次、不相交公理、属性限制、注释、出处等丰富语义信息。已有基于LLM的方法主要针对非结构化文本未针对关系模式的结构特性如外键语义、表间连贯性、模式约束进行优化且多为单次生成容易遗漏元素或产生错误。二、核心贡献——RIGOR方法作者提出了RIGORRetrieval-augmentedIterativeGeneration ofRDBOntologies一个迭代式检索增强生成RAG流水线使用LLM自动将关系模式转换为OWL2DL本体且几乎无需人工干预。关键设计如下表级迭代处理FK-BFS顺序按照外键依赖关系的广度优先顺序逐个处理表确保依赖表处理前被引用表已存在同时避免上下文窗口溢出。确定性直接映射保证覆盖对每个表先应用W3C直接映射规则生成一个基础OWL片段保证每个列都被表示清洗掉ETL工件列。三源检索增强RAG对每个表从三个来源检索最相关的上下文每个来源取top-3核心本体已处理表积累的本体外部领域本体如BioPortal、音乐本体文本文档数据字典、注释等采用all-MiniLM-L6-v2嵌入Faiss近似最近邻检索。Gen-LLM语义丰富将直接映射检索上下文输入LLM要求其执行六类语义增强操作添加rdfs:label/comment扩展缩写注释单位声明SubClassOf层次为编码整数值添加注释说明声明DisjointWith不相交公理为NOT NULL/UNIQUE列添加存在性限制链接到外部本体equivalentClass/subClassOfJudge-LLM验证与修正使用独立的LLM对生成的增量本体进行14项标准检查分关键/重要/次要三级输出批准/带修正批准/拒绝。结合确定性图验证类型一致性、域/范围、XSD类型等。最多重试2次若仍失败则选择最佳候选或回退到直接映射。增量合并验证通过后将增量本体合并到核心本体中供后续表使用。三、实验设计数据集两个医学数据库肝癌登记库16表/350列/15 FK、eICU-CRD31表/559列/30 FK一个音乐领域数据库Chinook11表/67列/11 FK另外使用BURR基准的ISWC数据库进行额外评估。对比方法W3C直接映射无LLM基线方法零样本LLM仅输入表模式非迭代RAG单次生成有检索但无迭代和验证RIGOR完整流水线评估手段8种语法与逻辑一致性RDFLib HermiTOOPS!建模陷阱检测结构分析类/属性/公理/注释/出处数量语义覆盖嵌入相似度≥0.55LLM-as-JudgeGPT-5.4基于能力问题评分7个维度10位人类专家评估4个代表性表Kendalls W衡量一致性BURR基准测试基于映射的F1消融实验分析各检索源的贡献四、主要结果质量大幅提升RIGOR在所有三个数据库上均排名第一LLM-as-Judge和专家评估均一致。在OOPS!陷阱检测中RIGOR将陷阱数量从数百个降至个位数或零Chinook上为0。语义丰富性显著RIGOR是唯一能稳定产生注释、出处断言、SubClassOf和DisjointWith公理的方法。其他方法直接映射、基线、非迭代均无法生成这些结构。模式覆盖保持表覆盖率达100%列覆盖率达0.77~1.00兼顾丰富性和完整性。BURR基准领先RIGOR在类F10.73、关系F10.67、属性F10.52上均优于W3C-Mapper、RDB2Onto、OntoGenix等系统。消融实验三个检索源均贡献正向效果完整RIGOR在外部本体对齐和文档对齐上的平均F1最高。专家一致性Kendalls W在0.39~0.72之间多数表呈现显著一致RIGOR在70%的评估中排名第一。五、局限与未来工作列覆盖不完全0.77~1.00部分属性可能在丰富时被遗漏。残留建模陷阱如P19表明Judge-LLM偶尔未能捕获Gen-LLM的错误。未来方向引入工具反馈如OOPS!作为agentic工具调用增强验证。利用实例级信号基数、值分布辅助消歧。耦合符号推理器以改进不相交公理生成。RIGOR是首个将迭代RAG、直接映射、LLM生成与LLM验证有机结合的本体自动构建系统在无需人工干预的情况下显著超越了现有基于规则和基于LLM的单次方法在多个领域和评估维度上均验证了其有效性。其核心贡献在于通过迭代式“结构覆盖→检索增强→语义丰富→验证修正”的闭环实现了从关系模式到高质量OWL2DL本体的自动转换。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要从关系数据库模式推导OWL本体支持语义互操作性和下游任务如知识图谱填充、基于本体的数据访问、基于图的学习和自动推理。现有方法要么需要大量的专家工作要么生成浅层本体这些本体反映了逻辑模式结构但未能完全捕获领域语义。我们提出了RIGOR从关系数据库本体进行检索增强的迭代生成这是一个LLM驱动的流水线可将关系模式转换为语义丰富的OWL2DL本体且只需最少的人工干预。对于每个关系表RIGOR生成一个直接映射以保证模式覆盖然后通过从三个来源检索来丰富它关系模式上下文和文档、外部领域本体以及一个随着每个验证后的片段被整合而逐步增长的核心本体。生成式LLM产生带有出处注释的本体片段增量本体这些片段在整合前由一个独立的评判LLM进行验证并在需要时进行修正。在外键约束的引导下该过程迭代遍历关系表直到覆盖整个模式。在跨越两个领域的三个数据库上的实验表明RIGOR在标准质量指标上始终优于基线方法且无需人工监督。关键词关系数据库 · 本体 · 大型语言模型。1 引言关系数据库[40]为存储、查询和操作数据提供了一个形式化的框架具备强一致性和完整性保证并作为医疗保健、金融、电子商务和政府中企业应用的支柱。然而关系数据库模式使得对其内容进行语义查询[40]或跨异构数据源集成数据变得困难。在关系数据库上定义一个OWL本体能够解锁关系模式本身无法提供的能力基于本体的数据访问OBDA它支持对实时数据库进行概念上强大的查询而无需物化[64]知识图谱填充它将数据物化为RDF实例用于基于图的学习[48]和推理[13,63]以及跨异构源的语义集成[60]。一个镜像逻辑模式的浅层本体已经可以提供其中一些好处然而一个语义丰富的本体——具有类层次结构、不相交公理、表达性属性限制以及与既定领域词汇的对齐——能够增强推理和跨系统互操作性。过去从数据库模式构建这样的本体是劳动密集型的。现有的自动化方法仅依赖于结构线索——表和列名、数据类型和外键约束——并产生缺乏有效人类和机器推理器所需表达性公理的本体[6]。LLM[22]在知识密集型任务中表现出色包括理解文本、编码概念知识[66]、执行算法推理[67]和生成结构化输出[31,30]。它们已被应用于从文本生成本体[5,46,36,39,29]最近的工作将它们应用于从关系模式构建本体[65]和对此类系统进行基准测试[27]。然而现有的基于LLM的方法针对非结构化文本并未解决关系模式特有的挑战例如解释外键语义、维护相互依赖表之间的连贯性以及将生成置于模式约束内导致生成的本体可能遗漏模式元素或错误表示结构关系。我们引入RIGOR一个迭代的检索增强生成RAG流水线使用LLM将关系数据库模式转换为语义丰富的OWL本体见图1。该流水线逐个处理表遵循外键关系并将每个生成步骤建立在关系模式结构之上。对于每个表在进行任何LLM参与之前确定性直接映射提供模式覆盖。然后从三个互补来源检索相关上下文关系模式及其文本文档、从先前处理的表构建的核心本体以及外部领域本体。一个生成式语言模型Gen-LLM通过标签、类层次结构、不相交公理和出处注释丰富直接映射产生一个增量本体。在集成之前一个独立的评判LLM验证并在必要时修正该片段。流水线迭代直到达到完整的模式覆盖生成一个保留知识图谱填充和OBDA所需的模式到本体对应关系的本体。我们在两个领域两个医学数据库和一个音乐领域数据库上评估RIGOR并与W3C直接映射[51]、一个LLM基线[34]和一种单次非迭代生成方法进行比较。通过一致性检查、语义相似度、建模陷阱检测和专家判断来评估本体质量。RIGOR在所有竞争方法中始终表现优异。图1RIGOR流水线概述。表按照外键遍历顺序迭代处理a。对于每个表生成直接映射b从外部本体仓库c、文本文档d和扩展中的核心本体e检索相关上下文。在提示构建期间f将直接映射和检索到的上下文传递给Gen-LLM后者生成语义丰富的增量本体g。增量本体被验证并在必要时由人类专家或评判LLM进行细化随后进行确定性图验证h并将接受的结果集成到核心本体中以供后续迭代使用i。2 相关工作2.1 从关系数据库学习本体从关系数据库到语义表示的转换已被广泛研究[57,4]。W3C直接映射和R2RML [51,3,7] 将每个表行转换为RDF资源生成一个保留逻辑模式但不引入类层次结构、属性限制或指向领域词汇链接的知识图谱。BootOX [23] 进一步将表映射到类将外键映射到对象属性然后通过LogMap将结果与领域本体对齐然而它需要一个预先存在的目标本体无法从头生成。诸如Karma [25]、IncMap [43]、MIRROR [35]和D2RQ [55]等工具已在RODI基准测试[42]中评估该测试表明所有系统在处理复杂的模式-本体不匹配问题时都遇到困难编码隐式层次结构的表、表示n元关系的连接表以及反规范化设计一直被错误映射或未被映射。Ben等人[6]使用基于外键和数据模式的启发式方法从数据库学习本体但他们的方法依赖于固定的映射规则无法推广到其编码模式之外并假设数据是规范化的这在现实世界的临床或企业数据库中很少见其中隐式层次结构和神秘的列命名例如BM_DEP表示骨髓抑制很常见。现有方法共有两个局限性它们依赖于无法捕获隐式语义的固定结构规则并且它们生成的本体缺乏注释、出处或超出模式直接编码的公理深度。基于LLM的本体学习。LLM已被应用于本体生成主要来自非结构化文本[5,1,29,39,10,9,11]。Babaei等人[5]评估了零样本LLM在术语类型化、分类法发现和关系提取方面的表现性能有限特别是在模型缺乏领域基础的分类法和关系任务上。OntoKGen [1] 使用GPT-4结合迭代式专家参与提示改进了结果但仍依赖于每一步的人工指导并针对技术文档而非结构化模式。这些基于文本的方法并未解决关系模式特有的挑战例如解析连接表、解释外键语义或处理反规范化设计。Xiao等人[65]将LLM应用于从数据库模式构建虚拟知识图谱结合结构模式识别与LLM驱动的对齐和映射模块。他们的系统假设存在一个用于对齐的预先存在的目标本体并以单次传递方式运行如果初始生成包含错误这些错误会未经修正地传播。当前基于LLM的方法在该任务上存在困难这一点由BURR基准测试[27]证实该基准使用基于映射的指标评估从关系数据库学习本体他们的结果表明当前基于LLM的方法在映射精度和召回率上不如基于规则的系统这表明仅靠LLM——没有在源模式中的结构化基础——尚不能产生足够质量的本体。2.2 基础我们的工作建立在三个既定范式之上。检索增强生成RAG[28]通过在生成前检索相关上下文来提高事实准确性减少问答、对话和代码生成中的幻觉[15]然而RAG本身并未解决本体工程的结构约束如类型一致性、域/范围正确性或与OWL概要的一致性。LLM即评判者范式[19]使用辅助LLM评估生成的输出它已被应用于基于能力问题[41,26]和陷阱检测[29]的本体评估但仅作为事后评估器而非生成过程中的循环验证器。能力问题[18]验证本体是否捕获了所需的领域知识最近的工作使用LLM根据本体[47]或数据集[2]自动生成它们。3 RIGOR算法3.1 概述与设计原理3.2 数据结构我们定义了整个流水线中使用的数据结构附录6.1表2提供了摘要。3.3 基于嵌入的检索将所有可用上下文传递给Gen-LLM会超出LLM上下文窗口限制并引入噪声密集检索仅从每个来源中选择最相关的元素并且比关键词匹配更好地处理同义词。每个生成步骤使用密集嵌入从三个来源——核心本体、文档和外部仓库——进行检索。3.4 提示构建与生成提示还施加了输出结构约束以减少建模错误类型一致性没有URI同时被声明为对象属性和数据属性、每个属性恰好一个rdfs:domain和一个rdfs:range、数据属性范围使用标准XSD数据类型以及除非有明确理由否则禁止自反对象属性。完整提示模板见附录6.3图2。3.5 验证与精炼LLM生成的本体片段可能包含提示约束和Gen-LLM自一致性都无法防止的建模错误。每个增量本体ΔOrΔOr在集成到核心本体之前图1-(h)经历两个验证阶段评判LLM和确定性图验证。评判LLM评估。评判LLM根据14个标准评估ΔOr这些标准分为3个严重级别基于既定的本体质量框架[58]、OOPS!陷阱目录[45]和OWL2DL规范[59]。完整提示模板见附录6.3图3。评判LLM返回三个决定之一Approved按原样接受、Approved_With_Corrections接受并附带修正后的片段或Rejected严重违规需要重新生成。确定性图验证。在将接受的片段解析为RDF图之后一个基于规则的验证器检查类型一致性没有URI同时被声明为对象属性和数据属性、域/范围基数、仅XSD数据类型范围以及完整的模式覆盖。重试机制。任一阶段的失败都会连同已识别的问题作为修正指令返回给Gen-LLM。此循环重复最多k2次尝试如果仍然被拒绝评判LLM在其修正片段和直接映射DMr中选择最佳候选。该循环在算法1第10-21行形式化。我们设置k2遵循LLM自我精炼文献[33,52]的证据该证据表明纠正性反馈在超过两次迭代后收益递减。3.6 增量本体合并4 实验4.1 评估数据库关系数据库模式。我们在两个医学数据库和一个音乐领域数据库上进行评估它们在来源、大小和模式复杂性上各不相同。肝癌数据库是一个肝癌登记库包含16个表、350列和15个外键约束。由于该数据库不公开它防止了LLM测试数据泄露[41]。eICU-CRD [44]eICU协作研究数据库建模重症监护病房入院情况31个表、559列、30个外键约束可通过PhysioNet [17]获取。这两个数据库互为补充肝癌登记库具有紧凑的专业模式带有领域特定的编码值例如ECOG评分而eICU-CRD具有广泛的通用ICU模式包含许多表和一个广泛的外键结构。为了进一步评估医学之外的跨领域泛化能力我们使用Chinook数据库[49]它建模一个数字音乐商店包含艺术家、专辑、曲目、播放列表、客户、发票和员工11个表、67列和11个外键约束。它们共同测试RIGOR是否能泛化到不同的模式大小、复杂性和领域特异性。4.2 能力问题生成我们使用能力问题作为事后评估工具。我们提示一个LLM使用思维链提示[62]为数据库模式中的每个表生成五个能力问题每个问题都是一个自然语言问题配有一个解释本体如何解决它的答案。生成的能力问题由领域专家验证。4.3 外部本体仓库对于生物医学数据库我们根据领域专家的推荐从BioPortalsup4/sup中选择了四个本体选择它们是为了覆盖评估数据库中所代表临床领域的互补方面疾病分类ICD-10、疾病语义人类疾病本体、细胞生物学细胞本体和营养学营养研究本体。对于Chinook数据库我们使用音乐本体sup5/sup、表演音乐本体sup6/sup和DOREMUS本体sup7/sup。统计数据见附录6.2表4。4.4 实验设置数据库文档。我们使用GPT-4o生成数据库实体的自然语言描述并由领域专家审查。大型语言模型。生成。我们使用了来自不同家族的三个LLM均通过OpenRouter APIsup8/sup访问Claude-Opus-4.6Anthropicsup9/sup、Mistral-Small-24B-Instructsup10/sup和DeepSeek-V3sup11/sup。每个模型在所有三种基于LLM的方法第4.5节中用作生成模型。在RIGOR中相同的模型还充当评判LLM。评估。能力问题使用Mistral-Small-24B-Instructsup10/sup生成第4.2节。由LLM即评判者第4.6节策略6执行的评估使用了GPT-5.4sup12/supOpenAI这是一个独立的模型家族以消除自我评估偏差。计算资源和成本。本体生成在一个带有两个NVIDIA A100 GPU的HPC节点上运行。按数据库和模型划分的生成运行时间、API请求、令牌使用量和成本见附录6.4表15。4.5 本体生成方法我们在一个受控光谱中比较四种方法每种方法在前一种方法的基础上增加一种能力附录6.2表3。(i) W3C直接映射 [51]在整个关系到本体文献[42]中使用的标准确定性基线。它在没有任何LLM参与的情况下将模式转换为OWL建立了仅靠结构翻译所能达到的下限第3.2节。由于Sequeda等人[51]形式化地定义了直接映射而没有提供可重用的实现我们根据其映射规范实现了该基线。(ii) 基线 [34]Mateiu等人[34]提出的基于LLM的本体生成方法最初用于从自然语言生成本体此处改编用于数据库模式。由于没有提供实现我们从论文的提示和方法描述中重现了该方法将自然语言输入替换为表模式。LLM在零样本设置中仅接收表模式——没有检索到的上下文没有验证——隔离了LLM参数化知识的贡献。完整提示见附录6.3图4。(iii) 非迭代扩展基线(ii)包括完整的模式上下文、FAISS检索的文档和外部本体概念。这代表了当前基于RAG的本体生成实践状态[21]并隔离了检索增强相对于迭代精炼的效果。完整提示见附录6.3图5。(iv) RIGOR完整流水线从空的核心本体O0∅开始添加直接映射作为生成种子扩展中的核心本体作为跨表上下文以及带有有限重试的评判LLM验证算法1。这测试了迭代丰富和验证是否产生超出仅检索的收益。4.6 评估策略我们采用八种互补的评估技术语法有效性检查使用RDFLib检查每个本体是否符合OWL2DL。逻辑一致性检查使用HermiT推理器[16]验证逻辑一致性。建模陷阱我们使用OOPS! [45]检测生成本体中的常见建模陷阱与先前工作[29]一致。OOPS!扫描41个陷阱P01-P41并根据其对本体质量的影响将每个发现分类为关键、重要或次要。结构分析我们使用Ontometrics [32]报告每个本体的类、对象属性和数据属性、公理、注释和出处断言的数量。语义覆盖为了了解源模式中有多少被表示在本体中我们使用all-MiniLM-L6-v2嵌入模式表和列名以及本体类和属性名。如果至少一个本体元素超过0.55的余弦相似度阈值则认为模式表或列被覆盖该阈值是经验调整的与先前工作[14,12]一致。通过能力问题表现评估本体质量我们使用GPT-5.4作为LLM即评判者第2.2节以能力问题第4.2节作为表级评估锚点指定每个本体应捕获的领域知识。对于每个表我们比较四个匿名化的本体片段对应第4.5节中的四种方法。每个片段包含匹配的owl:Class、其属性、注释和范围。评判者接收这些片段、表模式和每个表五个能力问题肝癌80个eICU-CRD 155个Chinook 55个然后将片段排名为第1至第4名并根据既定的本体质量框架[44,58,53]在七个0-5分维度上对每个进行评分准确性、完整性、简洁性、适应性、清晰性、一致性和领域丰富性。分数在表上平均评分质量维度的定义和完整提示见附录6.3图7。专家评估十位本体工程和知识表示领域的专家简介见附录6.4图8通过结构化调查评估了两个医学数据库的本体质量每个数据库评估两个表。我们选择了在所有四个本体中都出现且涵盖不同建模挑战的表general_aftercare肝癌具有多个外键的临床随访、complication肝癌编码严重程度等级和过程部分-整体关系、hospitaleICU-CRD紧凑的管理实体和patienteICU-CRD被大多数表引用的密集连接实体。专家们收到了表模式、5个能力问题和四个匿名化的本体片段直接映射[51]和三个由Claude生成的基于LLM的本体标记为A-D。他们在与策略6相同的七个维度上对每个进行评分0-5分制并将片段排名为第1至第4名。评分者间一致性使用Kendalls W [24]测量它量化了多个评分者在序数排名上的一致性。本体学习基准测试我们使用BURR [27]基准测试将RIGOR与已建立的本体学习系统进行比较。BURR通过将数据库到本体的映射与黄金标准进行比较测量类C、关系R和属性A的基于映射的F1。我们使用BURR的ISWC数据库涵盖国际语义网会议领域会议、论文、人员和主题。该数据库有9个表、46列和11个外键。我们使用Claude生成RIGOR本体使用GPT-5.4生成文档并使用SWRC sup13/sup和BIBO sup14/sup作为外部本体。BURR评估映射而非本体结构因此我们将RIGOR的prov:wasDerivedFrom注释导出为D2RQ映射[55]。4.7 结果我们评估了30个本体3个LLM × 3种基于LLM的方法 × 3个数据库加上3个直接映射[51]本体。详细结果见附录6.4表7-11。策略1-2语法和一致性。所有30个本体均为有效的OWL2DLRDFLib且逻辑一致HermiT。策略3建模陷阱。OOPS!报告显示所有RIGOR变体的陷阱数量大幅减少附录6.4表7。在eICU-CRD上直接映射[51]产生665个陷阱每个基线[34]本体超过400个RIGOR对Claude和Mistral将此数量减少到个位数对DeepSeek减少到26个。在肝癌数据库和Chinook上类似模式成立RIGOR始终比所有其他方法产生少一到两个数量级的陷阱所有三个RIGOR变体在Chinook上均达到零陷阱。这种减少不仅仅是后处理效果虽然一些基线陷阱例如缺少域/范围声明P11可以机械修复但此类修复不提供有意义的标签、出处或类层次结构。策略4结构分析。RIGOR是唯一一种始终产生注释断言、出处三元组和SubClassOf公理的方法附录6.4表8。直接映射[51]和基线方法[34]均不产生这些非迭代方法在某些配置中产生注释但从不产生出处或类层次结构。RIGOR也是唯一一种生成owl:disjointWith公理的方法在Chinook上使用Mistral生成13个这是一项即使对专用方法[56]也特别具有挑战性的任务没有其他方法产生任何不相交公理。策略5语义覆盖。RIGOR在添加策略4中报告的结构的同时保持高模式覆盖率附录6.4表9。在所有数据库中RIGOR变体覆盖所有表跨数据库和模型的列覆盖率在0.77到1.00之间。直接映射[51]通过构造达到相当的列覆盖率但没有注释、出处或子类公理。非迭代方法尽管检索相同的上下文但列覆盖率较低证实了单次生成会遗漏许多模式属性。策略6和7能力问题和专家评估。表1报告了来自两个互补评估者的质量分数和排名频率一个LLM即评判者GPT-5.4在所有表上以及十位人类专家在医学数据库的四个代表性表上。RIGOR在LLM即评判者评估的所有三个数据库上均排名第一并在两个医学数据库的专家排名中领先。最大的改进出现在清晰性和领域丰富性上其中注释、值文档和类层次结构直接受益附录6.4表1011。非迭代方法在eICU-CRD上表现最差LLM即评判者在所有31个表上将其排在最后证实了仅凭检索到的上下文没有模式基础和验证是不够的。如附录6.4表12所示十位专家在所有四个评估表的排名上显示出显著一致性Kendalls W 范围从0.39中等一致性到0.72强一致性。RIGOR在40次专家评估中的28次70%中被排名第一。策略8本体学习基准测试。在BURR [27]的ISWC数据库上RIGOR在生成本体的系统中取得了最高的类F10.73、关系F10.67和属性F10.52。Laskowski等人[27]得出结论当前基于LLM的方法在映射恢复方面不如基于规则的系统RIGOR通过将LLM生成与基于模式的出处相结合逆转了这一发现作为语义丰富本体构建的副产品实现了有竞争力的映射分数。表1本体质量直接映射[51]和三种基于LLM生成的本体的平均分数0-5分七个质量维度平均和排名频率。LLM即评判者GPT-5.4在所有解析的表上。专家10位人类专家在来自两个医学数据库的四个代表性表上。排名第1计数/总数。LLM即评判者排名第1的分母分别是16个肝癌表、31个eICU-CRD表和11个Chinook表。专家评估的分母是每个医学数据集20次评估。4.8 消融研究为了隔离每个检索来源的贡献我们使用Claude在Chinook上对RIGOR进行了消融。检索来源为1关系模式和核心本体上下文2外部领域本体和3文本文档。我们评估五种变体无检索、三种单源变体和启用所有源的完整RIGOR。所有变体保留确定性直接映射只有检索到的上下文不同。我们使用本体类/属性作为候选资源元素作为参考评估生成本体与每个检索资源的对齐情况模式表/列名、外部本体类/属性标签和文档句子。两边都使用all-MiniLM-L6-v2嵌入当余弦相似度至少为0.55时计为匹配我们报告精确度、召回率和F1。结果见表14显示所有变体的模式对齐几乎饱和因为直接映射的主干已经保留了表和列名。完整RIGOR实现了最高的外部本体召回率和F1以及三个资源的最高平均召回率和F1表明最强的跨源对齐。单源变体提供有针对性的增益例如仅文档在文档F1上最高但完整RIGOR在模式、外部本体和文档之间提供了最佳的整体平衡。5 结论我们提出了RIGOR一个迭代的RAG流水线用于将关系模式转换为OWL2DL本体。直接映射保证模式覆盖Gen-LLM使用不断增长的核心本体、检索到的文档和外部本体对其进行丰富评判LLM在集成前验证每个增量本体。在三个数据库和两个领域的实验表明RIGOR始终优于所有竞争方法这一点得到了LLM即评判者、10位人类专家和BURR基准测试的证实。局限性和未来工作。列覆盖率在0.77到1.00之间表明在丰富过程中可能会遗漏一些模式属性。残留的建模陷阱例如P19反映了评判LLM未能捕获Gen-LLM错误的情况通过代理工具调用将来自OOPS!等验证器的基于工具的反馈集成到生成循环中是一个有前景的方向。RIGOR通过设计操作于模式和文档确保跨部署的可移植性然而当文档不可用时实例级信号基数、值分布、隐式键发现可以帮助消除神秘列的歧义。将Gen-LLM与符号推理器结合可能会改善不相交公理[56]。