十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Flexible metadata harvesting for ecology using large language models

Flexible metadata harvesting for ecology using large language models 文章总结与翻译一、文章主要内容在生态与环境科学领域,整合多源数据集对研究至关重要,但不同数据提供商平台的元数据可用性和标准存在差异,给研究者查找、整合合适数据集带来阻碍。为此,研究团队开发了一款基于大型语言模型(LLM)的元数据收集器,其核心功能与相关研究情况如下:核心功能:能从任意数据集的登录页面灵活提取元数据,并借助现有元数据标准将其转换为用户自定义的统一格式,同时可通过计算嵌入相似度和统一提取元数据格式以实现基于规则的处理,从而识别数据集间的关联。技术细节:采用Python的BeautifulSoup和Playwright库抓取网站登录页面,用BeautifulSoup解析.xml文件,在Python 3环境中进行LLM调用及后续分析可视化,对比使用OpenAI GPT-4和Google Gemini 2.5 Flash两种LLM,还利用SBERT计算描述嵌入以得到余弦相似度。评估情况:在来自7个数据提供商的16个数据集上对元数据收集器进行评估,这些数据集涵盖陆地和水生、生态和环境领域,包括原位观测和地球观测数据集。通过手动标注创建基准数据集,区分需模糊匹配和精确语义匹配的元数据字段,分别采用ROUGE-L F1分数、Faithfulness和Response Relevancy作为评估指标。研究结果:该收集器能成功从所有7个数据提供商获取元数据并转换为两种不同格式;LLM后处理流程大幅提升所有元数据字段的准确性,Gemini 2
返回列表