十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Evidently 数据质量检测完全指南:一键筛查缺失、重复与异常三类数据问题

Evidently 数据质量检测完全指南:一键筛查缺失、重复与异常三类数据问题 Evidently 数据质量检测完全指南一键筛查缺失、重复与异常三类数据问题【免费下载链接】evidentlyEvidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidentlyEvidently 数据质量检测能把数据集里的三大隐患——缺失值、重复行、异常值——一次性筛出来组装好内置指标、跑一次报告就能拿到一份带通过/失败结论、可归档可对比的 HTML 质量报告。作为开源的 ML 与 LLM 可观测性框架Evidently 内置 100 多个指标覆盖从离线验证到线上监控的完整链路而数据质量筛查正是其中最常用的入口。先让数据开口说话质量事故往往先于模型爆发模型指标突然掉点、线上预测整体偏移根因经常不在算法而在喂给它的数据。等模型报警再回头查往往已经晚了。把质量检查前移到数据层是更省事的姿势。 三个最容易被忽视的质量盲区缺失值某个字段悄悄变成 NULL模型相当于在空气上训练问题会沿着特征一路传导到预测结果。重复行上游 join 或回补逻辑出错样本被复制放大部分群体被隐性加权评估指标失真却难以察觉。异常值个别极端读数把均值、方差全部带偏下游的分位数、归一化全都会跟着走形。这三类问题的共同点是单看一条记录都合法只有从整表视角统计才会现形。Evidently 的设计思路正是如此——用可计算的指标去量化它们而不是靠人肉翻数据。Evidently 的数据质量指标体系从行到列全覆盖指标是 Evidently 的基本单元每个指标只算一个数同时自带阈值测试算完立刻给出通过/失败的判定而不只是给你一个数字。缺失与重复检测表级和列级各有专职指标数据集层面的总账指标集中在 数据集统计指标实现 中全部可以从 metrics 包 直接导入DatasetMissingValueCount统计整表中缺失单元格的总数用来盯空值是否突然变多DuplicatedRowCount统计完全重复的行数专门暴露 join/回补引入的冗余DuplicatedColumnsCount找出彼此完全相同的列提示 schema 里的双胞胎字段。定位到具体字段时则用列级指标。列统计指标实现 中的MissingValueCount指定列名后返回该列的缺失数量适合盯单个关键字段如主键、订单号的空值率。异常值检测 统计指标 阈值测试Evidently 没有一个叫异常值检测器的黑盒。它的做法是把异常拆成两半统计指标负责算出最小值、最大值、均值、标准差这类分布特征阈值测试负责判断这个数越界没有。指标值一旦越过阈值对应测试失败并在报告中标记异常也就被显性化了。这套指标负责算、测试负责判的分工让检查规则天然可配置、可复用。三步生成你的第一份数据质量报告 概念清楚了上手比想象中快。安装 Evidently 并准备数据直接装发布版即可pip install evidently如果要从源码跑先克隆仓库再装最小依赖git clone https://gitcode.com/GitHub_Trending/ev/evidently cd evidently pip install -r requirements.min.txt数据用任意 pandas DataFrame本例直接读 CSV。组装指标、运行并导出报告核心示例一共六行覆盖重复行与关键列缺失值两项检查import pandas as pd from evidently import Report from evidently.metrics import DuplicatedRowCount, MissingValueCount df pd.read_csv(bookings.csv) report Report(metrics[DuplicatedRowCount(), MissingValueCount(column_namecustomer_id)]) report.run(current_datadf) report.save_html(data_quality_report.html)跑完后data_quality_report.html是一份独立网页每项指标的当前值、测试结论、对比基线都在同一页里可以直接发给同事也可以按天存档观察趋势。进阶把检查规则改成你自己的再让它持续跑起来⚙️ 给指标挂上自定义阈值测试内置指标自带默认测试比如重复行应当为 0但业务阈值往往要自己定。在 测试别名模块 中lt、gt、eq、is_in这些函数都可以直接绑定到指标上覆盖默认规则from evidently.metrics import DuplicatedRowCount from evidently.tests import lt report Report(metrics[DuplicatedRowCount(testslt(0))])阈值想松想紧、是否标为 critical失败即阻断都由这一处参数决定。懒得逐个挑指标时也可以用 预置模板 中的DataSummaryPreset一次带上整套数据集概况指标。从一次性体检到持续监控报告解决的是此刻有没有问题接入看板则回答问题何时开始出现。仓库的 Grafana 示例目录 提供了现成的数据漂移与 LLM 评估仪表板配合定时计算指标质量趋势就能在图上一目了然当某天缺失值曲线陡增时你追的是数据源的变更而不是模型的玄学。【免费下载链接】evidentlyEvidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表