用 Evidently 给数据做体检:缺失值、重复值、异常值一次查清
用 Evidently 给数据做体检缺失值、重复值、异常值一次查清【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently模型上线第三天预测准确率突然掉下来。排查半天发现模型本身没动是上游一个字段开始大面积缺值——这就是典型的先查数据再怀疑模型。Evidently是一个开源的 ML 与 LLM 可观测框架覆盖 100 指标一次 Report 就能把数据质量检测里的缺失值、重复值、异常值全部过一遍。Evidently 是什么给 ML 数据做体检的工具一句话定位Evidently 帮你给数据和模型做体检。它不只是评估一次而是可以周期性地在生产上反复跑同一套检查跟踪数据质量随时间的变化这也是它作为 ML 监控工具的核心价值。思路很直接把数据是不是出问题了这个模糊问题拆成一组可度量的指标每个指标还自带默认的通过/失败规则。五分钟跑通第一次数据体检安装步骤pip install evidently # 或者从源码安装 git clone https://gitcode.com/GitHub_Trending/ev/evidently生成第一份数据质量报告第一次跑不用配置任何东西用预设拼一个 Reportrun 之后存成 HTMLimport pandas as pd from evidently import Report from evidently.presets import DataSummaryPreset df pd.read_csv(train.csv) snapshot Report([DataSummaryPreset()]).run(df) snapshot.save_html(data_quality_report.html)打开生成的 HTML每个字段的行数、缺失数、分布一目了然。之后你可以把预设换成单个指标做深度排查也可以在run()里传入参考数据集做漂移对比。三类数据问题逐个排查缺失值哪些字段在漏数据现象长什么样某字段偶尔出现空值或整列突然全是 NaN。模型如果默认把缺失填 0会悄悄毒化预测结果。Evidently 怎么查DatasetMissingValueCount看全表的缺失总数和缺失占比MissingValueCount(column...)逐列下钻。检测逻辑在 src/evidently/metrics/column_statistics.py默认测试规则是缺失数等于 0。结果怎么读重点看两个数——绝对数量和占比。占比低比如 1% 以下的文本字段缺失可以忽略但关键数值特征占比突然抬升多半是上游数据源出了问题对比参考数据集能立刻看出来。重复值数据集里有多少双胞胎现象长什么样数据里出现完全相同的行样本被重复计数统计指标失真严重时模型会背题。Evidently 怎么查DuplicatedRowCount统计完全重复的行数DuplicatedColumnsCount统计和其他列完全相同的列——后者通常意味着 ETL 环节复制粘贴或 join 写错了。实现都在 src/evidently/metrics/dataset_statistics.py。结果怎么读默认规则是两者都应为 0。重复行数从 0 变成非 0优先怀疑采集重复或管道重跑发现重复列更省事能直接定位是哪个字段被错误复制。异常值如何揪出离群点现象长什么样一个极端值是其他数据的百倍训练后指标整体被带偏。Evidently 怎么查column_statistics 模块里的MaxValue、MinValue、QuantileValue、StdValue帮你锁定各列的极值与分位数OutRangeValueCount则直接数出落在你定义合理区间之外的值有多少。结果怎么读先看最大值和中位数的量级差例如最大值是 median 的一千倍就需要分箱或对数变换。OutRangeValueCount的结果越偏离预期越应该怀疑采集错误而不是真实业务波动。报告与可视化把数据质量摆到台面上HTML 报告适合留档和分享snapshot.save_html()生成独立页面浏览器直接打开贴进周报或事故复盘都很方便。持续监控可以接 Grafana定时批量计算指标、写入数据库再搭一块面板实时盯。仓库里的 examples/grafana/ 给了完整示例数据质量从偶尔看一眼变成异常自动报警才是 ML 监控真正的价值所在。进阶自定义检测规则内置的 100 指标覆盖大多数场景但金额字段不能为负单批数据缺失率不能超过 5%这类业务规则往往需要自己写。参照 src/evidently/metrics/data_quality.py 里的实现即可模式统一一个指标类加一组测试条件读懂一个就能照葫芦画瓢写一个。上手建议从一张真实表开始先别追求功能全用DataSummaryPreset跑通你手头的一个真实业务数据集。留一份参考集和一份历史上正常的数据对比数据质量检测的价值会翻倍。阈值按业务校准默认测试规则只是起点关键字段的上下限要按业务容忍度调整。把报告挂上仪表板一次性 HTML 用来复盘持续监控才能拦住下一次事故。先查数据再怀疑模型——这个顺序别搞反。Evidently 把数据好像不太对变成了可检查的数字下一步很简单拿一份你手上的真实数据把第一份 Report 跑出来。【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考