拓冰建站拓冰建站
首页 / 资讯中心 / 正文

cleanlab Datalab 内置 IssueManager 体系全解析:从问题检测基类到自定义扩展实战

cleanlab Datalab 内置 IssueManager 体系全解析从问题检测基类到自定义扩展实战【免费下载链接】cleanlabCleanlabs open-source library is the standard>项目地址: https://gitcode.com/GitHub_Trending/cl/cleanlab导读本文以 cleanlab 官方文档 issue_manager 模块索引 为骨架系统讲解 Datalab 中问题管理器Issue Manager这一核心机制它如何为每个样本产出 0~1 的严重程度评分与is_issue标记、如何汇总数据集整体健康度以及 8 个内置问题管理器分别检测什么类型的数据问题。读完你将掌握内置 IssueManager 的注册清单与各自检测原理并能基于IssueManager抽象基类编写自定义问题类型并注册进 Datalab。⚠️模块稳定性说明文档与源码均强调issue_manager模块属于快速迭代的前沿功能API 在不同 cleanlab 版本之间不保证稳定见 issue_manager/index.rst 顶部 warning使用时请以当前安装版本的源码为准。一、模块定位Datalab 问题检测的插件中枢在 cleanlab 的>from cleanlab import Datalab import numpy as np from sklearn.neighbors import NearestNeighbors # 两个明显分离的簇 X np.vstack([ np.random.normal(-1, 1, (25, 2)), np.random.normal(1, 1, (25, 2)), ]) y np.array([0]*25 [1]*25) lab Datalab(data{y: y}, label_namey) # 为数据估值构建 kNN 图 knn NearestNeighbors(n_neighbors10).fit(X) knn_graph knn.kneighbors_graph(modedistance) # 显式指定 data_valuation 类型不在默认清单中 issue_types {data_valuation: {}} lab.find_issues(knn_graphknn_graph, issue_typesissue_types)示例源自 data_valuation.py 的 docstring。4.9 面向任务的专用管理器回归标签问题RegressionLabelIssueManagerregression/label.py用于回归任务的标签错误检测多标签问题MultilabelIssueManagermultilabel/label.py用于多标签分类的标签问题检测。它们分别注册在Task.REGRESSION与Task.MULTILABEL的label键下替换默认的分类版标签管理器见 issue_manager_factory.py。4.10 其他已导出但未在索引页列出的管理器模块__init__.py还导出了IdentifierColumnIssueManageridentifier_column.py用于处理标识符列相关的问题它不在文档索引 toctree 与默认执行清单中属于需要显式使用的高级功能。五、kNN 图共享管理器之间的协作机制多个管理器outlier、near_duplicate、non_iid、underperforming_group、data_valuation都依赖 kNN 图为避免重复计算knn_graph_helpers.py提供了统一的复用机制set_knn_graph(...)根据传入的features、find_issues_kwargs、metric、k与已有 statistics决定是复用已有的weighted_knn_graph还是新建并同步更新 statisticsknn_exists(...)/num_neighbors_in_knn_graph(...)检查现有图是否足够大从源码可见各管理器在find_issues中都会优先读取self.datalab.get_info(statistics)中的weighted_knn_graph只有在图不存在、邻居数不足或 metric 改变时才重建并把新图写回 statistics如 outlier.py 中的_build_statistics_dictionary。这意味着先跑一次 outlier 检测后后续的 near_duplicate、non_iid 等检测可复用同一张 kNN 图显著降低整体计算开销。测试覆盖见 tests/datalab/issue_manager/test_knn_graph.py 与 test_knn_graph_helpers.py。六、实战编写并注册自定义 IssueManager官方在 自定义问题管理器指南 中给出了从入门到进阶的完整示例这里提炼三个层级。6.1 基础版只实现 find_issuesimport numpy as np import pandas as pd from cleanlab import IssueManager class Basic(IssueManager): issue_name basic def find_issues(self, **kwargs) - None: # 为每个样本计算评分 scores np.random.rand(len(self.datalab.data)) # 构造样本级 issues DataFrame标记列 评分列 self.issues pd.DataFrame( { fis_{self.issue_name}_issue: scores 0.1, self.issue_score_key: scores, }, ) # 数据集整体评分 self.summary self.make_summary(scorescores.mean())要点issue_name是必填类属性self.issues必须同时包含is_{issue_name}_issue布尔列与{issue_name}_score评分列issue_score_key由元类自动生成整体评分用make_summary构造。6.2 进阶版补充 info 与 verbosity 报告class Intermediate(IssueManager): issue_name intermediate # 控制报告中额外信息的展示粒度 verbosity_levels { 0: [], 1: [std], 2: [raw_scores], } description Intermediate issues are a bit more involved than basic issues. def find_issues(self, *, intermediate_arg: int, **kwargs) - None: N len(self.datalab.data) raw_scores np.random.rand(N) std raw_scores.std() threshold min(0, raw_scores.mean() - std) sin_filter np.sin(intermediate_arg * np.arange(N) / N) kernel sin_filter ** 2 scores kernel * raw_scores self.issues pd.DataFrame( { fis_{self.issue_name}_issue: scores threshold, self.issue_score_key: scores, }, ) self.summary self.make_summary(scorescores.mean()) # 写入 info供 Datalab 查询与报告展示 self.info { std: std, raw_scores: raw_scores, kernel: kernel, }find_issues中通过关键字参数接收自定义配置如intermediate_arg这些参数会由Datalab.find_issues(issue_types...)传入。6.3 注册并接入 Datalabfrom cleanlab.datalab.internal.issue_manager_factory import register from cleanlab import Datalab import numpy as np import pandas as pd # 构造虚拟数据集 N 20 data pd.DataFrame( { text: [fexample {i} for i in range(N)], label: np.random.randint(0, 2, N), }, ) # 注册自定义问题管理器默认注册到 classification 任务 for issue_manager in [Basic, Intermediate]: register(issue_manager) # 实例化 Datalab 并执行问题检测 datalab Datalab(data, label_namelabel) issue_types {basic: {}, intermediate: {intermediate_arg: 2}} datalab.find_issues(issue_typesissue_types) # 输出报告 datalab.report(verbosity0)运行后报告形如Here is a summary of the different kinds of issues found in the data: issue_type score num_issues basic 0.477762 2 intermediate 0.286455 0 (Note: A lower score indicates a more severe issue across all examples in the dataset.) ------------------------------------------- basic issues ------------------------------------------- Number of examples with this issue: 2 Overall dataset quality in terms of this issue: 0.4778 Examples representing most severe instances of this issue: is_basic_issue basic_score 13 True 0.003042 8 True 0.058117 11 False 0.121908 ...示例与报告输出均摘自 custom_issue_manager.rst。6.4 注册函数的两种用法与注意事项register函数issue_manager_factory.py支持两种方式# 方式一装饰器仅适用于分类任务 register class MyIssueManager(IssueManager): issue_name: str my_issue def find_issues(self, **kwargs): pass # 方式二显式函数调用可指定任务 register(MyIssueManager, taskclassification) # register(MyIssueManagerForRegression, taskregression)需要注意register要求传入类必须是IssueManager子类且issue_name唯一重复注册同名会打印覆盖警告一个全局问题无法归因到单一样本的问题类型也建议尽量给出逐样本评分与布尔标记如 NonIID 管理器并且其issue_summary中num_issues必须大于 0否则默认不会出现在Datalab.report()中装饰器用法当前仅对分类任务生效回归/多标签任务请使用函数式注册并指定task。七、总结与延伸阅读IssueManager 是 cleanlab Datalab 问题检测能力的插件中枢IssueManager抽象基类定义了评分 标记 汇总 信息的统一契约元类保证issue_name必填并自动派生issue_score_key8 个内置管理器覆盖标签错误、离群点、近重复、非 IID、类别不平衡、表现不佳分组、全空行与低价值数据等常见数据质量问题并通过共享 kNN 图降低重复计算register机制允许用户无缝扩展自定义问题类型。进一步深入可参考各管理器 API 文档issue_manager.rst、label.rst、outlier.rst、duplicate.rst、noniid.rst、imbalance.rst、underperforming_group.rst、null.rst、data_valuation.rst任务专用管理器regression/label.rst、multilabel/label.rst自定义扩展教程自定义问题管理器指南单元测试tests/datalab/issue_manager/ 下针对每个管理器的测试文件可对照验证各检测逻辑的正确性与参数边界。【免费下载链接】cleanlabCleanlabs open-source library is the standard>项目地址: https://gitcode.com/GitHub_Trending/cl/cleanlab创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门