拓冰建站拓冰建站
首页 / 资讯中心 / 正文

植物病害检测数据集指南:PlantDoc-Dataset 从下载到训练模型完整教程

植物病害检测数据集指南PlantDoc-Dataset 从下载到训练模型完整教程【免费下载链接】PlantDoc-DatasetDataset used in PlantDoc: A Dataset for Visual Plant Disease Detection accepted in CODS-COMAD 2020项目地址: https://gitcode.com/gh_mirrors/pl/PlantDoc-Dataset如果你正在做植物疾病检测相关的图像分类项目PlantDoc-Dataset 是一个可以直接上手的植物病害数据集它来自论文《PlantDoc: A Dataset for Visual Plant Disease Detection》覆盖 13 种植物、最多 17 类病害共 2598 张经人工标注的图像适合用来训练和评估作物病害深度学习模型。下面按先懂它、再拿到它、最后跑起来的顺序带你完整走一遍。为什么需要这样一个植物病害数据集先说背景。根据原论文的描述印度每年因植物病害损失的作物产量高达 35%。问题不在于病害本身难治而在于发现得太晚——大多数农田缺乏实验室检测和专家资源等病害被确诊时损失往往已经造成。计算机视觉是一条有希望的路农民用手机拍一张叶子照片模型判断是否生病、生的是什么病。但这条路卡在数据上公开可用、类别齐全、标注干净的田间非实验室病害图像集一直稀缺。PlantDoc-Dataset 就是为此补上的一块短板团队从互联网抓取图像并投入约 300 个人工小时完成裁剪与标注最终沉淀出这套可以直接用于分类训练的数据集。可以把它理解成给病害分类模型准备的标准化教材——每个类别都有足够多的样例模型才有得学。数据集规模与质量2598 张图像是怎么组织的核心数字先放一张表里方便你评估它够不够用项目数值植物种类13 种苹果、番茄、玉米、土豆、蓝莓、樱桃等病害类别最多 17 类含健康叶与各类病斑、锈病、病毒等图像总量2598 个数据点标注工时约 300 个人工小时出处CoDS-COMAD 2020ACM 印度联合数据科学与数据管理国际会议仓库把图像直接按类别分目录存放结构非常直白也是它上手快的原因train/训练集约 2300 张每个子目录对应一个类别如train/Tomato Septoria leaf spot/、train/Apple Scab Leaf/test/测试集约 200 张类别目录与训练集一一对应方便你做留出评估类别命名以植物 病害为主比如Corn leaf blight玉米大斑病、Potato leaf early blight土豆早疫病、Apple rust leaf苹果锈病。个别类别样本偏少如Tomato two spotted spider mites leaf只有 2 张训练时建议结合数据增强或按需与相近类别合并。下面看几张典型的标注样本感受一下数据的真实程度番茄早疫病植物病害叶片样本 ![玉米灰斑病玉米叶片病害图像](https://raw.gitcode.com/gh_mirrors/pl/PlantDoc-Dataset/raw/5467f6012d78d1c446145d5f582da6096f852ae8/test/Corn leaf blight/corn-disease-update-fig-3-gray-leaf-spot.jpg?utm_sourcegitcode_repo_files) ![苹果锈病苹果叶片锈斑样本](https://raw.gitcode.com/gh_mirrors/pl/PlantDoc-Dataset/raw/5467f6012d78d1c446145d5f582da6096f852ae8/test/Apple rust leaf/20130610_110514.jpg?utm_sourcegitcode_repo_files) ![青椒细菌性叶斑病害图像](https://raw.gitcode.com/gh_mirrors/pl/PlantDoc-Dataset/raw/5467f6012d78d1c446145d5f582da6096f852ae8/test/Bell_pepper leaf spot/pepper_bacterial-spot_03_zoom.jpg?utm_sourcegitcode_repo_files)如何下载并核对数据获取方式很简单一条命令克隆仓库即可git clone https://gitcode.com/gh_mirrors/pl/PlantDoc-Dataset.git克隆完成后建议花两分钟核对一下数据完整性确认根目录下有train/和test/两个文件夹以及 README.md、LICENSE.txt抽查几个类别目录如train/Potato leaf late blight/、test/Apple Scab Leaf/确认图片可以正常打开用你熟悉的框架加载一次train/核对读入的类别数与图像数是否符合预期数据集采用 Creative Commons Attribution 4.0CC BY 4.0许可引用论文即可自由使用如需在学术工作中引用README.md 中已附好 BibTeX 条目。用 PyTorch 加载植物病害分类数据因为目录本身就是标准 ImageFolder 结构根目录/类别/图片加载代码可以少到几乎没有。下面这段最小示例就能把训练集读进来from torchvision.datasets import ImageFolder from torch.utils.data import DataLoader from torchvision import transforms transform transforms.Compose([ transforms.Resize((224, 224)), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]), ]) dataset ImageFolder(rootPlantDoc-Dataset/train, transformtransform) dataloader DataLoader(dataset, batch_size32, shuffleTrue) print(len(dataset)) # 图像总数 print(dataset.classes) # 类别列表即各子目录名测试集照搬同样的写法、把路径换成test/即可。之后接上你的模型ResNet、VGG 都行就能进入常规的训练—验证—测试流程。提升植物病害分类准确率的小技巧原论文在三个模型上验证过基于该数据集训练后病害分类准确率最高可以提升 31%。在你自己微调时可以优先尝试这几件事用 ImageNet 预训练模型微调ResNet、VGG 等预训练 CNN 当特征提取器只训练最后几层小样本类别收敛更快这是植物病害分类里性价比最高的一招数据增强不能省旋转、随机翻转、色彩抖动都能有效扩充多样性。对样本少的类别比如只有个位数的叶螨类尤其必要监控混淆矩阵而不是只看总体准确率早疫病和晚疫病、不同叶斑病之间的样本长得很像混淆矩阵能直接告诉你模型到底把哪两类搞混了用交叉验证兜底留出测试集之外再做几折交叉验证确认结果不是运气好它能用在哪些真实场景数据集的定位是降低计算机视觉进入农业领域的门槛所以落地方向很实际移动端病害识别应用把训练好的模型压缩后部署到手机农民田间拍照即可得到初步诊断精准农业研究作为基准数据集横向对比不同分类算法在植物疾病检测任务上的表现教学与课程实验目录结构简单、数据量适中2598 张非常适合作为机器视觉课程的入门项目学生从数据加载到部署全流程都能跑通如果你的任务是定位病斑在哪里而不只是判断什么病原作者还发布了对应的目标检测版本数据集PlantDoc-Object-Detection-DatasetREADME 中有说明可以按需选用。小结PlantDoc-Dataset 把13 种植物、最多 17 类病害、2598 张标注图像打包成了一个开箱即用的植物病害分类基准目录结构天然适配 ImageFolder加载只需几行代码配合预训练模型微调就能快速看到效果。对你来说最顺的路径是克隆仓库 → 核对train/与test/数据 → 用 ImageFolder 加载 → 预训练模型微调 → 用混淆矩阵定位短板。 数据、论文出处CoDS-COMAD 2020、许可方式CC BY 4.0都已在仓库里讲清楚直接开始动手就好。【免费下载链接】PlantDoc-DatasetDataset used in PlantDoc: A Dataset for Visual Plant Disease Detection accepted in CODS-COMAD 2020项目地址: https://gitcode.com/gh_mirrors/pl/PlantDoc-Dataset创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门