拓冰建站拓冰建站
首页 / 资讯中心 / 正文

ImageNet-22k到ImageNet-1k:convnextv2_base.fcmae_ft_in22k_in1k的迁移学习实践

ImageNet-22k到ImageNet-1kconvnextv2_base.fcmae_ft_in22k_in1k的迁移学习实践【免费下载链接】convnextv2_base.fcmae_ft_in22k_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/convnextv2_base.fcmae_ft_in22k_in1kconvnextv2_base.fcmae_ft_in22k_in1k是一款基于ConvNeXt-V2架构的图像分类模型通过全卷积掩码自编码器框架FCMAE预训练并在ImageNet-22k和ImageNet-1k数据集上进行微调为图像分类任务提供了高效解决方案。模型核心特性解析 架构与性能参数该模型属于图像分类/特征骨干网络拥有88.7M参数15.4 GMACs计算量28.8M激活值。训练时采用224x224图像尺寸测试时则使用288x288尺寸以获得更优性能。在ImageNet-1k数据集上该模型实现了86.74%的top1准确率和98.022%的top5准确率展现出卓越的图像分类能力。迁移学习策略模型采用了两阶段迁移学习策略首先在大规模ImageNet-22k数据集上进行预训练学习通用视觉特征然后在较小的ImageNet-1k数据集上进行微调适应特定分类任务。这种从大到小的迁移学习方法充分利用了大规模数据的优势同时兼顾了特定任务的需求有效提升了模型性能。快速上手使用指南环境准备要使用该模型首先需要安装timm库。可以通过以下命令进行安装pip install timm图像分类实现以下是使用convnextv2_base.fcmae_ft_in22k_in1k进行图像分类的简单示例from urllib.request import urlopen from PIL import Image import timm import torch img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) model timm.create_model(convnextv2_base.fcmae_ft_in22k_in1k, pretrainedTrue) model model.eval() # 获取模型特定的变换归一化、调整大小 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) output model(transforms(img).unsqueeze(0)) # 将单张图像转换为批次为1的输入 top5_probabilities, top5_class_indices torch.topk(output.softmax(dim1) * 100, k5)特征提取应用除了图像分类该模型还可用于特征提取model timm.create_model( convnextv2_base.fcmae_ft_in22k_in1k, pretrainedTrue, features_onlyTrue, ) model model.eval() # 获取模型特定的变换 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) output model(transforms(img).unsqueeze(0)) # 输出为特征图列表 for o in output: print(o.shape) # 打印每个特征图的形状模型优势与适用场景与同类模型对比在timm模型结果中convnextv2_base.fcmae_ft_in22k_in1k表现出色。与convnext_base.fb_in22k_ft_in1k相比虽然参数数量相近88.72M vs 88.59M但top1准确率更高86.74% vs 85.822%同时保持了较高的推理速度624.23 samples_per_sec。适用场景该模型适用于各种图像分类任务如物体识别、场景分类等。其优秀的特征提取能力也使其可作为其他计算机视觉任务的骨干网络如目标检测、语义分割等。特别是在数据量有限的情况下利用预训练模型进行迁移学习可以快速构建高性能的视觉系统。模型配置详情模型的配置信息存储在config.json文件中包含了架构、输入尺寸、预处理参数等关键信息。其中输入图像经过归一化处理均值为[0.485, 0.456, 0.406]标准差为[0.229, 0.224, 0.225]。测试时采用288x288的输入尺寸和中心裁剪方式以获得更稳定的性能。总结与展望convnextv2_base.fcmae_ft_in22k_in1k通过巧妙的迁移学习策略和先进的ConvNeXt-V2架构在图像分类任务上取得了优异的性能。其从ImageNet-22k到ImageNet-1k的迁移学习实践为我们展示了如何充分利用大规模数据进行模型预训练再通过微调适应特定任务的有效方法。未来我们可以进一步探索该模型在更多计算机视觉任务上的应用如目标检测、语义分割等充分发挥其强大的特征提取能力。同时也可以尝试在其他领域的数据集上进行迁移学习拓展模型的适用范围。引用与致谢如果您在研究中使用了该模型请引用以下文献article{Woo2023ConvNeXtV2, title{ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders}, author{Sanghyun Woo, Shoubhik Debnath, Ronghang Hu, Xinlei Chen, Zhuang Liu, In So Kweon and Saining Xie}, year{2023}, journal{arXiv preprint arXiv:2301.00808}, } misc{rw2019timm, author {Ross Wightman}, title {PyTorch Image Models}, year {2019}, publisher {GitHub}, journal {GitHub repository}, doi {10.5281/zenodo.4414861}, howpublished {\url{https://github.com/huggingface/pytorch-image-models}} }感谢Facebook Research团队开发的ConvNeXt-V2架构以及Ross Wightman维护的PyTorch Image Models库为该模型的实现和应用提供了有力支持。【免费下载链接】convnextv2_base.fcmae_ft_in22k_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/convnextv2_base.fcmae_ft_in22k_in1k创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门