ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

1556个预训练配置、Top-1最高90.056%:pytorch-image-models(timm)跨数据集性能实测与选型指南

1556个预训练配置、Top-1最高90.056%:pytorch-image-models(timm)跨数据集性能实测与选型指南 1556个预训练配置、Top-1最高90.056%pytorch-image-modelstimm跨数据集性能实测与选型指南【免费下载链接】pytorch-image-modelsThe largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more项目地址: https://gitcode.com/GitHub_Trending/py/pytorch-image-models选分类模型时你是否也卡过32×32 的小图用什么架构224 以上的大规模数据又该上谁同一个模型在两类数据集上能差多少本文直接引用仓库results/results-imagenet.csv中 1556 个实测配置结合timm/data的数据集加载代码把 pytorch-image-modelstimm的性能边界和选型逻辑一次讲清。读完本文你将获得四档模型在 ImageNet 上的性能边界CIFAR 与 ImageNet 的迁移量化规律三种算力场景的选型与部署参数项目全景速览timm 是一个 PyTorch 图像编码器backbone即分类模型的特征提取主干集合库覆盖 ResNet、EfficientNet、Swin、ConvNeXt、ViT、RegNet 等 100 架构族自带训练、验证、推理、导出脚本与官方预训练权重。指标项数值库版本1.0.29.dev0timm/version.py模型架构文件数111 个timm/models/ImageNet 实测配置数1556 条results/results-imagenet.csv最高 Top-1 准确率90.056%eva02_large_patch14_448.mim_m38m_ft_in22k_in1k最小参数量配置2.54Mtf_mobilenetv3_small_100.in1k数据侧同样完整timm/data中内置 ImageNet、WDS、TFDS、CIFAR-10/100 等数据集工厂CIFAR 注册见 timm/data/dataset_factory.py。核心能力拆解pytorch-image-models 四档模型的性能边界以下三张表全部取自results/results-imagenet.csv原始列模型名、输入尺寸、Top-1、参数量无二次加工。高精度档自监督预训练把 Top-1 顶过 89%TOP5 配置全部来自 EVA / ViT 系的「自监督预训练 微调」自监督已是高精度档的默认项。模型配置输入Top-1参数量(M)eva02_large_patch14_448.mim_m38m_ft_in22k_in1k44890.056%305.08eva02_large_patch14_448.mim_in22k_ft_in22k_in1k44889.956%305.08eva_giant_patch14_560.m30m_ft_in22k_in1k56089.790%1014.45convnextv2_huge.fcmae_ft_in22k_in1k_51251288.860%660.29eva02_base_patch14_448.mim_in22k_ft_in22k_in1k44888.678%87.12这意味着87.12M 参数的 base 档就能拿到 88.678%其参数效率反超 1014.45M 的 giant 档约 0.1 个百分点/百万参数的量级差距堆参数不再是唯一通路。中档输入分辨率比换架构更提分同家族模型在 288–384 输入下参数量每翻一倍 Top-1 提升 1–2 个点分辨率升级与换架构的提分效率相当。模型配置输入Top-1参数量(M)regnety_040.ra3_in1k28883.048%20.65convnext_tiny.in12k_ft_in1k_38438485.154%28.59convnext_small.in12k_ft_in1k_38438486.186%50.22swin_base_patch4_window7_224.ms_in22k_ft_in1k22485.276%87.77值得注意的是87.77M 的 swin_base 在 224 输入下只比 50.22M 的 convnext_small384 高 0.09 个点中档选型时小模型 大输入往往比大模型 224更划算。轻量档3–6M 参数撑住 68%–79% 的 Top-1移动端可用区间是 2.54M–5.72M 参数其中 21k 预训练权重比纯 in1k 权重高 2–4 个点。模型配置输入Top-1参数量(M)tf_mobilenetv3_small_100.in1k22467.922%2.54efficientnet_lite0.ra_in1k22475.488%4.65efficientnet_b0.ra4_e3600_r224_in1k25679.364%5.29mobilenetv3_large_100.miil_in21k_ft_in1k22477.920%5.48vit_tiny_patch16_224.augreg_in21k_ft_in1k22475.452%5.72日常调用只需一行import timm model timm.create_model(efficientnet_b0.ra4_e3600_r224_in1k, pretrainedTrue, num_classes10)这意味着轻量档里 ViT-Tiny 并不比同参数量 CNN 有优势75.452% vs 79.364%注意力结构在小参数下还没跨过数据门槛。对比与迁移分析CIFAR 与 ImageNet 的四条量化规律results/目录只收录 ImageNet 系基准仓库内无官方 CIFAR 数字。以下结合社区实测≈ 为估算值与源码结构分析用于指导跨数据集迁移参数规模与泛化能力正相关但在小数据集上方向收窄305.08M 的 EVA-Large 在 ImageNet 拿到 90.056%但放到 CIFAR-100 的 5 万张训练图上相对 ≈25M 参数的 ResNet 系仅多 ≈0.5–1 个点过拟合吃掉大部分收益需要更强正则化。注意力机制存在数据规模门槛ViT 系在 ImageNet 上比同档 CNN 高 2–3 个点如 86.57M 的 vit_base 达 85.108%但 CIFAR-10 上 ViT-Tiny 约 ≈95.8%与 MobileNetV3-Large≈94.5%的差距缩到 ≈1.3 个点优势基本消失。自监督预训练是跨数据集迁移最稳的变量results/model_metadata-in1k.csv 中 mim、fcmae、webli、in21k-selfsl 命名的配置普遍比同规模随机初始化微调高 3–5 个点且在小数据集微调时优势保持最稳定可直接复用。stem 层是小分辨率的结构开关timm/models/resnet.py 的stem_type支持 deep 3×3 卷积分身、replace_stem_pool可把初始 MaxPool 换成 stride-2 卷积让 CIFAR32 输入少损失一层下采样这是把 ImageNet 架构适配小图的标准改法比盲目加深网络有效。场景化选型timm 在三种算力下的部署建议移动端轻量部署算力预算极低推荐方案efficientnet_b0.ra4_e3600_r224_in1k5.29M极限体积选 tf_mobilenetv3_small_100.in1k2.54M关键指标Top-1 79.364% / 67.922%参数量 5.29M / 2.54M落地提示导出 ONNX 后跑onnx_validate.py核对精度一致性再冻结 BN 部署边缘计算单卡 8GB 显存训练推荐方案convnext_tiny.in12k_ft_in1k_38428.59M更省选 regnety_040.ra3_in1k20.65M关键指标Top-1 85.154% / 83.048%输入 384 / 288落地提示训练自有数据集时启用混合精度python train.py -d convnext_tiny.in12k_ft_in1k --amp --model-ema服务器云端高精度推理推荐方案eva02_base_patch14_448.mim_in22k_ft_in22k_in1k87.12M极致精度上 eva02_large_patch14_448.mim_m38m_ft_in22k_in1k305.08M关键指标Top-1 88.678% / 90.056%输入 448落地提示显存吃不下 448 时换 336 输入的 eva_giant_patch14_336.m30m_ft_in22k_in1k仍有 89.566%收束与行动指引先看数据量再选参数档训练样本 50 万以下优先 20M–90M 中档模型5M 轻量档足够直接上 300M 属于算力浪费。跨域微调直接复用自监督权重名字带 mim、fcmae、webli、in21k 的配置跳过架构重验环节这是 CSV 里性价比最高的操作。小数据集上优先改 stem 层deep stem 去初始池化而不是加深网络这条在 timm/models/resnet.py 里一行配置就能生效。持续跟进timm/version.py 的版本号变化当前 1.0.29.dev0以及 results/README.md 说明下results-imagenet.csv的新增配置本次盘点为 1556 条。 你在小数据集上微调 timm 模型踩过什么坑权重不收敛还是过拟合欢迎留言交流。【免费下载链接】pytorch-image-modelsThe largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more项目地址: https://gitcode.com/GitHub_Trending/py/pytorch-image-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表