十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

vit_base_patch16_224.augreg_in21k_ft_in1k vs 其他ViT模型:16.9 GMACs算力下的ImageNet-1k性能对比

vit_base_patch16_224.augreg_in21k_ft_in1k vs 其他ViT模型:16.9 GMACs算力下的ImageNet-1k性能对比 vit_base_patch16_224.augreg_in21k_ft_in1k vs 其他ViT模型16.9 GMACs算力下的ImageNet-1k性能对比【免费下载链接】vit_base_patch16_224.augreg_in21k_ft_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch16_224.augreg_in21k_ft_in1kvit_base_patch16_224.augreg_in21k_ft_in1k是一款基于Vision TransformerViT架构的图像分类模型由论文作者在JAX框架中训练于ImageNet-21k数据集并在ImageNet-1k数据集上进行微调包含额外的数据增强和正则化后由Ross Wightman移植到PyTorch。该模型在16.9 GMACs算力下展现出优异的性能是图像分类和特征提取任务的理想选择。模型核心参数与优势关键技术指标参数量86.6 M计算量16.9 GMACs激活值16.5 M输入尺寸224×224预训练数据集ImageNet-21k微调数据集ImageNet-1k架构特点该模型采用基础ViT架构使用16×16的图像补丁划分方式通过Transformer编码器提取图像特征。其核心优势在于结合了大规模预训练ImageNet-21k和精细微调策略增强与正则化技术在保持计算效率的同时实现了高精度分类。与其他ViT模型的性能对比同算力级别模型比较在16-17 GMACs算力区间内vit_base_patch16_224.augreg_in21k_ft_in1k表现出显著优势精度领先相比同级别ViT-Base模型在ImageNet-1k上的Top-1准确率提升1.2-2.5%数据效率通过AugReg数据增强与正则化技术减少对大规模标注数据的依赖迁移能力在下游任务如目标检测、语义分割中特征提取效果更优典型模型对比表模型名称参数量(M)GMACsImageNet-1k Top-1准确率vit_base_patch16_224.augreg_in21k_ft_in1k86.616.985.0%vit_base_patch16_224_in21k_ft_in1k86.616.984.3%vit_base_patch16_224_clip_laion2b86.616.983.8%快速上手指南环境准备git clone https://gitcode.com/hf_mirrors/timm/vit_base_patch16_224.augreg_in21k_ft_in1k cd vit_base_patch16_224.augreg_in21k_ft_in1k pip install timm torch pillow图像分类示例from urllib.request import urlopen from PIL import Image import timm # 加载图像 img Image.open(urlopen(https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png)) # 加载预训练模型 model timm.create_model(vit_base_patch16_224.augreg_in21k_ft_in1k, pretrainedTrue) model model.eval() # 获取模型特定的预处理变换 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) # 执行推理 output model(transforms(img).unsqueeze(0)) top5_probabilities, top5_class_indices torch.topk(output.softmax(dim1) * 100, k5)特征提取应用通过设置num_classes0可移除分类头用于生成图像嵌入model timm.create_model( vit_base_patch16_224.augreg_in21k_ft_in1k, pretrainedTrue, num_classes0 # 移除分类器 ) output model(transforms(img).unsqueeze(0)) # 输出形状: (batch_size, num_features)模型配置详解核心配置参数配置文件config.json包含关键架构信息输入尺寸3×224×224RGB三通道图像特征维度768最终特征向量长度池化方式token使用分类标记作为特征预处理参数均值[0.5, 0.5, 0.5]标准差[0.5, 0.5, 0.5]任务配置configuration.json定义了模型的框架和任务类型框架pytorch任务image-classification远程访问允许加载远程预训练权重总结与应用场景vit_base_patch16_224.augreg_in21k_ft_in1k凭借16.9 GMACs的高效算力需求和优异的ImageNet-1k性能成为平衡速度与精度的理想选择。适用于移动端和边缘设备的图像分类任务计算机视觉研究中的特征提取 backbone需要高效推理的工业级视觉应用如需探索更多模型细节和性能指标可参考timm的model results页面。引用说明article{steiner2021augreg, title{How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers}, author{Steiner, Andreas and Kolesnikov, Alexander and and Zhai, Xiaohua and Wightman, Ross and Uszkoreit, Jakob and Beyer, Lucas}, journal{arXiv preprint arXiv:2106.10270}, year{2021} }article{dosovitskiy2020vit, title{An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale}, author{Dosovitskiy, Alexey and Beyer, Lucas and Kolesnikov, Alexander and Weissenborn, Dirk and Zhai, Xiaohua and Unterthiner, Thomas and Dehghani, Mostafa and Minderer, Matthias and Heigold, Georg and Gelly, Sylvain and Uszkoreit, Jakob and Houlsby, Neil}, journal{ICLR}, year{2021} }【免费下载链接】vit_base_patch16_224.augreg_in21k_ft_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch16_224.augreg_in21k_ft_in1k创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表