ConvNets Match Vision Transformers at Scale
作者: Samuel L. Smith, Andrew Brock, Leonard Berrada, Soham De
分类: cs.CV, cs.LG, cs.NE
发布日期: 2023-10-25
💡 一句话要点
提出高效ConvNet架构以匹敌Vision Transformer性能
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 卷积神经网络 视觉变换器 大规模数据集 预训练 图像分类 深度学习 性能提升
📋 核心要点
- 核心问题:现有研究普遍认为ConvNets在大规模数据集上不如Vision Transformers,限制了其应用。
- 方法要点:本文提出在JFT-4B数据集上预训练的NFNet架构,通过调整深度和宽度来提升性能。
- 实验或效果:经过微调,NFNets在ImageNet上达到了90.4%的Top-1准确率,表现与Vision Transformers相当。
📝 摘要(中文)
许多研究者认为,ConvNets在小型或中型数据集上表现良好,但在大规模数据集上不及Vision Transformers。本文通过评估在JFT-4B大规模标注数据集上预训练的高效ConvNet架构,挑战了这一观点。研究考虑了0.4k至110k TPU-v4核心计算小时的预训练计算预算,并训练了一系列来自NFNet模型家族的网络。结果显示,经过ImageNet微调后,NFNets在相似计算预算下的性能与Vision Transformers相当,最强微调模型的Top-1准确率达到90.4%。
🔬 方法详解
问题定义:本文旨在解决ConvNets在大规模数据集上性能不足的问题,尤其是在与Vision Transformers的比较中,ConvNets常被认为不具竞争力。
核心思路:通过在JFT-4B数据集上进行大规模预训练,本文提出了一种高效的ConvNet架构,NFNet,旨在通过增加网络的深度和宽度来提升其性能。
技术框架:研究采用了NFNet模型家族,考虑了不同的计算预算进行预训练,并在ImageNet数据集上进行微调。整体流程包括数据预处理、模型训练、微调及性能评估等阶段。
关键创新:本文的主要创新在于通过大规模预训练使ConvNets在性能上与Vision Transformers相匹敌,挑战了传统观念。与现有方法相比,NFNet在相同计算预算下表现出色。
关键设计:在模型设计上,NFNet采用了特定的网络结构和参数设置,优化了损失函数,并通过调整网络的深度和宽度来实现性能提升。
🖼️ 关键图片
📊 实验亮点
实验结果显示,经过在JFT-4B数据集上的预训练和ImageNet上的微调,NFNets达到了90.4%的Top-1准确率,性能与Vision Transformers相当,展示了在相似计算预算下的显著提升。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉、图像分类、自动驾驶等。通过提升ConvNets在大规模数据集上的性能,可以为实际应用提供更高效的解决方案,推动相关技术的发展和应用。
📄 摘要(原文)
Many researchers believe that ConvNets perform well on small or moderately sized datasets, but are not competitive with Vision Transformers when given access to datasets on the web-scale. We challenge this belief by evaluating a performant ConvNet architecture pre-trained on JFT-4B, a large labelled dataset of images often used for training foundation models. We consider pre-training compute budgets between 0.4k and 110k TPU-v4 core compute hours, and train a series of networks of increasing depth and width from the NFNet model family. We observe a log-log scaling law between held out loss and compute budget. After fine-tuning on ImageNet, NFNets match the reported performance of Vision Transformers with comparable compute budgets. Our strongest fine-tuned model achieves a Top-1 accuracy of 90.4%.