深度学习论文: MobileNetV4 - Universal Models for the Mobile Ecosystem及其PyTorch实现

深度学习论文: MobileNetV4 - Universal Models for the Mobile Ecosystem及其PyTorch实现
MobileNetV4 - Universal Models for the Mobile Ecosystem
PDF: https://arxiv.org/pdf/2404.10518.pdf
PyTorch代码: https://github.com/shanglianlm0525/CvPytorch
PyTorch代码: https://github.com/shanglianlm0525/PyTorch-Networks

1 概述

专为移动设备设计的高效架构MobileNetV4（MNv4）核心在于引入了通用倒置瓶颈（UIB）搜索块和Mobile MQA注意力块，前者融合了多种技术，后者针对移动加速器优化，可大幅提升速度。同时采用了优化的神经架构搜索（NAS）方案。这一系列创新使得MNv4模型在多种设备上实现帕累托最优。此外，还引入了一种新的知识蒸馏技术，提高了模型的准确性。最终，MNv4-Hybrid-Large模型在ImageNet-1K上达到87%的准确率，同时在Pixel 8 EdgeTPU上的运行时间极短。

在这里插入图片描述

2 Universal Inverted Bottlenecks

通用倒瓶颈（UIB）块，其设计简洁而高效，如图所展示，它在传统的倒瓶颈块中巧妙地融入了两个可选的深度卷积（DW）操作。这两个DW分别置于扩展层之前以及扩展层和投影层之间，它们的存在与否是通过神经网络架构搜索（NAS）优化过程精心确定的，从而生成出性能卓越的全新架构。
在这里插入图片描述
尽管这种改动看似简单，但UIB块却成功地将多个现有的关键组件融为一体，包括经典的IB块、前沿的ConvNext块以及ViT中的FFN块。这种融合不仅保留了各组件的优势，还通过互补效应进一步提升了整体性能。

更值得一提的是，UIB还引入了一种革新的变体——额外的深度卷积IB（ExtraDW）块。这一创新举措为UIB块注入了新的活力，使其在保持高效的同时，进一步提升了模型的表达能力。

在网络的每个阶段，UIB都展现了出色的灵活性，以达成以下三个关键目标：

即时实现空间和通道混合的权衡，优化模型的表达能力；
按需扩大感受野，提升模型对上下文信息的捕获能力；
最大化计算利用率，确保资源的高效利用。

3 Mobile MQA

专门为加速器优化的Mobile MQA注意力块，该块能够显著提升推理速度，达到超过39%的效率提升。

MQA
MQA通过共享键和值简化了多查询注意力机制。与MHSA相比，MQA在保持高质量的同时，实现了显著加速和参数减少。
在这里插入图片描述
Spatial Reduction Attention (SRA)
受到MQA非对称计算的启发，进一步将空间缩减注意力（SRA）融入优化后的MQA模块中，以降低键和值的分辨率，同时保持高分辨率的查询。此外使用步长为2的3x3深度卷积替代了AvgPooling，为模型容量的提升提供了一种高效且经济的方案。
在这里插入图片描述
通过引入非对称空间下采样，我们可以在保持极小精度损失（-0.06%）的同时，实现超过20%的效率提升。