智东西1月22日消息,1月18日,来自中国科学院、华为、鹏城实验室的研究人员推出一个新的视觉模型VMamba(Visual State Space Model,视觉状态空间模型)。CNN(卷积神经网络)和ViTs(视觉Transformer)是视觉领域当下最主流的两种基础模型,但这两种模型的计算复杂度都较高。通过对全局接受域和动态权重的结合,ViTs实现了卓越的视觉建模性能。这一观察结果促使团队提出一种新的架构VMamba,该架构继承了这些组件,同时提高了计算效率。大量的实验结果证实,VMamba不仅在各种视觉感知任务中表现出提升,而且随着图像分辨率的增加,它比现有基准显示出更明显的优势。VMamba-S在ImageNet-1K上达到83.5%的正确率,比Vim-S高3.2%,比Swin-S高 0.5%。

论文地址:
https://arxiv.org/pdf/2401.10166.pdf
GitHub地址:
https://github.com/MzeroMiko/VMamba



22


