8月21日
10:56
10:56官方账号arXiv cs.LG@Joonas Järve, Halil Ibrahim Aysel, Tarun Khajuria, Meelis Kull
本文通过可视化训练过程,使用稀疏自编码器提取候选稀疏特征,研究视觉Transformer(ViT)中特征级别的动态变化。实验表明,特征迁移主要发生在训练早期,且随着特征组织稳定而减少。深层网络比浅层网络更早和更稳定地稳定。
推荐理由:这篇论文通过可视化展示了ViT训练过程中的特征演变和迁移,为理解ViT的学习和演变提供了新的视角。
7月31日
12:32
12:32官方账号arXiv cs.LG@Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk
MixFrag提出一种面向视觉Transformer的脆弱性引导混合精度训练后量化框架。它通过计算全精度与量化输出分布的KL散度来估计各组件量化脆弱性,并将位宽分配建模为多选择背包问题。在ImageNet-1K上,MixFrag在多种ViT架构下取得有竞争力的分类精度。在COCO目标检测与实例分割任务中,MixFrag在MP3/MP3设置下比此前最优方法提升高达9.6 AP。
推荐理由:MixFrag用KL散度定位模型里对量化最敏感的部分,再把位宽分配变成背包问题。在COCO上比之前最好的混合精度PTQ方法涨了9.6 AP,跑ViT的可以看看。
7月13日
5月13日
19:12
19:12官方账号arXiv cs.LG@Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo
精选
VECA(Visual Elastic Core Attention)提出了一种新的视觉Transformer架构,用核心-外围结构替代传统的全对全自注意力。通过一组可学习的核心token作为通信接口,图像patch只与核心交互,计算复杂度从O(N²)降为O(N)。该模型在分类和密集预测任务上性能与最新视觉基础模型相当,同时大幅降低计算成本。VECA还支持在推理时弹性调整计算量与精度,为高分辨率视觉任务提供了可扩展的替代方案。
推荐理由:ViT在高分辨率场景下计算量爆炸的问题终于有了优雅解法——VECA用线性复杂度实现竞争性能,做视觉模型部署或高分辨率图像处理的团队值得关注。