10:56官方账号arXiv cs.LG@Joonas Järve, Halil Ibrahim Aysel, Tarun Khajuria, Meelis Kull本文通过可视化训练过程,使用稀疏自编码器提取候选稀疏特征,研究视觉Transformer(ViT)中特征级别的动态变化。实验表明,特征迁移主要发生在训练早期,且随着特征组织稳定而减少。深层网络比浅层网络更早和更稳定地稳定。论文视觉Transformer特征演变稀疏自编码器推荐理由:这篇论文通过可视化展示了ViT训练过程中的特征演变和迁移,为理解ViT的学习和演变提供了新的视角。原文稍后读已读值得跟进有用关注 视觉Transformer
12:32官方账号arXiv cs.LG@Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixFrag提出一种面向视觉Transformer的脆弱性引导混合精度训练后量化框架。它通过计算全精度与量化输出分布的KL散度来估计各组件量化脆弱性,并将位宽分配建模为多选择背包问题。在ImageNet-1K上,MixFrag在多种ViT架构下取得有竞争力的分类精度。在COCO目标检测与实例分割任务中,MixFrag在MP3/MP3设置下比此前最优方法提升高达9.6 AP。论文MixFrag量化视觉Transformer推荐理由:MixFrag用KL散度定位模型里对量化最敏感的部分,再把位宽分配变成背包问题。在COCO上比之前最好的混合精度PTQ方法涨了9.6 AP,跑ViT的可以看看。原文稍后读已读值得跟进有用关注 MixFrag
09:22官方账号arXiv cs.LG@Ibrahim Batuhan Akkaya, Kishaan Jeeveswaran, Bahram Zonooz, Elahe Arani该论文提出FDT(Foveated Dynamic Transformer),受人类视觉系统中央凹采样和眼动启发。FDT包含注视模块定位注视点过滤无关信息,中央凹模块生成多尺度中央凹嵌入。在50%固定预算下,FDT在ImageNet上准确率81.9%,高于DeiT-S的80.9%,同时减少34.57%乘加操作。FDT对噪声和对抗攻击展现出天然鲁棒性,无需专门训练。论文FDTDeiT-S视觉Transformer推荐理由:这篇论文提出的FDT模拟人眼注视,只用一半token就比DeiT-S更准还省34%算力,而且天然抗噪声攻击。原文稍后读已读值得跟进有用关注 FDT
12:21官方一手pandaily@contact@pandaily.com (Pandaily)精选72°清华大学与阿里巴巴联合发表论文,提出ViT³(Vision Test-Time Training)架构,这是一种纯Transformer模型,在视觉任务中实现了线性计算复杂度。该架构使得在边缘设备上进行高分辨率图像理解成为可能,解决了传统Transformer在视觉应用中计算量过大的问题。该论文已被CVPR 2026接收为Oral论文,标志着视觉Transformer在效率上取得重要突破。论文视觉Transformer线性复杂度边缘计算推荐理由:视觉Transformer终于突破了计算瓶颈,做边缘计算或高分辨率图像处理的开发者可以直接关注,这可能是部署到手机等设备的关键技术。原文稍后读已读值得跟进有用关注 视觉Transformer
19:12官方账号arXiv cs.LG@Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo精选VECA(Visual Elastic Core Attention)提出了一种新的视觉Transformer架构,用核心-外围结构替代传统的全对全自注意力。通过一组可学习的核心token作为通信接口,图像patch只与核心交互,计算复杂度从O(N²)降为O(N)。该模型在分类和密集预测任务上性能与最新视觉基础模型相当,同时大幅降低计算成本。VECA还支持在推理时弹性调整计算量与精度,为高分辨率视觉任务提供了可扩展的替代方案。论文视觉Transformer高效注意力核心-外围结构推荐理由:ViT在高分辨率场景下计算量爆炸的问题终于有了优雅解法——VECA用线性复杂度实现竞争性能,做视觉模型部署或高分辨率图像处理的团队值得关注。原文稍后读已读值得跟进有用关注 视觉Transformer