10:34官方账号arXiv cs.LG@Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck论文提出ARMDIL,一种使用多模态大语言模型(MLLM)作为自适应路由器的图像分类集成方法。该集成包含ResNet、自监督学习(SSL)和视觉语言模型(VLM)等视觉骨干,在统一标签空间上训练。实验显示,ARMDIL与专用的训练型路由器性能相当,同时能通过简单提示修改快速整合新信息。该方法用自然语言推理轨迹增强可解释性,为通用视觉系统提供支持。论文ARMDILMLLM图像分类推荐理由:这篇论文搞了个ARMDIL,用MLLM当路由器给图像挑合适的视觉模型,效果不输专门训练的,还能改提示词加新数据。原文稍后读已读值得跟进有用关注 ARMDIL
12:13官方账号arXiv cs.LG@V. S. Usatyuk, D. A. Sapozhnikov, S. I. Egorov精选论文提出 KSSE(Kohn–Sham Spectral Embedding),用稀疏图上的谱嵌入替代稠密 CNN 分类器,并在相关随机键 Ising 模型的 Nishimori 温度下求解。在冻结 EfficientNet-B4 特征(D=1792)的 ImageNet-1000 传导协议上,KSSE 用约 21.24M 参数达到 88.93% Top-1 准确率。这优于 Swin-L(197M 参数,86.4–87.3%),并以约十分之一参数匹配 ViT-H/14(632M 参数,88.0–89.5%)。方法通过星域手术优化图拓扑,将残差挫败限制在 ρ≤1+δ,并证明 Ihara–Bass 恒等式等六个理论结果。论文KSSEImageNet-1000谱嵌入推荐理由:一篇用物理模型替代CNN做分类的论文:KSSE用2100万参数在ImageNet-1000上做到88.93%,超过Swin-L,逼近ViT-H/14,值得看看方法。原文稍后读已读值得跟进有用关注 KSSE
11:10官方账号arXiv cs.LG@Cesar Roder, Kajetan Schweighofer深度神经网络分类器常因依赖训练数据中的虚假背景特征而导致泛化失败。新方法AutoBackSwap通过辅助网络分离前景和背景,并用填充方式生成完整背景,然后将不同前景与填充背景组合来增强训练数据。仅需几百个样本的补丁标注即可训练辅助网络,并自动增强整个数据集。在多个具有虚假背景的图像分类任务上,AutoBackSwap始终优于先前方法,即使在训练数据中没有任何打破虚假相关性的样本时也有效。论文AutoBackSwap图像分类虚假相关性推荐理由:这篇论文提出了AutoBackSwap,只用几百张图片的标注就能让模型不依赖背景,效果比之前的方法都好,做图像分类的值得一看。原文稍后读已读值得跟进有用关注 AutoBackSwap
09:56官方账号arXiv cs.LG@Clément Fuchs, Tim Bary, Benoît Macq本文对视觉-语言模型(VLMs)在自然图像分类任务上使用局部化共形预测(localized conformal prediction)进行不确定性量化。作者通过开源实现基准测试,发现直接使用测试样本与校准样本视觉特征的余弦相似度并不能优于非局部基线。他们提出一种简单的非线性变换,在保持边缘覆盖保证的同时,实现了统计显著的集合大小平均减少。实验在多个VLM上验证了有效性。论文VLM共形预测不确定性量化推荐理由:这篇论文发现直接用余弦相似度搞局部共形预测效果一般,但换个非线性变换后,预测集变小了,值得做VLM不确定性量化的看看。原文稍后读已读值得跟进有用关注 VLM
12:26官方账号arXiv cs.LG@Alper Yıldırım论文复现了Oppenheim和Lim(1981)的经典实验,在隐藏层中测试相位与幅度对图像识别的影响。在PRISM2D、GFNet和ViT-B/16中,预测完全跟随相位或符号捐赠者,删除幅度信息后准确率几乎不变。ResNet-50在ReLU后看似不遵循此模式,但ReLU前的干预显示晚期块中存在强相位编码,且DC-only控制表明读取器依赖通道式空间平均。这些架构共享相位/符号身份编码,但因整流和读取几何暴露在不同基底上,为CNN与注意力模型间的纹理-形状差距提供了机理解释。论文PRISM2DGFNetViT-B/16推荐理由:这篇论文用Oppenheim-Lim实验方法测试了多个模型(ViT、CNN)的内部表示,发现相位才是关键,还解释了为什么CNN和ViT对纹理和形状的偏好不同。原文稍后读已读值得跟进有用关注 PRISM2D
11:12官方账号arXiv cs.AI@Aray Karjauv这篇论文指出,现代图像分类器使用的全局平均池化(GAP)加线性分类头的结构,使图像级logits等于特征网格上逐点分类后logits的平均值。这种线性性意味着标准分类器本质上是多实例学习器(MIL),将图像视为空间实例的包。实验发现,即使图像级预测错误,分类器仍在特征网格中保留了空间类别证据,且现成模型(off-the-shelf models)能稳定恢复前景区域的地面真实类别。该研究将GAP隐藏的空间信息重新提取出来,为模型诊断提供了新思路。论文GAP多实例学习图像分类推荐理由:用GAP隐藏的空间证据诊断分类错误原文稍后读已读值得跟进有用关注 GAP
11:11官方账号arXiv cs.AI@Rafi Ahamed, Md. Abir Rahman, Tasnia Tarannum Roza, Munaia Jannat Easha, Md. Asif Khan, Sudeepta MandalCottonLeafVision框架为棉花叶病分类而生,评估了DenseNet201、InceptionV3和VGG19等预训练模型。在包含6类病害和1类健康的7类公开数据集上,DenseNet201达到了98%的最高分类准确率。框架采用Grad-CAM、遮挡敏感分析和对抗训练来增强模型可解释性与噪声鲁棒性。最后,团队开发了原型,用于实际农业场景中的病害管理。AI模型CottonLeafVisionDenseNet201图像分类推荐理由:98%准确率识别棉花叶病原文稍后读已读值得跟进有用关注 CottonLeafVision