10:34官方账号arXiv cs.LG@Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck论文提出ARMDIL,一种使用多模态大语言模型(MLLM)作为自适应路由器的图像分类集成方法。该集成包含ResNet、自监督学习(SSL)和视觉语言模型(VLM)等视觉骨干,在统一标签空间上训练。实验显示,ARMDIL与专用的训练型路由器性能相当,同时能通过简单提示修改快速整合新信息。该方法用自然语言推理轨迹增强可解释性,为通用视觉系统提供支持。论文ARMDILMLLM图像分类推荐理由:这篇论文搞了个ARMDIL,用MLLM当路由器给图像挑合适的视觉模型,效果不输专门训练的,还能改提示词加新数据。原文稍后读已读值得跟进有用关注 ARMDIL