7月1日
10:08
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu
论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。
推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
6月19日
11:03
11:03官方账号arXiv cs.LG@Yusuf Salcan, Simon Ging, Robin Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox
论文提出RefRad2D数据集,包含120万CT和MR图像-文本对,覆盖德语和英语。该数据集通过LLM标注和自动分割生成任务特定的VQA和空间定位子集。基于此训练的RadGrounder模型同时支持报告生成、视觉问答和边界框检测/分割。在Slake和VQA-RAD外部基准上,RadGrounder取得与专用医学VLM竞争的结果。加入临床数据训练可提升开放VQA表现,且增加空间定位监督不降低语言质量。
推荐理由:这篇论文开源了120万对的放射学双语数据集RefRad2D,训练出的RadGrounder能同时做报告生成、VQA和空间定位,空间定位还不影响语言质量,搞医疗AI的值得看看。