11:56官方账号arXiv cs.AI@Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald ClarkMMDiff是一个多模态模型差分框架,通过训练多模态稀疏自编码器(SAE)来发现和控制多模态大模型(MLLM)的内部特征。该框架支持特征隔离、任务特定特征检测和特征级控制三种用途。研究团队在LLaVA-MORE、PaliGemma 2和InternVL3.5三个模型家族上训练了多模态SAE,并在视觉空间理解、多模态安全和OCR任务上进行了评估。移除MMDiff发现的特征可使空间任务性能平均下降12%、OCR下降17%,多模态安全攻击成功率降低24%,且不影响VQA性能。特征引导在空间和OCR任务上分别比标准单层引导基线平均提升+3.6%和+1.8%。论文MMDiff多模态大模型稀疏自编码器推荐理由:想搞懂多模态模型内部怎么运作?MMDiff能找出是哪些特征让模型变聪明,还能精准控制它们,安全性和效果都有数据支撑。原文稍后读已读值得跟进有用关注 MMDiff