10:55官方账号arXiv cs.AI@Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi ChengVCA方法通过分离文本和空白对照,评估多模态大模型(MLLMs)在空间基准中是否真的依赖图像证据。在四个MLLMs和两个基准上,12.73-26.25%的正确决策未获得图像信用。相同分割的图像排列使依赖正确性下降21.25-47.80点,所有95%置信区间均高于零。固定像素关系对比和3x3证据源阶乘设计表明,空对照无法识别关系响应;在受控正确但未获信用的决策中,关系反转响应覆盖81.57-100.00%,32.11%改变答案。论文VCA多模态空间推理MLLMs推荐理由:这篇论文告诉你,模型答对空间题不一定是因为看了图——VCA方法能揪出这种虚假正确。结果发现十几到二十几个百分点的正确回答其实没用到图像信息。原文稍后读已读值得跟进有用关注 VCA