论文精选10:45相同证据不同答案:多模态大模型中排序敏感性的审计这篇论文用Facet-Probe测试了18个主流多模态大模型,发现它们对输入顺序都很敏感,最好的模型也错13.4%,提醒我们模型可靠性还不是想象中那么好。#Facet-Probe#MLLM#Gemini#多模态aarXiv cs.LG@Akshay Paruchuri 等 3 人原文稍后读已读值得跟进有用关注 Facet-Probe