9月1日
10:18
10:18官方账号arXiv cs.AI@Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee
精选73°
研究团队推出MIOH基准,系统评估多图像场景下的物体幻觉问题。该基准包含4项基础任务(存在性、计数、属性、位置),3种多图像推理模式(综合、比较、选择性)和3种对抗压力。测试显示GPT-5和Gemini-2.5-Pro等29个模型均存在不同失败模式。幻觉主要源于多图像间物体表示的整合阶段限制,而非感知失败。
推荐理由:MIOH基准帮你看清多模态模型在复杂视觉推理中的真实表现,GPT-5和Gemini-2.5-Pro也不例外。