12:23官方账号arXiv cs.AI@Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard DragutERUnderstand是首个大规模评估视觉语言模型(VLM)对实体关系图(ERD)结构化理解能力的基准,包含2960张来自教育、真实世界和合成数据源的图。测试发现常见元素F1>0.74,但弱实体F1低至0.28,多值属性仅0.14,N元关系仅0.07。使用推理增强的模型整体提升15%-25%,但仍受语言先验和复杂度影响。基准、数据、工具和生成代码已开源。论文ERUnderstandVision-Language ModelsEntity-Relationship Diagrams推荐理由:想测VLM能不能看懂ER图?这个新基准用2960张图挨个打分,弱实体和N元关系掉得厉害,读论文就能知道差距在哪儿。原文稍后读已读值得跟进有用关注 ERUnderstand
12:14官方账号arXiv cs.AI@Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal KalitaAUTOPILOT-VQA 是一个针对行车记录仪视频的视觉问答基准,用于评估视觉语言模型在安全关键事故中的推理能力。该基准覆盖天气光照、交通环境、道路布局、路面状态、标志、涉及实体、事故是否发生、撞击位置和事故可避免性等9个类别。数据集基于真实驾驶事故与近事故场景设计结构化问题,要求模型回答场景属性与事件细节。该基准作为 CVPR 2026 竞赛的一部分发布,旨在推动更可解释、鲁棒和安全敏感的视觉语言系统。论文AUTOPILOT-VQAVision-Language ModelsCVPR 2026推荐理由:CVPR 2026 竞赛推出了 AUTOPILOT-VQA 基准,专门测试 AI 模型对行车记录仪事故视频的推理能力,比普通视觉问答更难更贴近安全。原文稍后读已读值得跟进有用关注 AUTOPILOT-VQA