11:11官方账号arXiv cs.AI@Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei ZhouSABRE是一个可扩展的自动化流水线,能把Markdown任务设计转化为结构化规格、图像和问答对,用于构建视觉语言模型压力测试。该流程通过自动化过滤和人工审查保证题目质量。作者用SABRE-Prior实例测试模型是否依赖世界先验而非视觉证据,包含600张图像和1000个问题。六个VLM在宏观平均准确率上仅达17.8%至31.3%,平均22.6%。SABRE-Counting和SABRE-Spatial的试点证明该工作流可扩展至其他压力测试场景。论文SABREVLM压力测试推荐理由:这论文给了一个能自动造VLM压力测试的框架,比现有基准更能暴露模型短板,做评测的可以看看。原文稍后读已读值得跟进有用关注 SABRE