AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

SABRE

共 1 条相关 AI 资讯
8月10日
11:11
11:11官方账号arXiv cs.AI@Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou
SABRE是一个可扩展的自动化流水线,能把Markdown任务设计转化为结构化规格、图像和问答对,用于构建视觉语言模型压力测试。该流程通过自动化过滤和人工审查保证题目质量。作者用SABRE-Prior实例测试模型是否依赖世界先验而非视觉证据,包含600张图像和1000个问题。六个VLM在宏观平均准确率上仅达17.8%至31.3%,平均22.6%。SABRE-Counting和SABRE-Spatial的试点证明该工作流可扩展至其他压力测试场景。
论文SABREVLM压力测试

推荐理由:这论文给了一个能自动造VLM压力测试的框架,比现有基准更能暴露模型短板,做评测的可以看看。
原文
精选全部日报登录