AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

压力测试

共 3 条相关 AI 资讯
8月10日
11:11
11:11官方账号arXiv cs.AI@Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou
SABRE是一个可扩展的自动化流水线,能把Markdown任务设计转化为结构化规格、图像和问答对,用于构建视觉语言模型压力测试。该流程通过自动化过滤和人工审查保证题目质量。作者用SABRE-Prior实例测试模型是否依赖世界先验而非视觉证据,包含600张图像和1000个问题。六个VLM在宏观平均准确率上仅达17.8%至31.3%,平均22.6%。SABRE-Counting和SABRE-Spatial的试点证明该工作流可扩展至其他压力测试场景。
论文SABREVLM压力测试

推荐理由:这论文给了一个能自动造VLM压力测试的框架,比现有基准更能暴露模型短板,做评测的可以看看。
原文
6月29日
15:42
15:42@koltregaskes@koltregaskes
精选
Nature Medicine论文对GPT-5、Gemini 2.5 Pro等前沿模型进行了医学视觉推理压力测试,通过移除图像、替换图像、调整问题格式来检验模型是否真正理解。结果显示,在标准基准上表现优异的模型在条件变化时出现推理不稳、幻觉视觉细节等问题。作者将测试框架开源,随后有人用GPT-5.5 Pro重新运行,得分从之前最好的67-70%提升至79%,约10个百分点的进步。这解决了论文发表时模型已过时的问题,使评估能随模型更新而保持时效性。
论文GPT-5Gemini 2.5 Pro医学视觉推理

推荐理由:Nature Medicine那篇论文把模型考倒了,但作者直接把考卷开源了。后来GPT-5.5 Pro重新考,分数涨了10%!
原文
6月11日
11:49
11:49rohanpaul_ai@rohanpaul_ai
一项新研究指出,LLM 作为安全裁判时,对同一答案的翻译或改写版本可能给出不同安全判决。问题在于许多 AI 团队依赖 LLM 判断模型回答是否安全,但安全并非简单的二元问题。论文提出压力测试:将相同答案翻译或改写后展示给裁判,检查判决是否一致。裁判在暴力或极端内容等明显有害场景表现较好,但在金融建议、信用评估等依赖上下文和判断的场景中表现脆弱。不同裁判之间分歧大,高原始一致性可能掩盖低真实可靠性。
论文LLM 安全裁判模型一致性

推荐理由:做 AI 安全评测的团队会直接受影响——你的安全裁判可能比想象中更不可靠,建议点开看看测试方法。
原文
精选全部日报登录