AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

BenchDrift

共 1 条相关 AI 资讯
8月16日
08:20
08:20elvis@omarsar0
精选
IBM发布BenchDrift研究,生成基准问题的语义等价变体来测试模型鲁棒性。结果显示,弱模型从改写中获益多于损失,而强模型损失远大于获益。在GSM8K、MMLU和MATH-Hard上测试的8个模型中,措辞敏感性随模型增强不降反增。该研究表明,顶尖模型的基准分数高度依赖题目措辞,而非纯粹能力。论文已发布于arxiv.org/abs/2608.11694。
论文BenchDriftIBMGSM8K

推荐理由:IBM这篇研究说明,看榜单选模型可能被题目措辞骗了,强模型反而更怕改写。
原文
精选全部日报登录