论文

Stanford HAI 发布两项研究,质疑 AI 基准测试是否测出了宣称的能力

精选理由

斯坦福 HAI 出了两篇研究,专门追问 LMSYS、MMLU 这些基准分数到底能不能代表模型真实能力,做选型或评测的都该看看。

Stanford HAI 支持的两项新研究显示,基准分数会影响哪些 AI 模型获得融资、收购与监管对待。研究团队与外部合作者共同检验这些测试是否真的测量了它们声称的能力。结论指向基准有效性存在需要审视的缺口。

图片来源 · Stanford HAI
原文 · Stanford HAI

Benchmark scores influence which AI models get funded, bought, and regulated. Two new studies from Stanford researchers and collaborators, supported by Stanford HAI, ask whether those tests measure what they claim to. Read more: https://t.co/5kKp42eJjm