事件专题 ·官方一手

论文用六维文化回应标准审计 SimpleQA 与 Chatbot Arena

一篇 arXiv 论文借用文化回应性评估(CRE)框架,用六个维度审计了 OpenAI 的 SimpleQA(4,326 题)和 LMSYS Chatbot Arena(600 段对话)。SimpleQA 的全部 4,326 道题都以英文档案文献作为验证依据,且仅一位标注者对哥伦比亚建国年份的偏好就占全部题目的 2.70%,虚增了全球南方覆盖的表象。Chatbot Arena 中英文提示词占 76.3%,而国际电信联盟(ITU)估计英文用户仅占全球网民的 25.9%。论文构建的 50 题反向基准测得 SimpleQA 的文化回应性缺陷均值高出近三倍(Cohen's d = 1.01),并据此提出一套可操作的 CRE 评估框架。

当前结论

SimpleQA 全部题目只认英文档案,Arena 七成多提问是英文,这篇论文把评测偏差算成了具体数字。

4 个信源41° AI 热度最后更新 2026/9/21 17:29:39

证据链

4 个信源
相关来源 2掘金本周最热
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。