12:08官方账号arXiv cs.AI@Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris一项研究将项目反应理论(IRT)应用于8个安全基准、192个语言模型,这是迄今最大规模的LLM安全评估心理测量分析。研究发现,拒绝严格度、真实性和情境危害三个可解释因子解释了模型间大部分差异。IRT选出的题目在恢复完整基准分数时误差低于随机子集,约10个自适应题即可替代若干单个基准,评估成本降低97%-99%。IRT还能用于检测模型的朴素沙袋行为和API后端模型更换。论文项目反应理论AI安全安全基准推荐理由:这篇论文用IRT给192个模型的安全基准做心理测量,能把评测成本砍掉97%以上,还能识破模型故意考差或API后门换模型。原文稍后读已读值得跟进有用关注 项目反应理论
09:26官方账号arXiv cs.AI@Yang Zhang, Xiao Fei, Amr Mohamed, Sarah Almeida Carneiro, Mersin Konomi, Mingmeng Geng, Ahmed Asaad, Guokan Shang, Michalis Vazirgiannis这篇论文研究了大型语言模型在回答文化相关问题时,使用英语还是本地语言更能获取文化知识。现有评估存在两个局限:模板化问题不自然,且准确率混淆了语言能力和知识访问。作者构建了控制框架,使用真实文化问题,通过项目反应理论模型分离语言能力和知识访问。在13个地区、约80个模型上发现,英语在文化无关问题上表现更好,但控制语言能力后,本地语言在文化知识访问上普遍有优势。这种优势在原始准确率中被掩盖,但在前沿、区域对齐或语言适配模型中更明显。结论是,本地语言表现弱不意味着文化知识弱,而是语言能力限制了访问。论文大语言模型多语言文化知识推荐理由:这篇论文揭示了多语言AI评估中的一个关键误区——本地语言表现差可能不是知识缺失,而是语言能力瓶颈。做跨文化NLP或本地化模型的团队,看完会重新理解评测指标。原文稍后读已读值得跟进有用关注 大语言模型