8月28日
16:38
16:38官方账号arXiv cs.AI@Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov
精选73°
CorporateBench 是一个人工验证的多任务问答基准,评估语料超过23万份文档。该基准通过四个模拟企业(员工规模从12到10,000人)评估大模型在信息提取和知识库查询两个维度的表现。研究显示,随着输入规模接近真实场景,大模型性能显著下降。
推荐理由:CorporateBench 填补了企业级大模型评估空白,用23万文档测试了5个模型在真实规模下的表现。