11:11官方账号arXiv cs.AI@Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat法律AI系统日益用于回答法律问题,但现有基准假设查询完全指定。InsufficiencyBench是第一个针对查询不足的法律基准,评估模型是否识别查询缺乏法律相关信息,识别缺失内容,并避免过早结论。该基准包含八个典型缺失元素类别,涵盖三种结构故障模式,并构建了202个基准项目,涵盖六个法律领域和24个美国司法管辖区。评估了十个前沿模型,发现没有模型在缺失元素识别上超过F2 = 0.46,平均召回率为0.44。模型要么无差别地打掩护,要么在虚构的假设下沉默。没有模型既能识别和限定对不足查询的响应,又能直接针对完整查询。论文法律AILLM查询不足推荐理由:这篇论文介绍了InsufficiencyBench,这是第一个评估LLM在用户查询不足方面的法律建议的基准。它对法律AI系统提出了新的挑战,并提供了评估模型性能的新方法。原文稍后读已读值得跟进有用关注 法律AI