8月21日
10:35
10:35官方账号arXiv cs.AI@Yejin Bang, Kirsty Fielding, Brandan Oliver, Brian Birke, Nabeel Seedat, Andrew M. Bean
合同审查是法律工作中依赖大量文本处理的领域之一,ContractScrub作为首个评估合同审查能力的基准,包含多种错误类型的合同,如定义术语误用、不正确的引用和不一致的语言。前沿模型在相关基准上表现出色,但在ContractScrub上表现不佳,仅有一个模型达到0.75的宏观平均召回率,突显了当前模型的实际限制和特定领域基准的重要性。
推荐理由:ContractScrub基准为评估合同审查能力提供了首个标准,揭示了前沿模型在特定任务上的局限性,值得法律和AI领域专业人士关注。