8月21日
10:35
10:35官方账号arXiv cs.AI@Yejin Bang, Kirsty Fielding, Brandan Oliver, Brian Birke, Nabeel Seedat, Andrew M. Bean
合同审查是法律工作中依赖大量文本处理的领域之一,ContractScrub作为首个评估合同审查能力的基准,包含多种错误类型的合同,如定义术语误用、不正确的引用和不一致的语言。前沿模型在相关基准上表现出色,但在ContractScrub上表现不佳,仅有一个模型达到0.75的宏观平均召回率,突显了当前模型的实际限制和特定领域基准的重要性。
推荐理由:ContractScrub基准为评估合同审查能力提供了首个标准,揭示了前沿模型在特定任务上的局限性,值得法律和AI领域专业人士关注。
00:44
8月19日
13:26
13:26官方账号阿里通义 Qwen@Alibaba_Qwen
Qwen3.8-27B在Harvey的Legal Agent基准测试中获得11.3分,与Fable 5并列第一。该模型在性能上超越Kimi K3、Qwen 3.8 Max和DeepSeek V4等模型。作为开源模型,Qwen3.8-27B能够处理专业法律任务,同时体积小到可在本地机器运行。
事件专题

推荐理由:阿里Qwen的Qwen3.8-27B在法律基准上并列第一,还能本地运行,比其他大模型更实用。
01:54
7月29日
7月27日
18:39
6月29日
10:06
10:06官方一手arXiv: DeepSeek@Aniket Deroy, Kripabandhu Ghosh, Saptarshi Ghosh
该论文提出一种受树状思维(Tree-of-Thoughts)启发的提取-抽象混合方法,用于法律判决摘要生成。实验使用DeepSeek和LLama两种LLM,对比了纯提取、纯抽象及混合式摘要。结果显示,混合式提示生成的摘要质量优于其他类型提示。
推荐理由:这篇论文把思维树和提取-生成结合起来做法律摘要,用DeepSeek和Llama对比,发现混合方法效果更好。
6月23日
6月18日
01:10
6月4日
01:46
01:46Fireworks AI@FireworksAI_HQ
Fireworks AI 在 Harvey 的法律智能体基准上测试了稀疏顾问模式:用 GLM 5.1 作为执行工人,Claude Opus 4.7 作为稀疏顾问,结果全部通过率从 Opus 单独运行的 14/100 提升至 18/100,成本仅为 Opus 单独运行的 39%。该模式通过让强大模型仅在关键步骤提供建议,显著降低了推理成本。Fireworks 已开源相关 harness 设计、顾问模式及训练结果。
事件专题

推荐理由:法律 AI 团队终于有了降本增效的实战方案——用 GLM 5.1 搭配 Claude Opus 4.7 做稀疏顾问,性能提升 28% 的同时成本砍掉 61%,做法律智能体或长链推理的开发者值得一试。