法律基准加了幻觉门槛后排名大洗牌:Muse Spark 本来领先,过滤幻觉后掉到第二,GPT-6 Astra 几乎不缩水。看各家法律任务幻觉差距挺有意思。
#法律AI
Legora 的 CEO 说选法律 AI 别纠结哪个模型最强,他们直接做了套路由系统,按任务自动挑模型,窄任务还自己微调小模型。
Mistral 放话了:Harvey 那个法律基准 LAB 上,Mistral Large 4 是开源模型里的第一名,做法律 AI 的可以看看。
做法律工作的朋友可以看看,Legora 上了 250 多个现成的法律技能,合同比对、合规解读这类活直接用,不用自己从头调教。
哥伦比亚法律考了 15 个模型,Gemini 3.1 Pro 选择题 0.905 但写答案正确率不到 0.45,引用的法条一半是编的,做法律 AI 的都该看看。
做法律工作的人可以看看,Legora 的 Agent 现在能学你们所里的审合同习惯,还自带 250 多个现成 Skills。
OpenAI 晒了个 GPT-6 Astra 加 Harvey 的案例,律师丢一堆文档进去就能拿到结构化法律草稿,做法律 AI 的可以看看。
OpenAI 新出的 GPT-6 Sol 和 Luna 被拿来做法律场景实测了,Sol 抓合同变更、Luna 管细节核查,做法律 AI 的可以看看成绩。
这篇论文介绍了InsufficiencyBench,这是第一个评估LLM在用户查询不足方面的法律建议的基准。它对法律AI系统提出了新的挑战,并提供了评估模型性能的新方法。
Foremark Legal刚拿了600万种子轮,用AI代理式法律事务所帮消费者算法律案值,按结果收费,和传统律所不同。
Harvey在招人组建自己的模型训练团队,要把法律AI做到模型层,已有数千GPU和独特后训练数据,能提升开源模型到前沿水平,适合想做大型模型训练的AI研究员。
Patlytics 用 LangSmith 搭建了专利全流程 AI 平台,从提示到评估都管,法律行业可以看看。
法律AI从业者终于有了一个严肃的理论框架来理解RAG的失败原因——不是模型不够大,而是检索架构与法律知识的本质不匹配。做法律科技或合规自动化的团队,建议仔细读读这篇,能帮你避开很多坑。
法律AI赛道跑出56亿美元独角兽,18个月做到1亿ARR,做企业级AI产品的团队值得研究它的增长逻辑和行业破局方法。
LangChain 与 Harvey 的联合研究展示了 AI 在法律领域的落地路径,做法律 AI 或企业级应用的开发者可以直接参考其中的工作流设计。
法律 AI 团队终于有了降本增效的实战方案——用 GLM 5.1 搭配 Claude Opus 4.7 做稀疏顾问,性能提升 28% 的同时成本砍掉 61%,做法律智能体或长链推理的开发者值得一试。
Legal AI正在打破法律资源的不平等,让普通人也能在法庭上与大机构抗衡,关注社会公平和AI应用的读者值得一看。