01:06elvis@omarsar0Harvey发布了其首个法律专用模型Tenet。该模型基于Kimi K3,在法律数据集上进行了微调。Tenet在LAB Contracts基准上达到SOTA性能,在LAB基准上排名第二。其所有通过率比Kimi K3基座模型提升了82%。该模型还针对代币效率进行了优化,成本仅为领先基础模型的四分之一。AI模型HarveyTenetKimi K35 个信源在谈事件专题推荐理由:Harvey发布了法律专用模型Tenet,在法律任务上表现优异,成本还很低,展示了AI原生公司如何构建自己的智能栈。原文稍后读已读值得跟进有用关注 Harvey
09:29官方账号arXiv cs.AI@Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong HeCRAFT是一种新方法,将基于评分标准的评估数据集转化为模型特定弱能力诊断。它从每个提示-评分标准对中提取能力描述,聚类成层次能力树,在4个开源模型、金融和法律两个领域及13个保留基准上评估。在金融领域,CRAFT对所有4个模型的平均分超过基线;在法律领域,对4个模型中的3个表现最强。结果表明,基于评分标准诊断比基于提示或类别能更精确地定位模型弱能力,并生成更有效的微调数据。论文CRAFT微调能力诊断推荐理由:CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。原文稍后读已读值得跟进有用关注 CRAFT
11:12IT之家(博客/媒体)韩国法院行政处因AI幻觉导致律师引用虚假判例,计划修订法案对违规律师处以罚款。首尔某法官称,现在不得不在判决书正文中逐一标注不实案例。大邱高等法院出现律师引用不存在的最高法院判例,另一律师使用谷歌Gemini检索后未核实内容。韩国已投入161亿韩元(约7179万元人民币)搭建司法专用AI平台,并上线案例编号核验功能。行业韩国法院AI幻觉律师推荐理由:法官被AI幻觉折磨原文稍后读已读值得跟进有用关注 韩国法院