10:48官方一手arXiv: DeepSeek@Muhammed Saeed, Simon Razniewski精选73°LLMPEDIA 从 GPT-5-mini、DeepSeek-V3.2 和 Llama-3.3-70B 三个模型家族中提取了约 130 万篇文章。研究团队对分层抽样的事实声明进行审核,发现真实准确率为 68.4%,比 MMLU 基准低 21 个百分点。30.5% 的声明无法被维基百科或网络资源验证,属于长尾知识或合理幻觉。该平台提供五种一键视图,包括链接遍历探索、声明级事实核查、跨模型和政治立场比较等。论文LLMPEDIAGPT-5-miniDeepSeek-V3.21 个信源在谈事件专题推荐理由:LLMPEDIA 让你能直接查看和比较三大模型的知识准确性,发现它们在 MMLU 外的真实表现。原文稍后读已读值得跟进有用关注 LLMPEDIA
12:49官方一手arXiv: OpenAI@M. Mikail Demir, M. Abdullah Canbaz精选该论文针对法律先例中负面处理的自动分类任务,提出了一种更稳健的评估框架。研究基于一个由专家标注的239个真实法律引用数据集,并引入新的平均严重性错误指标来衡量分类错误的实际影响。实验显示,Google的Gemini 2.5 Flash在高层次分类任务中准确率最高(79.1%),而OpenAI的GPT-5-mini在更复杂的细粒度分类中表现最佳(67.7%)。这项工作为法律领域的NLP任务建立了关键基线,并提供了新的评估工具。论文法律NLPLLM评估分类任务7 个信源在谈事件专题推荐理由:法律科技团队终于有了针对负面处理分类的专门评估框架——新指标和数据集能更真实反映错误风险,做法律文档自动化的开发者建议直接参考。原文稍后读已读值得跟进有用关注 法律NLP