AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

GPT-5-mini

共 2 条相关 AI 资讯
9月2日
10:48
10:48官方一手arXiv: DeepSeek@Muhammed Saeed, Simon Razniewski
精选73°
LLMPEDIA 从 GPT-5-mini、DeepSeek-V3.2 和 Llama-3.3-70B 三个模型家族中提取了约 130 万篇文章。研究团队对分层抽样的事实声明进行审核,发现真实准确率为 68.4%,比 MMLU 基准低 21 个百分点。30.5% 的声明无法被维基百科或网络资源验证,属于长尾知识或合理幻觉。该平台提供五种一键视图,包括链接遍历探索、声明级事实核查、跨模型和政治立场比较等。
论文LLMPEDIAGPT-5-miniDeepSeek-V3.2
事件专题

推荐理由:LLMPEDIA 让你能直接查看和比较三大模型的知识准确性,发现它们在 MMLU 外的真实表现。
原文
5月19日
12:49
12:49官方一手arXiv: OpenAI@M. Mikail Demir, M. Abdullah Canbaz
精选
该论文针对法律先例中负面处理的自动分类任务,提出了一种更稳健的评估框架。研究基于一个由专家标注的239个真实法律引用数据集,并引入新的平均严重性错误指标来衡量分类错误的实际影响。实验显示,Google的Gemini 2.5 Flash在高层次分类任务中准确率最高(79.1%),而OpenAI的GPT-5-mini在更复杂的细粒度分类中表现最佳(67.7%)。这项工作为法律领域的NLP任务建立了关键基线,并提供了新的评估工具。
论文法律NLPLLM评估分类任务
事件专题

推荐理由:法律科技团队终于有了针对负面处理分类的专门评估框架——新指标和数据集能更真实反映错误风险,做法律文档自动化的开发者建议直接参考。
原文
精选全部日报登录