AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

专家一致性

共 1 条相关 AI 资讯
7月31日
11:25
11:25官方账号arXiv cs.LG@Bertil Braun, Martin Forell
这篇论文提出用多个LLM对输出做两两比较、再用Elo评分生成排名的评估框架。通过可调的同意阈值,从全票一致到多数投票,控制评估置信度与覆盖率。作者在科学摘要生成的胜任力画像上做了验证,自动排名与专家判断相关性良好。相比人工评估显著减少干预成本,且不依赖参考标准。论文编号为arXiv:2607.28282v1。
论文LLM评估Elo评分自动化评估

推荐理由:多模型两两PK加Elo计分来评LLM输出,能调阈值控严格度,科学摘要上跟专家判断挺接近。
原文
精选全部日报登录