论文11:25面向可扩展可靠的大语言模型自动化评估框架多模型两两PK加Elo计分来评LLM输出,能调阈值控严格度,科学摘要上跟专家判断挺接近。#LLM评估#Elo评分#自动化评估#专家一致性aarXiv cs.LG@Bertil Braun, Martin Forell原文稍后读已读值得跟进有用关注 LLM评估