论文精选11:21黑盒LLM评估器可靠性研究失败OpenAI等公司的模型评估可能存在严重可靠性问题,同一模型在不同时间点表现差异巨大。#LLM#评估可靠性#模型评估#Spearman官方账号arXiv cs.LG@Haoyaun Zhu, Jie Zhang原文稍后读已读值得跟进有用关注 LLM