论文精选12:11LLM-as-Judge 评估科学新颖性不可靠:RQ-Bench 揭示“新颖性幻象”做科学创新评估或使用 LLM 辅助审稿的团队,这篇论文揭示了 LLM 裁判的盲区——它可能高估新颖性,导致误判。建议点开了解 RQ-Bench 的测试方法,避免在关键评估中踩坑。#LLM评估#科学新颖性#RQ-Bench#LLM-as-JudgeaarXiv cs.AI@Soumitra Sinhahajari 等 3 人原文稍后读已读值得跟进有用关注 LLM评估