论文精选12:12SoundnessBench:AI科学家能否区分好与坏的研究想法?这个基准测试戳中了AI科研助手的关键短板——无法判断研究想法的可行性,做自动化科研或依赖LLM审稿的团队值得关注,看完会重新评估AI在科研流程中的角色。#基准测试#LLM评估#科研自动化#乐观偏差aarXiv cs.LG@Sy-Tuyen Ho 等 4 人原文稍后读已读值得跟进有用关注 基准测试