15:28官方账号arXiv cs.AI@Hui MaoarXiv 论文提出用历史回测评估科学问题生成系统:从历史截止点的语料生成问题,冻结后由未来语料判定其是否被回答、部分解决或独立提出。研究在 2010-2024 四个时间窗口测试 798 个问题,发现证据结构优先的生成器优于纯 LLM 提示,后者存在记忆性相关但缺乏前瞻性。七位评分者一致性研究显示人类标注者 kappa 仅 0.17,而前沿模型间一致性达 0.60,说明 LLM 评委可靠性被高估三倍。论文发布了可复现的天文学实例和 200 个冻结问题供未来验证。论文历史回测科学发现LLM评估推荐理由:这篇论文给科学问题生成系统立了个可证伪的考试:用未来文献打分。证据结构优先的生成器比纯 LLM 提示更靠谱,还发现 LLM 评委互相打分虚高,值得做科研工具的人看看。原文稍后读已读值得跟进有用关注 历史回测