FirstResearch: 可审计LLM科学发现问题生成框架
这篇论文搞了个FirstResearch框架,用研究问题证书让LLM提的科学问题更透明可查,比现有方法得分高出一截,适合研究AI科学发现的同学看看。
这篇论文搞了个FirstResearch框架,用研究问题证书让LLM提的科学问题更透明可查,比现有方法得分高出一截,适合研究AI科学发现的同学看看。
做科学创新评估或使用 LLM 辅助审稿的团队,这篇论文揭示了 LLM 裁判的盲区——它可能高估新颖性,导致误判。建议点开了解 RQ-Bench 的测试方法,避免在关键评估中踩坑。