7月30日
11:23
11:23官方账号arXiv cs.AI@Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Stephan Rabanser, David Africa, Konstantinos Voudouris, Viet Nguyen, Toby Pilditch, Magda Dubois, Harry Coppock, Cozmin Ududec, Nitya Nadgir, Matilda Orona, Tilman Bayer, Derrick Chan-Sew, Yue Ling, Abhishek Shetty, Helen Toner, Gillian Hadfield, Seth Lazar, Steve Newman, Shoshannah Tekofsky, Rishi Bommasani, Arvind Narayanan
该研究提出“影子评估”方法,让AI agent尝试回答两篇未发表的NeurIPS 2026论文的核心研究问题。agent在6天内消耗数千美元算力完成了全部工程任务,但未取得实质性进展,两篇论文均被原作者明确拒绝。研究归纳了五个失败模式:对发表标准判断不佳、研究设计缺陷缺乏创造性应对、无效回溯、资源意识差、指令漂移。另一模型和脚手架的稳健性检验重现了相同失败。
推荐理由:想知道AI做研究到底行不行?这篇论文用两个真实案例告诉你:干活还行,但搞科研还差得远,五个硬伤很实在。