11:23
11:23
官方账号arXiv cs.AI@Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Stephan Rabanser, David Africa, Konstantinos Voudouris, Viet Nguyen, Toby Pilditch, Magda Dubois, Harry Coppock, Cozmin Ududec, Nitya Nadgir, Matilda Orona, Tilman Bayer, Derrick Chan-Sew, Yue Ling, Abhishek Shetty, Helen Toner, Gillian Hadfield, Seth Lazar, Steve Newman, Shoshannah Tekofsky, Rishi Bommasani, Arvind Narayanan 该研究提出“影子评估”方法,让AI agent尝试回答两篇未发表的NeurIPS 2026论文的核心研究问题。agent在6天内消耗数千美元算力完成了全部工程任务,但未取得实质性进展,两篇论文均被原作者明确拒绝。研究归纳了五个失败模式:对发表标准判断不佳、研究设计缺陷缺乏创造性应对、无效回溯、资源意识差、指令漂移。另一模型和脚手架的稳健性检验重现了相同失败。
推荐理由:想知道AI做研究到底行不行?这篇论文用两个真实案例告诉你:干活还行,但搞科研还差得远,五个硬伤很实在。
11:17
11:17
官方账号arXiv cs.AI@Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu 新基准 OmegaUse-OfficeVal 包含 100 个办公套件任务,平均需 2.32 小时人工完成。每个任务提供人工时间与任务价格代理两个经济信号,用于对比人类成本与 LLM 推理成本。评估了 GPT-4、Claude 3.5 等前沿 LLM,结果显示它们虽更便宜更快,但交付质量尚未达到人类水平。该基准代码与数据集已开源。
推荐理由:想做办公自动化?这个新基准用真实成本告诉你:现在LLM虽便宜但还没人类靠谱,值得看看差距在哪。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。