论文精选72°11:01DeepWeb-Bench:更难的深度研究基准,揭示模型推理短板做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。#基准测试#深度研究#推理模型#评估方法aarXiv cs.AI@Sixiong Xie 等 11 人原文稍后读已读值得跟进有用关注 基准测试