09:36
09:36 官方账号 arXiv cs.AI @Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp AIMO可解释性挑战赛旨在通过模型内部机制区分前沿数学语言模型的鲁棒推理与虚假推理。比赛基于AI数学奥林匹克(AIMO)问题及Fields Model Initiative资源,提供新发布的奥林匹克级数学推理题及其符号表示。参赛者可访问前沿推理模型及其对抗鲁棒性评估,开发识别鲁棒推理的方法。比赛将创建开放的鲁棒性基准和基线系统,推动数学推理与可解释性研究。 推荐理由: 想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。
稍后读 已读 值得跟进 有用 关注 AIMO
09:39
09:39 官方账号 arXiv cs.AI @Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu Li MemOps基准将对话记忆重新定义为生命周期操作序列,包括记住、遗忘、更新、反思及其组合。它通过可控生成流水线在长任务对话中嵌入操作,产生六类操作级探针,并在相邻证据与长上下文两种设置下评估。实验对比了长上下文、检索、参数化和托管记忆系统,发现会话级检索优于回合级检索,而长上下文模型在重构有序记忆状态轨迹上表现明显较弱。该基准揭示出仅靠最终答案准确度无法暴露的多种失败模式,推动记忆评估向可解释的操作级诊断转变。 推荐理由: 想测AI的记忆系统到底靠不靠谱?这个新基准MemOps把记忆拆成6种操作来测,比只看最终答案准多了,搞记忆研究的必读。
稍后读 已读 值得跟进 有用 关注 MemOps
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档 (侧边栏 → AI 日报 → 顶部「往期日报」)。