11:21官方账号arXiv cs.AI@Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya PoriaMNIST-PRO基准测试将MNIST数字识别转化为基于连续观察的搜索任务,限制了回溯能力。研究人员评估了10个多模态模型在四种记忆表示下的表现,包括原始视觉历史、文本状态、结构化网格地图和整合视觉画布。在部分可观察环境下,模型表现出明显的性能差距,暴露出三个瓶颈:感知状态构建与解释困难、过早停止探索、无法修正早期错误信念。论文MNIST-PROAI智能体部分可观察环境推荐理由:MNIST-PRO基准测试揭示了AI智能体在部分可观察环境下的感知能力缺陷,特别是整合碎片化信息和更新错误信念的能力。原文稍后读已读值得跟进有用关注 MNIST-PRO