11:26官方账号arXiv cs.LG@Zuyuan Zhang, Yongshan Chen, Mahdi Imani, Tian Lan该研究针对Holonomy-Cover决策过程(一类结构化的POMDP)构建稳定商,即保持一步奖励和商后继的最粗观测-wise抽象。理论证明当前观测与稳定类构成精确有限马尔可夫状态,且在可到达性和成对决策分离条件下,任何有限记忆控制器无法使用更少的记忆符号。在可重置诊断下,近原型类推理的误差呈指数衰减。实验将原始状态压缩至商状态,仅用三个决策记忆状态即实现完美配对顺序准确率,优于非商基线。论文Holonomy-CoverPOMDP稳定商推荐理由:这篇论文给POMDP找了个最省记忆的压缩方法,稳定商只用3个记忆状态就能完美还原配对顺序,比传统方法省很多。原文稍后读已读值得跟进有用关注 Holonomy-Cover