AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

POMDP

共 2 条相关 AI 资讯
7月30日
11:26
11:26官方账号arXiv cs.LG@Zuyuan Zhang, Yongshan Chen, Mahdi Imani, Tian Lan
该研究针对Holonomy-Cover决策过程(一类结构化的POMDP)构建稳定商,即保持一步奖励和商后继的最粗观测-wise抽象。理论证明当前观测与稳定类构成精确有限马尔可夫状态,且在可到达性和成对决策分离条件下,任何有限记忆控制器无法使用更少的记忆符号。在可重置诊断下,近原型类推理的误差呈指数衰减。实验将原始状态压缩至商状态,仅用三个决策记忆状态即实现完美配对顺序准确率,优于非商基线。
论文Holonomy-CoverPOMDP稳定商

推荐理由:这篇论文给POMDP找了个最省记忆的压缩方法,稳定商只用3个记忆状态就能完美还原配对顺序,比传统方法省很多。
原文
6月16日
11:07
11:07官方账号arXiv cs.LG@Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet
该论文提出一种基于因果起源的统一分类法,用于描述强化学习(RL)中的分布偏移。作者将监督学习中的经典数据集偏移原则迁移到RL,通过部分可观测马尔可夫决策过程(POMDP)将交互分解为状态分布、观测过程、策略、奖励和转移动力学等结构组件。分类法区分了内部(智能体驱动)和外部(环境驱动)两种分布偏移,并从偏移时间边界角度定义了显式、隐式和混合偏移。该方法统一了分布内/分布外(ID/OOD)泛化与非平稳性,并引入性能退化与恢复指标来评估偏移影响和适应性。
论文强化学习分布偏移POMDP

推荐理由:这篇论文把RL里训练和测试环境不一致的问题,用因果原因做了系统分类,还统一了OOD泛化和非平稳性的视角,搞清楚偏移根源才能更好做鲁棒性分析。
原文
精选全部日报登录