论文10:32Wasserstein Policy Learning 用于分布结果型离线策略学习这篇论文把因果推断中的离线策略学习扩展到了分布结果,用Wasserstein重心定义奖励,并给出了严格的统计保证,和传统均值策略学习不同,适合做理论研究的参考。#Wasserstein#离线策略学习#分布结果#因果推断aarXiv cs.LG@Yiyan Huang 等 4 人原文稍后读已读值得跟进有用关注 Wasserstein