12:06官方账号arXiv cs.LG@Masahiro Kato, Taka Kato该论文提出一步法和两步法,将检索增强生成(RAG)用于因果推断中的政策学习。两步法通过向量搜索检索动作特定的邻近证据,生成器估计条件期望结果,从而连接向量搜索与最近邻匹配。他们将后悔分解为候选生成后悔和候选内选择后悔,并用最近邻估计器和Transformer的预测误差进行界限分析。一步法则直接作为策略进行评估,无需中间计算。论文RAG向量搜索因果推断推荐理由:这篇论文把RAG和因果推断结合起来,用向量搜索做最近邻匹配,还证明了理论界限,挺有意思的。原文稍后读已读值得跟进有用关注 RAG