全部 AI 动态 · AI 热点

6月18日

10:32

10:32

arXiv cs.LG@Yiyan Huang, Cheuk Hang Leung, Qi Wu, Zhiheng Zhang

该论文研究离线策略学习中结果变量为分布的情况，将每个潜在结果视为概率测度，并通过 Wasserstein 重心下的效用函数定义奖励。论文基于 IPW 和 Doubly Robust 估计量建立了统计保证，证明了有限样本后悔率的领先项为 O~(√(N-dim(Π)/N))。在一维 Wasserstein 设定下，后悔率仍由策略类复杂度主导。另外提供了极小化下界，证明了对 N 和 N-dim(Π) 的领先依赖的紧致性。

论文 Wasserstein 离线策略学习分布结果因果推断 IPW

推荐理由：这篇论文把因果推断中的离线策略学习扩展到了分布结果，用Wasserstein重心定义奖励，并给出了严格的统计保证，和传统均值策略学习不同，适合做理论研究的参考。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？