推荐给做在线决策或推荐排序的读者:这篇论文处理了“连续动作组合必须合规”这种常见但少有人形式化的问题,给出了可用的 OFUL 算法和遗憾界证明。
#在线学习
共 14 条 · 7 天 2 条 · 30 天 6 条
信息流里打上「在线学习」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
论文10:27
arXiv 论文:精确滑动窗口约束下的线性 Bandit 算法与遗憾界分析10月5日
10月1日
9月29日
9月28日
9月18日
8月26日
8月19日
8月14日
7月3日
6月30日
6月9日
Dri-MED:应对偏好漂移与约束的线性上下文赌博机算法
在线推荐系统常面临用户偏好漂移和基线约束的挑战,Dri-MED 为这类问题提供了理论扎实且效果显著的解决方案,做推荐系统或在线学习的团队值得关注其算法设计。
6月8日
5月12日
论文19:11
连续潜在上下文让Transformer实现高效在线学习该工作通过理论构造和实验验证,说明了连续潜在上下文可作为Transformer在线学习的通用状态载体,为构建能长期自适应交互的轻量级AI系统提供了新思路。