#策略优化

共 11 条 · 7 天 0 条 · 30 天 4 条
信息流里打上「策略优化」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月2日
9月30日
8月4日
7月31日
7月21日
6月10日
6月2日
论文多源确认12:06
ReSkill:在智能体强化学习中协调技能创建与策略优化

做智能体强化学习的团队终于有了一个能自动积累可复用策略的框架——ReSkill 让技能创建和策略优化不再打架,直接提升泛化能力,做 RL 和 LLM 智能体的研究者值得细读。

事件专题
arXiv: Anthropic@Zelin He 等 9 人5 个信源在谈原文
5月19日
论文精选14:36
COOPO:循环离线-在线策略优化算法,提升强化学习效率

做强化学习研究的团队终于有了一个能同时解决分布偏移和灾难性遗忘的通用框架——COOPO 的循环设计让离线数据复用和在线探索形成正向循环,D4RL 上效果显著,建议做 RL 算法开发的同学点开看理论证明和实验细节。

arXiv cs.AI@Qisai Liu 等 6 人原文
5月12日