#策略优化
共 11 条 · 7 天 0 条 · 30 天 4 条
信息流里打上「策略优化」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月2日
9月30日
8月4日
7月31日
7月21日
6月10日
6月2日
ReSkill:在智能体强化学习中协调技能创建与策略优化
做智能体强化学习的团队终于有了一个能自动积累可复用策略的框架——ReSkill 让技能创建和策略优化不再打架,直接提升泛化能力,做 RL 和 LLM 智能体的研究者值得细读。
5月19日
COOPO:循环离线-在线策略优化算法,提升强化学习效率
做强化学习研究的团队终于有了一个能同时解决分布偏移和灾难性遗忘的通用框架——COOPO 的循环设计让离线数据复用和在线探索形成正向循环,D4RL 上效果显著,建议做 RL 算法开发的同学点开看理论证明和实验细节。
5月12日
EXPO:自适应KL调节与高斯课程采样的探索优先策略优化
该工作针对GRPO在LLM数学推理中的实际瓶颈提出两项轻量改进,AKL与GCS模块即插即用,实验验证显著提升pass@32指标,对强化学习训练策略的优化具有直接指导意义。