reinforcement-learning
general · 首次出现 2026-05-22 · 最近出现 2026-09-25 · 累计提及 250
综述
相关报道
10 条在档- 一种新方法稳定大语言模型强化学习arXiv cs.LG
- 一篇综述论文探讨控制理论、最优传输等五大学科与机器学习的联系arXiv cs.LG
- 一种基于模型强化学习的模块化生产系统分布式优化方法arXiv cs.LG
- 图像强化学习中整合新颖性与惊喜的经验回放方法arXiv: Google DeepMind
- 物理增强强化学习PEARL实现动力学系统实时最优控制arXiv cs.LG
- PACT:小型语言模型规划提升反应式强化学习在陌生环境中的表现arXiv cs.LG
- 策略梯度与软Q学习的等价性OpenAI Blog
- 多目标强化学习:挑战机器人环境与研究呼吁OpenAI Blog
- OpenAI发布PPO算法:更简单的强化学习OpenAI Blog
- 进化策略可替代强化学习,性能相当且更简便OpenAI Blog