结构化参数环境下课程生成提升导航策略鲁棒性

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

精选理由

想让导航策略适应各种环境参数?这篇论文的自动课程生成方法在Car Racing和Bipedal Walker上打败了SPRL等基线,值得一看。

AI 摘要

该论文提出一种基于单向梯度优化的重参数化课程生成框架,用于在连续环境参数(如转弯率、障碍物、摩擦、坑洞、坡度)中自动设计训练课程,提升自主智能体的导航策略泛化能力。方法在包含图像和标量的多模态观测空间中引入分布偏移正则化目标,以学习更细粒度的潜在表征。在OpenAI Gym的Car Racing和Bipedal Walker两个连续控制环境中,该方法在五个随机种子上优于普通策略训练、随机参数采样、手动课程、前沿方法、SPRL、ALP-GMM和反向课程学习等基线。消融实验验证了重参数化课程机制的有效性,并揭示了辅助正则化目标在不同环境中的依赖效果。

原文 · arXiv: OpenAI

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

Robust navigation policies for autonomous agents must generalize across continuously varying environmental conditions such as turn rates, obstacles, friction, pits, and slopes. Curriculum generation provides a principled mechanism for improving generalization by progressively adapting training environments, but designing such curricula in a sample-efficient and automated manner remains challenging. This paper proposes a reparameterized curriculum generation framework for structured continuous environment parameters using unidirectional gradient-based optimization. To improve robustness in multimodal observation spaces consisting of image-based and scalar inputs, a distribution-shift regularization objective is incorporated to encourage the learning of finer-grained latent representations. The proposed method is evaluated across two continuous-control OpenAI Gym environments: a 2D obstacle-based Car Racing variant and Bipedal Walker variant, where coupled environment parameters jointly influence policy performance. Across five random seeds, our method consistently outperforms vanilla policy training, random parameter sampling, manual curricula, frontier-based methods, Self-Paced Reinforcement Learning (SPRL), Absolute Learning Progress with Gaussian Mixture Models (ALP-GMM), and reverse curriculum learning baselines. Ablation studies further demonstrate the effectiveness of the reparameterized curriculum mechanism across both environments, while highlighting environment-dependent benefits of the auxiliary regularization objective.