8月7日
09:22
09:22官方账号arXiv cs.AI@Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel
iARCS 框架用迭代智能体强化学习,让预训练场景生成器适配自然语言任务要求。它采用两阶段策略:先用通用奖励预训练提升物理合理性,再用 LLM 生成的奖励程序做任务特定微调。实验在可步行性、可达性和间隙约束任务上提升了约束保真度,同时场景多样性保持竞争力。iARCS 生成的数据还能反过来改进基础生成器。
推荐理由:iARCS 用强化学习让 3D 场景生成器听懂自然语言要求,走路、够东西这些约束都能满足,还能提升基础生成器。