论文政策与合规精选10:22CoPhy:认知-物理强化学习框架实现自动驾驶新突破自动驾驶团队终于有了兼顾安全与意图的强化学习方案——CoPhy用蒸馏VLM和BEV世界模型解决了行为克隆的瓶颈,做端到端驾驶的开发者可以直接参考其双奖励机制。#自动驾驶#强化学习#VLM蒸馏#BEV世界模型aarXiv cs.LG@Yang Wu 等 6 人原文稍后读已读值得跟进有用关注 自动驾驶