论文精选10:39PCM:概率性分块掩码加速VLA强化学习2.38倍做VLA机器人强化学习的团队终于有了省算力的方案——PCM直接替换GRPO就能省60%内存、快2倍多,效果还不打折,建议做后训练优化的点开看看。#强化学习#VLA策略#GRPO#梯度加速aarXiv cs.LG@Vaidehi Bagaria 等 3 人原文稍后读已读值得跟进有用关注 强化学习