论文精选10:17VEPO:视觉锚定令牌选择解锁视觉推理强化学习视觉推理强化学习一直缺乏有效的信用分配机制,VEPO解决了这个痛点——做多模态RL的团队可以直接参考这个框架,在视觉-语义交叉场景中提升模型表现。#强化学习#视觉推理#令牌选择#多模态aarXiv cs.AI@Senjie Jin 等 11 人原文稍后读已读值得跟进有用关注 强化学习