论文10:10SPOT-E:测试时视觉聚光灯熵整形提升冻结VLM证据读取SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。#SPOT-E#VLM#GRPO#多模态aarXiv cs.AI@Bo Yin 等 9 人原文稍后读已读值得跟进有用关注 SPOT-E
论文精选11:28QGF:测试时策略优化,用价值梯度引导流模型生成高回报动作做机器人控制或连续控制RL的团队,如果受困于扩散/流模型训练的不稳定性,QGF提供了一种“训练照旧、测试优化”的实用方案,值得一试。#强化学习#流模型#测试时优化#QGFaarXiv cs.AI@Zhiyuan Zhou 等 7 人原文稍后读已读值得跟进有用关注 强化学习