论文11:47结构感知微调增强VLM奖励模型SAFT用结构先验替代人工标注,给VLM奖励模型降噪,训练收敛更快,EPIC距离也更好了。#VLM#SAFT#LoRA#奖励模型aarXiv cs.LG@Pyrros Koussios 等 4 人原文稍后读已读值得跟进有用关注 VLM