11:47官方账号arXiv cs.LG@Pyrros Koussios, Chenhao Li, Xin Chen, Andreas KrauseSAFT是一种自监督方法,通过LoRA适配器利用任务固有结构先验来正则化VLM的潜在空间,无需人工标注即可在线优化奖励信号。在多个基础模型能力范围内测试,SAFT持续降低奖励噪声,加速策略收敛,并使EPIC距离显著改善。研究表明VLM奖励模型的失败多源于结构脆弱性而非语义误解,SAFT为文本条件强化学习提供了可扩展的稳定路径。论文VLMSAFTLoRA推荐理由:SAFT用结构先验替代人工标注,给VLM奖励模型降噪,训练收敛更快,EPIC距离也更好了。原文稍后读已读值得跟进有用关注 VLM