AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

SAFT

共 1 条相关 AI 资讯
8月5日
11:47
11:47官方账号arXiv cs.LG@Pyrros Koussios, Chenhao Li, Xin Chen, Andreas Krause
SAFT是一种自监督方法,通过LoRA适配器利用任务固有结构先验来正则化VLM的潜在空间,无需人工标注即可在线优化奖励信号。在多个基础模型能力范围内测试,SAFT持续降低奖励噪声,加速策略收敛,并使EPIC距离显著改善。研究表明VLM奖励模型的失败多源于结构脆弱性而非语义误解,SAFT为文本条件强化学习提供了可扩展的稳定路径。
论文VLMSAFTLoRA

推荐理由:SAFT用结构先验替代人工标注,给VLM奖励模型降噪,训练收敛更快,EPIC距离也更好了。
原文
精选全部日报登录