论文精选72°10:58VPO:向量策略优化训练多样性,提升测试时搜索效果VPO解决了LLM在推理时搜索中缺乏多样性的痛点,做强化学习后训练或推理时搜索的团队值得关注,它直接替换GRPO就能提升搜索效果。#强化学习#推理时搜索#多样性训练#VPOaarXiv cs.AI@Ryan Bahlous-Boldi 等 9 人原文稍后读已读值得跟进有用关注 强化学习