论文09:44SCPO: 语义一致性策略优化用于LLM智能体强化学习这篇论文解决了强化学习给LLM智能体分配奖励时的一个逻辑问题:相同意思的步骤因轨迹成败拿了相反信用。SCPO在ALFWorld和WebShop上跑分挺高,最难的步骤提升明显。#SCPO#ALFWorld#WebShop#强化学习aarXiv cs.AI@Peng Xu 等 4 人原文稍后读已读值得跟进有用关注 SCPO