09:40官方账号arXiv cs.AI@Yuzhou Liu, Xiyang HuCloud-ScPO 提出从大模型内部表征的几何结构中挖掘偏好信号,无需外部奖励模型。它利用少量标注样本构建正确与错误的参考云,将每条推理轨迹映射为平均池化隐藏状态,并用组件级软k近邻打分。在GSM8K和MATH-Numeric数据集上,Cloud-ScPO相较ScPO最高提升4.49%和4.19%。对配对轨迹的分析显示,该方法在保持正确率的同时,能更有效筛选出高质量的正确轨迹。论文Cloud-ScPOScPOGSM8K推荐理由:这篇论文教模型用自己脑内的几何结构来挑正确答案,不用额外奖励模型,在GSM8K和MATH上比原版ScPO高出4个多点。原文稍后读已读值得跟进有用关注 Cloud-ScPO