论文14:56P-TTT:用测试时训练改进个性化奖励建模一篇讲个性化奖励建模的论文,指出了 ICL 方法学不到偏好关系的坑,提出的 P-TTT 一次前向就能更新用户权重,做 RLHF 的可以看看。#P-TTT#RLHF#奖励模型#测试时训练aarXiv cs.AI@Bohao Wang 等 7 人原文稍后读已读值得跟进有用关注 P-TTT