论文11:43GraphDPO:利用偏好图扩展语言模型对齐优化该研究从图论视角重新审视偏好对齐,解决了DPO在多响应数据上的局限性,对提升模型训练效率和稳定性具有实际指导意义。#偏好优化#DPO#图结构学习#语言模型对齐aarXiv cs.LG原文稍后读已读值得跟进有用关注 偏好优化