AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

SDPO

共 1 条相关 AI 资讯
8月6日
09:29
09:29官方账号arXiv cs.AI@Sarthak Harne, Chinmay Karkar, Yash Pandya, Ahmed Awadallah, Akshay Nambi
论文复现了SDPO在简单设置下的收益,但相同流程应用到困难任务(问答、数学、代码、多轮agentic工具使用)后失效。训练中每个token的损失持续下降,验证准确率却无法提升甚至退化。作者提出PI偏置分数,量化教师因见过单一参考解而对特定轨迹的偏向。学生匹配这种目标后,损失主要落在停用词、标点等低信息token上,并惩罚探索性token。结论是自蒸馏单独作为目标时,优化信号与任务成功并不挂钩。
论文SDPOOPSD自蒸馏

推荐理由:这篇论文把SDPO从简单题搬到难题上,发现loss降了但准确率不涨,还提出PI偏置分数解释原因,值得做蒸馏的人看。
原文
精选全部日报登录