AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

U-OPSD

共 1 条相关 AI 资讯
8月7日
12:28
12:28官方账号arXiv cs.LG@Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos
U-OPSD 提出只用模型自身生成做 on-policy 自蒸馏,不依赖真实标签、环境反馈或更大模型。它通过多次采样后多数投票构造伪答案,并把教师分布建立在最短伪答案上,蒸馏到模型最长错误补全的前缀。在 AIME24、AIME25、HMMT25、MATH500、AMC23 上,U-OPSD 让 Qwen3 4B/8B 非思考模式相对基座提升 8.5%/10.7%,平均超过 OPSD 3.2%/2.3%。思考模式下,U-OPSD 在 4B 超 OPSD 0.9%,8B 持平,并分别超 GRPO 0.7%/1.1%。
论文U-OPSDQwen3OPSD

推荐理由:不需要标注和外部反馈,U-OPSD靠投票让Qwen3数学成绩再涨一截,追平甚至超过OPSD和GRPO。
原文
精选全部日报登录