AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

在线策略蒸馏

共 2 条相关 AI 资讯
7月28日
10:26
10:26官方账号arXiv cs.LG@Guoqing Ma
在线策略蒸馏(OPD)中教师提供的token级似然度常被局部解读,但本研究发现这种解读受到最终回答正确性的混淆。论文引入一种结果解析诊断方法,交叉评估点状师生分歧与最终答案正确性。在Qwen3-8B学生与Qwen3-32B教师的数学推理实验中,67.84%的响应token属于“同意但失败”(agreement-on-failure);Qwen2.5-7B/32B组合为67.68%。即使教师四轮均正确回答的提示,学生准确率达86.91%,但仍有14.76%的token存在同意但失败。三种训练策略(模仿、遮蔽、对比)均未能显著改善该现象,表明需要过程标签或教师延续等额外位置信息来解决定位局限。
论文Qwen3Qwen2.5知识蒸馏

推荐理由:论文用实验数据揭示了一个反直觉现象:学生在模仿老师时,67%的token在“同意但失败”,说明局部蒸馏有盲区。做模型蒸馏的朋友可以看看这个诊断方法。
原文
5月11日
11:42
11:42官方账号arXiv cs.AI(学术论文)
精选80°
Flow-OPD提出首个将在线策略蒸馏(OPD)集成到Flow Matching模型中的统一后训练框架,有效解决了多任务对齐中的奖励稀疏和梯度干扰问题。该框架采用两阶段对齐策略:先通过单奖励GRPO微调培养领域专用教师模型,再通过Flow冷启动、在线策略采样、任务路由标注和密集轨迹监督将异构专业知识整合到单个学生模型中。研究者还引入了流形锚点正则化(MAR),利用任务无关教师提供全数据监督,避免RL驱动对齐中常见的美学退化。在Stable Diffusion 3.5 Medium上的实验显示,GenEval分数从63提升至92,OCR准确率从59%提升至94%,整体提升约10个百分点,且保持图像保真度和人类偏好对齐,并出现“超越教师”效应。该工作为构建通用文本到图像模型的可扩展对齐范式奠定了基础。
论文图像生成Flow Matching在线策略蒸馏

推荐理由:该工作针对现有多任务对齐中指标相互制约和奖励欺骗的痛点,将LLM领域成熟的OPD方法成功迁移至图像生成领域,并通过冷启动、任务路由和正则化创新提升了效果。实验在关键指标上大幅领先现有方法,对业界构建高性能通用文生图模型具有直接参考价值。
原文
精选全部日报登录