AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

TIDE

共 2 条相关 AI 资讯
8月11日
11:39
11:39官方账号arXiv cs.AI@Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou
精选
在线策略蒸馏(OPD)是LLM后训练的核心环节,但存在退化一致性问题:学生通过重复循环获得与教师近乎完美的token一致,但整体回答有缺陷。论文将焦点转向师生不匹配,发现不匹配token分为学生多余和学生缺失两类。提出的TIDE方法采用有界Hellinger整形抑制多余token,并通过教师top-K注入恢复缺失token的概率质量。在Qwen3多个师生对上的数学推理基准中,TIDE优于标准OPD及近期基线,在强不匹配场景下Avg@8从6.9%提升至20.3%,平均响应长度缩短3.6倍。
论文TIDE在线蒸馏Qwen3

推荐理由:这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。
原文
5月19日
10:00
10:00官方账号arXiv cs.AI@Zheqin Yin, Yupei Ren, Yadong Zhang, Yujiang Lu, Man Lan
精选
现有研究在通过提示词准确理解和评估议论文方面存在不足。本文提出TIDE框架,通过引入“试验与辩论”机制,优化基于标准的提示词优化过程,减少噪声训练数据的影响并提升优化稳定性。在自动作文评分、论证成分检测和论证关系识别三个核心任务上,TIDE均提升了性能。该工作展示了结合提示词方法与辩论机制在高级论证理解中的潜力。
论文议论文理解提示词优化辩论机制

推荐理由:做教育AI或文本评估的团队,TIDE用辩论机制解决了提示词优化中的噪声和稳定性问题,值得在议论文分析场景中尝试。
原文
精选全部日报登录