主要来源arXiv: Anthropic
查看原文事件专题 ·官方一手
高频令牌掩码优化直接偏好优化
研究人员发现直接偏好优化(DPO)中存在高频令牌主导累积序列分数的问题。在Anthropic HH-RLHF数据集上,仅69个令牌类型占所有响应令牌的55.1%和成对共享令牌质量的85.9%。为解决此问题,他们提出了各向异性DPO(ADPO)和频率硬DPO方法。在Qwen-2.5-7B-Instruct和Llama-3-8B-Instruct模型上,该方法在AlpacaEval、MT-Bench和Arena-Hard基准测试中均优于标准DPO。
当前结论
研究人员发现高频令牌会稀释偏好信号,提出ADPO方法通过掩码这些令牌,在不增加计算成本的情况下提升了模型对齐效果。
6 个信源53° AI 热度最后更新 2026/9/26 10:21:46
证据链
6 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。