事件专题 · 官方一手

强化学习提升大语言模型选择性采纳污染检索证据

SelectBench是一个控制性基准和训练集,用于大语言模型选择性采纳检索结果中的证据。基于Qwen3.5-4B,使用DAPO强化学习方法,通过确定性规则奖励或语义法官进行后训练。在325样本的SelectBench-v2测试集上,严格成功率从原始检查点的22.46%提升至DAPO-Rule的25.54%和DAPO-DeepSeek的26.46%。两种策略均减少了禁止内容采纳,生成了更短更聚焦的回答,但提示注入跟随能力未改善。在MMLU和干净HotpotQA上未见明显退化,表明通用能力保持。

当前结论

Qwen3.5用强化学习学会在污染检索中挑有用证据,成功率从22%提到26%,还不掉通用分。

2 个信源39° AI 热度最后更新 2026/7/22 12:45:04

证据链

相关来源 1LMSYS Org (SGLang)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情