09:56官方一手arXiv: DeepSeek@Yanyu Chen, Yue Li, Yongyi Cui, Dongsheng Shi, Lichang DaiSelectBench是一个控制性基准和训练集,用于大语言模型选择性采纳检索结果中的证据。基于Qwen3.5-4B,使用DAPO强化学习方法,通过确定性规则奖励或语义法官进行后训练。在325样本的SelectBench-v2测试集上,严格成功率从原始检查点的22.46%提升至DAPO-Rule的25.54%和DAPO-DeepSeek的26.46%。两种策略均减少了禁止内容采纳,生成了更短更聚焦的回答,但提示注入跟随能力未改善。在MMLU和干净HotpotQA上未见明显退化,表明通用能力保持。论文SelectBenchDAPOQwen3.5推荐理由:Qwen3.5用强化学习学会在污染检索中挑有用证据,成功率从22%提到26%,还不掉通用分。原文稍后读已读值得跟进有用关注 SelectBench