11:22官方一手arXiv: DeepSeek@Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin精选现有强化学习RL训练对话智能体时通常针对固定对手,导致策略利用对手特定规律,作者将其称为静态对手不匹配问题。为此提出的IB-RL让对话双方通过联合轨迹共同进化,但各自用独立优势、动作掩码和更新路径优化自身奖励。在Vehicle TeleSales任务上,IB-RL取得89.6%的Success@1,超过最优单边基线84.6%。在Deal-or-NoDeal任务中,IB-RL对DeepSeek V4 Pro达到98.4%的一致率,而最优单边基线仅86.4%。论文IB-RLDeepSeek V4 Pro强化学习3 个信源在谈事件专题推荐理由:IB-RL让对话双方独立对练,不靠固定对手。车销任务89.6% vs 基线84.6%,还胜过DeepSeek V4 Pro。原文稍后读已读值得跟进有用关注 IB-RL