事件专题 · 官方一手

IB-RL:隔离双边强化学习提升战略对话智能体泛化

现有强化学习RL训练对话智能体时通常针对固定对手,导致策略利用对手特定规律,作者将其称为静态对手不匹配问题。为此提出的IB-RL让对话双方通过联合轨迹共同进化,但各自用独立优势、动作掩码和更新路径优化自身奖励。在Vehicle TeleSales任务上,IB-RL取得89.6%的Success@1,超过最优单边基线84.6%。在Deal-or-NoDeal任务中,IB-RL对DeepSeek V4 Pro达到98.4%的一致率,而最优单边基线仅86.4%。

当前结论

IB-RL让对话双方独立对练,不靠固定对手。车销任务89.6% vs 基线84.6%,还胜过DeepSeek V4 Pro。

4 个信源47° AI 热度最后更新 2026/8/7 02:59:53

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情