12:04官方账号arXiv cs.AI@Boning Li, Longbo HuangCS-RNR 是一种对手利用方法,通过任意时点有效的置信序列跟踪对手动作频率,仅当置信区间与均衡参考分离时才视为可剥削。该方法在部署前对每个候选策略进行全树最优响应审计,生成安全性证书并与用户指定预算比较。在 Leduc hold'em 中,CS-RNR 的稳态收益是货币验证二进制门控的 6.2 倍,轨迹混合变体达到预算的 13.6 倍。在 Leduc、Liar's Dice 和 5-rank Leduc 上,全部 36,000 次审计手牌均满足报告证书容差。论文CS-RNRLeduc hold'emLiar's Dice推荐理由:这篇论文提出CS-RNR,让智能体只利用自己审计过的对手漏洞。Leduc扑克收益是二进制门控的6.2倍,且36,000手牌全部符合安全证书。原文稍后读已读值得跟进有用关注 CS-RNR