论文精选12:41AdvGRPO:用GRPO实现语言模型自适应红队攻防协同训练做AI安全对齐的团队终于有了一个稳定的GRPO攻防协同训练方案,能同时提升攻击发现能力和防御鲁棒性,建议做红队测试的开发者直接参考。#红队测试#GRPO#攻防协同#安全对齐aarXiv cs.AI@Blake Bullwinkel 等 4 人原文稍后读已读值得跟进有用关注 红队测试