全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月18日

10:37

10:37

arXiv cs.LG@Yifan Zhang, Liang Zheng

精选

现实世界的控制系统常面临分段平稳环境，即动态长期稳定后突然发生模式切换。标准鲁棒强化学习方法面临两难：全局保守策略在稳定期性能浪费，而局部自适应策略在未检测到模式变化时可能导致灾难性失败。本文提出BAPR（贝叶斯遗忘分段鲁棒SAC），将贝叶斯在线变化检测（BOCD）与鲁棒集成强化学习统一。BAPR算子是一个γ-压缩映射，通过冻结信念分布加权模式条件贝尔曼算子的凸组合。论文通过Lean 4形式化验证了尖锐边界：当信念依赖于Q函数时，压缩因子变为γ+λΔ，且当γ+λΔ≥1时压缩失败。BOCD驱动自适应保守机制：检测到变化点后策略变得极度保守，随置信度增长平滑放松，检测延迟为O(log(1/δ))。

论文强化学习非平稳控制贝叶斯变化检测鲁棒控制 Lean 4形式化验证

推荐理由：做非平稳控制或鲁棒强化学习的团队终于有了一个理论扎实且可验证的方案——BAPR在稳定期和变化期之间自动平衡保守性，Lean 4形式化验证保证了可靠性，值得研究RL安全性的开发者点开。