论文10:03面向弹性信息物理系统的无模型强化学习控制这篇论文对比了四种强化学习奖励函数在抵御网络攻击时的表现,发现Lyapunov奖励弹性最好,PPO比DDPG方差更低,做控制器设计可以拿来参考。#PPO#DDPG#Lyapunov奖励#强化学习aarXiv cs.LG@Hugo O. Garcés 等 8 人原文稍后读已读值得跟进有用关注 PPO