模型11:28EvoPolicyGym:评估自主策略演化的新基准想看看AI智能体怎么自己迭代策略吗?EvoPolicyGym这个新基准让GPT-5.5跑了16个强化学习环境,全部拿到前两名。#EvoPolicyGym#GPT-5.5#强化学习#策略演化aarXiv cs.AI@Zhilin Wang 等 16 人原文稍后读已读值得跟进有用关注 EvoPolicyGym