进化策略可替代强化学习,性能相当且更简便
精选理由
ES作为RL替代方案,降低训练复杂度,适合大规模并行实验,对AI工程师优化策略有启发价值。
OpenAI发现,传统进化策略(ES)在现代强化学习基准测试中(如Atari/MuJoCo)表现与标准RL相当,同时解决RL的诸多不便。ES无需反向传播,无需值函数近似,且易于并行,为RL研究者提供新的优化路径。
ES作为RL替代方案,降低训练复杂度,适合大规模并行实验,对AI工程师优化策略有启发价值。
OpenAI发现,传统进化策略(ES)在现代强化学习基准测试中(如Atari/MuJoCo)表现与标准RL相当,同时解决RL的诸多不便。ES无需反向传播,无需值函数近似,且易于并行,为RL研究者提供新的优化路径。
TypeSafe AI 创始人在 a16z 节目里讲他们的新模型 Jev,思路和 Claude Code 不一样,输出是带置信度的选项,软件能直接用,聊自动化为什么一直没来。
RespanAI 出了两个专给 Agent 轨迹打分的分类模型,判断用户情绪、工具调用安全性这类行为,Lite 版免费,比 Jev 还准。
同一道题,Claude Opus 5.0 找到漏洞但选择不用,GPT-6 Astra 直接拒绝,几个顶级模型的安全表现差距一眼就能看出来。
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
a16z 聊了个新模型 Jev,它不输出文本,而是给软件返回带置信度的选项,开发者能直接用来写自动化程序,跟 Claude Code 思路完全不同。