13:14官方一手arXiv: DeepSeek@Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang精选Hyper-ES提出用少量梯度微调获取下降方向,再在低维子空间内用CMA-ES优化逐层DARE-TIES合并系数,避免在高维参数空间中随机扰动失效。研究在Qwen2.5-Instruct和DeepSeek-R1-Distill三个骨干上测试六个数学推理数据集。结果显示,Hyper-ES相比GRPO-LoRA平均提升1%,同时减少10%的梯度更新。代码已开源在GitHub。论文Hyper-ESCMA-ESDARE-TIES推荐理由:用少量梯度找方向,再用ES在子空间里搜,省资源还比GRPO-LoRA高1个点,有代码。原文稍后读已读值得跟进有用关注 Hyper-ES
09:26官方账号arXiv cs.LG@Riccardo Curcio, Toni Mancini, Enrico TronciSMC-ES是一种结合进化策略与统计模型检查的新算法,用于自动综合具有形式保证的控制策略。该方法以置信度1-δ和允许故障概率ε为参数,确保证书表明违规概率不超过ε。在Gymnasium和Safety Gymnasium的连续控制任务上评估,计算成本可持续增加,但性能与领先的无模型深度强化学习(DRL)和安全DRL基线相当。该算法为性能、安全性和鲁棒性规格提供了形式保证。论文SMC-ES进化策略统计模型检查推荐理由:这篇论文提出了SMC-ES,把进化策略和统计模型检查结合起来,能生成带形式安全证明的控制策略。比普通RL更靠谱。原文稍后读已读值得跟进有用关注 SMC-ES
11:46官方一手arXiv: DeepSeek@Pan Li精选论文审计了LLM作为进化引擎在科学方程发现中的效果,发现父代条件进化与独立采样无显著差异:中位OOD NMSE分别为0.045和0.049。新方法PTB-Search仅需一次LLM采样,通过集合级稀疏选择在717个测试中解决165-169个,而单术语方法仅74-78个。在239个问题的LLM-SRBench上,PTB-Search用Llama-3.1-8B达到73.2% Acc0.1,用DeepSeek-V4达到77.0%,是最好基线(49.2%)的1.5倍以上,且调用预算仅十分之一。论文PTB-SearchLLM-SRBench科学发现推荐理由:别浪费算力跑进化循环了——这篇论文实测发现多轮迭代没用,用一次采样加集合选择反而效果翻倍,还省了90%的调用成本。原文稍后读已读值得跟进有用关注 PTB-Search
20:02官方账号AlphaSignal@AlphaSignalAI88°NVIDIA 与牛津大学联合发表论文,提出 EGGROLL 方法,将进化策略(Evolution Strategies)扩展到十亿参数模型,无需反向传播即可训练。该方法用两个低秩矩阵替代密集随机扰动矩阵,大幅降低内存消耗,达到纯推理吞吐量的 91%。EGGROLL 支持数十万并行变异,可与不可微分组件配合,在推理任务上与 GRPO 竞争。团队还训练了纯 8 位整数循环语言模型 EGG,非线性来自整数溢出裁剪,而非激活函数,预训练时种群规模超过百万。论文进化策略反向传播NVIDIA推荐理由:这项研究打破了深度学习十年来的反向传播依赖,做大规模模型训练或非可微分任务(如强化学习、神经架构搜索)的团队可以直接关注 EGGROLL,它可能改变你构建模型的方式。原文稍后读已读值得跟进有用关注 进化策略