08:06elvis@omarsar0精选NPO是一种单谱系提示优化器,在指令跟随基准上仅需3,500和6,800次轮次就达到GEPA的3,593和6,871次轮次的性能。NPO不使用候选种群和搜索树,而是通过滑动窗口将最近迭代交给教师模型重写提示。在22个TextArena游戏中,NPO保持与GEPA相当的性能。随着教师模型能力增强,NPO的优势会扩大,这表明优化器端的搜索复杂度一直在弥补教师推理能力的不足。论文NPO提示优化GEPA推荐理由:NPO用简单方法实现高效提示优化,教师模型越强效果越好,颠覆了复杂优化器的设计思路。原文稍后读已读值得跟进有用关注 NPO