10:42官方一手arXiv: DeepSeek@Tailin ZhouHierarchical Self-Improvement (HSI) 框架提出让单个冻结的LLM在三个层级上运作:任务harness执行任务、evolver重写harness、meta-evolver重写evolver策略。在BALROG基准上以DeepSeek-V4-Flash-Preview为骨干,HSI在中等难度任务上比初始harness提升显著:BabyAI +39.3、Crafter +33.0、TextWorld +25.0、MiniHack +15.0(均为原始% Progress)。在BabaIsAI子套件上表现出强泛化,BreakStop最佳测试0.98、GoTo达1.00(来自20%未见分割)。当任务超出骨干能力(如NLE)时,harness进化无改善,揭示了反馈保真度和骨干能力两个边界。论文HSIDeepSeek-V4-Flash-PreviewBALROG推荐理由:想用冻结模型提升agent性能?HSI让模型自己改写执行脚手架,在BabyAI等任务上涨了39个点,代码已开源,值得一看。原文稍后读已读值得跟进有用关注 HSI