AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

BALROG

共 1 条相关 AI 资讯
8月11日
10:42
10:42官方一手arXiv: DeepSeek@Tailin Zhou
Hierarchical Self-Improvement (HSI) 框架提出让单个冻结的LLM在三个层级上运作:任务harness执行任务、evolver重写harness、meta-evolver重写evolver策略。在BALROG基准上以DeepSeek-V4-Flash-Preview为骨干,HSI在中等难度任务上比初始harness提升显著:BabyAI +39.3、Crafter +33.0、TextWorld +25.0、MiniHack +15.0(均为原始% Progress)。在BabaIsAI子套件上表现出强泛化,BreakStop最佳测试0.98、GoTo达1.00(来自20%未见分割)。当任务超出骨干能力(如NLE)时,harness进化无改善,揭示了反馈保真度和骨干能力两个边界。
论文HSIDeepSeek-V4-Flash-PreviewBALROG

推荐理由:想用冻结模型提升agent性能?HSI让模型自己改写执行脚手架,在BabyAI等任务上涨了39个点,代码已开源,值得一看。
原文
精选全部日报登录