On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity:研究发现,使用采样演示的在线自蒸馏虽然提升效率,但会降低策略输出的多样性,引发对探索能力的担忧。原文标题
当前焦点与观察点
当前Policy研究呈现两条主线:一是通过蒸馏和终身学习提升策略的泛化性与部署后适应能力;二是关注策略多样性下降的风险。此外,实际系统如Claude Code for Web出现的“GitHub被出口策略阻止”错误,提示策略(policy)在AI工具与外部平台交互时可能因权限限制引发运行异常。未来,如何在高效改进策略与保持探索多样性之间取得平衡,将成为关键课题。