policy

general · 首次出现 2026-05-22 · 最近出现 2026-09-11 · 累计提及 434

综述

Policy在人工智能领域通常指智能体在特定环境下采取行动的策略或规则。近期,policy相关研究在强化学习、机器人控制和大型语言模型等领域取得显著进展。

Policy 近期进展

  • 7.4%的准确率提升来自测试时自进化框架,该框架通过持续优化GUI视觉定位的policy实现了这一突破。
  • 3PO方法通过参数空间探索提升了LLM强化学习性能,展示了policy优化在大型语言模型中的应用潜力。
  • DASH框架针对推理模型的on-policy自蒸馏提出了自适应监督视野,改进了传统policy蒸馏方法。
  • APO框架实现了无监督原子策略优化,用于原子系统3D结构预测,展示了policy在科学计算中的应用。
  • 当前焦点与观察点

    Policy研究正从单一参数优化转向系统级适应,如持续学习研究所示。同时,边缘计算与云端的协同也促使policy推理引擎向实时与扩展性方向发展。值得注意的是,LLM Agent的权限policy框架APPA的出现,反映了AI系统安全与可控性日益受到重视。未来,policy研究可能更加注重跨领域应用与实际部署的平衡。

    相关报道

    10 条在档