optimization·general

optimization

别名
首次出现
2026-05-22
最近出现
2026-07-26
累计提及
222
§ 01综述

Optimization是机器学习领域的核心概念,指通过调整模型参数或策略来最大化或最小化某个目标函数的过程,广泛应用于训练神经网络、强化学习策略更新以及分子设计等场景。近年来,针对不同应用场景的优化方法不断创新,尤其在强化学习中的策略优化、生成模型偏好优化以及纳米技术分子优化方向涌现了大量新研究。

强化学习优化方法新进展

强化学习中的策略优化持续活跃:Proximal Policy Optimization for Amortized Discrete Sampling(原文标题)将PPO用于离散采样问题;APPO(原文标题)通过细粒度决策点优化提升AI工具调用能力;Agent Explorative Policy Optimization(原文标题)增强多模态智能体推理。此外,ESPO(原文标题)提出在PPO中提前停止以节省推理token并提升数学推理性能;GRPO优势坍塌问题诊断与AVSPO缓解方案(原文标题)则针对当前流行的GRPO算法缺陷提出改进。

分子与纳米技术优化基准

NMO基准(原文标题)专门针对纳米技术中的分子优化问题,提供了标准化测试框架,推动该领域的系统评估。类似地,Amortized Neural Optimization(原文标题)利用可微代理模型探索预布局信号完整性设计空间,展示了优化在硬件设计中的应用。

生成模型与后训练优化

VibeCoder基于Qwen2.5-Coder-3B,通过后训练技术实现出色性能(原文标题);DrPO(原文标题)提出一步生成模型偏好优化方法;ThinkDeception(原文标题)则用渐进式强化学习框架实现可解释多模态欺骗检测,这些工作均从不同角度优化生成模型的训练与推理。

当前焦点与观察点

当前Optimization研究的焦点集中于:一是提升强化学习优化的样本效率与计算经济性(如ESPO、APPO);二是解决广泛使用的PPO及其变体的稳定性问题(如GRPO优势坍塌);三是将优化从传统参数训练扩展到更复杂的分子、硬件设计等领域。这些进展表明,优化方法正从算法创新走向应用落地,但如何在不同任务中平衡性能与计算开销仍是关键挑战。
§ 02相关报道10 条在档
  1. 01
    149页长周期智能体调查:提出H1-H3与C1-C3双层级
    pandaily
  2. 02
    CriPO:基于自蒸馏增强评分RL,解决优化信号丢失问题
    arXiv cs.AI
  3. 03
    噪声鲁棒的盒监督红外小目标检测:HALO软标签优化方法
    arXiv cs.AI
  4. 04
    Muon优化器在智能体强化学习中的效果研究
    arXiv cs.AI
  5. 05
    数字万神殿:用LLM智能体模拟和审计联盟形成
    arXiv cs.AI
  6. 06
    SAO: 单轨迹异步优化稳定训练智能体强化学习
    arXiv cs.AI
  7. 07
    Liquid AI开源Antidoom:用FTPO减少推理模型Doom Loops
    marktechpost
  8. 08
    DT-Guard:面向无推理LLM安全护栏的意图驱动推理主动训练
    arXiv cs.AI
  9. 09
    PWO:神经量子态的临近波函数优化算法
    arXiv cs.LG
  10. 10
    NMO基准:推动纳米技术分子优化的新测试
    arXiv cs.LG
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/optimization