vanilla·general

Vanilla

别名
首次出现
2026-05-22
最近出现
2026-07-31
累计提及
22
§ 01综述

Vanilla 在机器学习中通常指基础、未经改进的标准方法,例如 Vanilla Reinforcement Learning(基础强化学习)或 Vanilla Transformer。近期多篇研究聚焦于突破 Vanilla 方法的局限,通过引入蒸馏、协同推理或课程学习等策略,显著提升了模型在复杂任务中的表现。

Vanilla 方法的近期改进进展

  • 双重同策略蒸馏解决特权幻觉:DOPD 方法针对 Vanilla 知识蒸馏中教师模型可能产生的特权幻觉,提出双重同策略蒸馏,在不依赖额外数据下提升了学生模型的鲁棒性。 原文标题
  • Tandem RL 实现模型协同推理:Tandem Reinforcement Learning 在 RLVR 框架中让两个模型协同推理,超越了单独使用 Vanilla RL 的推理能力上限。 原文标题
  • 边界感知课程强化学习提升推理:该方法通过课程学习动态调整训练边界,使 LLM 的推理能力显著超过其对应的 Vanilla 基础模型。 原文标题
  • ReuseRL 将技能复用注入强化学习:ReuseRL 提出将技能复用作为压缩机制,有效缓解了 Vanilla 强化学习中样本效率低下的问题。 原文标题
  • 当前焦点与观察点

    当前对 Vanilla 方法的改进呈现出两大趋势:一是通过蒸馏或协作机制突破单一模型的能力瓶颈,二是通过课程学习或技能复用提升训练效率。然而,这些方法的通用性和计算成本仍需进一步验证,Vanilla 方法因其简洁性仍是许多场景的可靠基线。如何平衡改进收益与复杂度,将是后续研究的焦点。
    § 02相关报道10 条在档
    1. 01
      β-OPSD:用策略优化推导,用自蒸馏训练
      arXiv cs.LG
    2. 02
      SpectONet:物理引导的谱深度算子网络用于欧拉-伯努利梁动力学
      arXiv cs.LG
    3. 03
      Off-Context GRPO:利用特权信息提升困难问题推理能力
      arXiv cs.LG
    4. 04
      用人类策略解释和调优Transformer LLM的算术任务
      arXiv cs.LG
    5. 05
      超级权重在LLM中并非普遍关键,单独训练导致随机猜测
      arXiv cs.LG
    6. 06
      DOPD:双重同策略蒸馏方法提出,解决特权幻觉问题
      arXiv cs.AI
    7. 07
      Tandem Reinforcement Learning 在 RLVR 中实现模型协同推理
      arXiv cs.AI
    8. 08
      信号覆盖矩阵:语句自动形式化中的类型与语义错误分层
      arXiv: DeepSeek
    9. 09
      边界感知课程强化学习提升LLM推理能力超越基础模型
      arXiv: DeepSeek
    10. 10
      ReuseRL:将技能复用作为智能体强化学习的压缩机制
      arXiv cs.LG
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Vanilla