Vanilla 在机器学习中通常指基础、未经改进的标准方法,例如 Vanilla Reinforcement Learning(基础强化学习)或 Vanilla Transformer。近期多篇研究聚焦于突破 Vanilla 方法的局限,通过引入蒸馏、协同推理或课程学习等策略,显著提升了模型在复杂任务中的表现。
№vanilla·general
Vanilla
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-07-31
- 累计提及
- 22
§ 01综述
§ 02相关报道10 条在档
- 01β-OPSD:用策略优化推导,用自蒸馏训练
- 02SpectONet:物理引导的谱深度算子网络用于欧拉-伯努利梁动力学
- 03Off-Context GRPO:利用特权信息提升困难问题推理能力
- 04用人类策略解释和调优Transformer LLM的算术任务
- 05超级权重在LLM中并非普遍关键,单独训练导致随机猜测
- 06DOPD:双重同策略蒸馏方法提出,解决特权幻觉问题
- 07Tandem Reinforcement Learning 在 RLVR 中实现模型协同推理
- 08信号覆盖矩阵:语句自动形式化中的类型与语义错误分层
- 09边界感知课程强化学习提升LLM推理能力超越基础模型
- 10ReuseRL:将技能复用作为智能体强化学习的压缩机制
§ 03邻近话题