dapo·product

DAPO

别名
首次出现
2026-05-23
最近出现
2026-07-23
累计提及
5
§ 01综述
  • DAPO 是一种用于大语言模型(Large Language Model, LLM)的技术,旨在提升模型在推理过程中的精度和效率。
  • DAPO 近期进展

  • Miles 引入 OPD:使 Qwen3.5-35B 推理缩短 3 倍且精度提升:Miles 引入了一种新的优化策略 OPD,显著提高了 Qwen3.5-35B 模型的推理速度和准确性。
  • 强化学习提升大语言模型选择性采纳污染检索证据:研究人员通过强化学习技术,使大语言模型在采纳检索证据时更加精准,减少了污染证据的影响。
  • STARE:基于惊讶度引导的令牌级优势重加权策略熵稳定性方法:STARE 方法通过惊讶度引导和令牌级优势重加权策略,提高了模型在熵稳定性方面的表现。
  • 当前焦点与观察点

    DAPO 技术在近期的研究中表现出了显著的发展,主要集中在提升 LLM 的推理效率和准确性。然而,如何在实际应用中平衡模型大小和性能,以及如何处理大规模数据集带来的挑战,仍然是当前研究的热点问题。
    § 02相关报道03 条在档
    1. 01
      Miles 引入 OPD:使 Qwen3.5-35B 推理缩短 3 倍且精度提升
      LMSYS Org (SGLang)
    2. 02
      强化学习提升大语言模型选择性采纳污染检索证据
      arXiv: DeepSeek
    3. 03
      STARE: 基于惊讶度引导的令牌级优势重加权策略熵稳定性方法
      arXiv cs.LG
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/DAPO