事件专题 ·单一信源

onPanda:用 token 级修正高效标注 LLM 与 Agent 的 on-policy 对齐数据

onPanda 是一篇关于对齐数据标注方法的研究,核心是通过 token 级修正(Token-Level Correction)来标注 on-policy 数据。方法面向 LLM 和 Agent 两类场景,替代了传统对完整生成结果做标注的方式。论文已发布在 Hugging Face Papers 上,编号 2609.24。

当前结论

一篇教你怎么标注 on-policy 对齐数据的论文,思路是在 token 层面做修正,LLM 和 Agent 都适用,做对齐训练的可以看看。

2 个信源58° AI 热度最后更新 2026/9/22 19:04:43

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。