主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
自我进化 LLM 系统何时该停:arXiv 论文提出即插即用停止准则
一篇 arXiv 论文研究自我进化 LLM 系统的停止时机与输出选择问题。作者把停止判定建模为在线序贯检验,用每次迭代已产生的逐项配对评估结果构建 anytime-valid 重启检测器,再用变点估计从历史候选中选一个更早的产物输出。该方案即插即用,无需修改底层自我进化算法。在 2 个自我进化框架、3 个 LLM 模型家族、5 个基准上的实验显示,SearchQA 上 SkillOpt 与 DeepSeek V4 Flash 组合在第 4 轮即停止(原预算 40 轮),token 用量减少 91.6%,未见测试集准确率 82.43% 对比跑满预算的 82.00%。
当前结论
做自我进化 agent 的可以看看:不用改算法,套个统计检验就能让系统自己判断什么时候停止迭代,省 91.6% 的 token 还不掉点。
3 个信源39° AI 热度最后更新 2026/10/3 20:47:53
证据链
3 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。