10:18官方账号arXiv cs.AI@Toby D. Pilditcharxiv 论文提出 optstop 框架,将大模型评测视为序贯测量问题,只对不确定性高的样本继续采样。该框架基于分层贝叶斯推断,支持二值、有序和连续结果,无需校准题库。在 200 项、10 轮次的示例评测中,optstop 在九种验证设置下减少了 57% 到 97% 的计划试验,整体结论与完整评测一致。研究表明评测算力可按不确定性分配,而非固定重复次数。论文optstop贝叶斯推断LLM评测推荐理由:跑大模型评测总烧钱?这个框架能省下最多97%的采样次数,结论还一样,做评测的人值得看看。原文稍后读已读值得跟进有用关注 optstop