12:28官方账号arXiv cs.LG@Iliya Mirzaei该论文对七种自我反思方法进行对照实验,使用1.5B、3B和7B三种开源模型,在两个数学基准上各150道题。所有方法按实际生成token数对齐后,与重复采样取多数答案的基线比较,共36组配对检验。结果显示没有任何方法在相等成本下稳定优于重复采样,其中10组可靠更差,全部18组涉及模型自我检查的比较均为负面。Self-Refine和强制的Reflexion在7B模型上仍落后基线3.6至10.1个百分点,而最佳选择在1.5B时取多数答案比模型自选高8.0和11.3点,到7B时差距缩小至不显著。论文Self-RefineReflexion重复采样推荐理由:这篇论文把Self-Refine、Reflexion这些热门方法拉出来做了严格对比,发现相同token预算下自己反思不如多采样几次取多数,想省成本做推理的可以看看。原文稍后读已读值得跟进有用关注 Self-Refine