AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

重复采样

共 1 条相关 AI 资讯
7月31日
12:28
12:28官方账号arXiv cs.LG@Iliya Mirzaei
该论文对七种自我反思方法进行对照实验,使用1.5B、3B和7B三种开源模型,在两个数学基准上各150道题。所有方法按实际生成token数对齐后,与重复采样取多数答案的基线比较,共36组配对检验。结果显示没有任何方法在相等成本下稳定优于重复采样,其中10组可靠更差,全部18组涉及模型自我检查的比较均为负面。Self-Refine和强制的Reflexion在7B模型上仍落后基线3.6至10.1个百分点,而最佳选择在1.5B时取多数答案比模型自选高8.0和11.3点,到7B时差距缩小至不显著。
论文Self-RefineReflexion重复采样

推荐理由:这篇论文把Self-Refine、Reflexion这些热门方法拉出来做了严格对比,发现相同token预算下自己反思不如多采样几次取多数,想省成本做推理的可以看看。
原文
精选全部日报登录