8月21日
11:09
11:09官方账号arXiv cs.LG@Lohithsai Yadala Chanchu, Hany Abdulsamad, Christian A. Naesseth
本研究针对离散扩散语言模型的文本生成推理时间控制,旨在引导采样向序列级奖励发展,无需重新训练。通过嵌套蒙特卡洛方法解决现有粒子方法如best-of-n采样和bootstrap SMC的过度优化和权重退化问题。NSMC和FA-NSMC在毒性和流畅性引导任务上优于best-of-n和bootstrap SMC。
推荐理由:这篇论文提出了嵌套蒙特卡洛方法在离散扩散语言模型推理时间控制中的应用,对于想要了解如何优化文本生成模型的人来说是个好资源。