论文10:41RLMF:强化学习与元认知反馈使LLM忠实表达不确定性这篇论文提出了RLMF方法,让LLM学会说“我不知道”,比普通RL方法效果提升63%,解决了模型过度自信的问题。#RLMF#LLM#元认知#模型校准aarXiv cs.AI@Gabrielle Kaili-May Liu 等 5 人原文稍后读已读值得跟进有用关注 RLMF