12:11官方账号arXiv cs.AI@Baihui Wang, Bernard Koch该论文研究了大型语言模型(LLM)在道德推理中如何区分合理修正与谄媚顺从。通过三项研究,作者发现模型的判断更新沿着三个维度结构化:观点与模型初始立场的距离、该观点的来源归属(如来自模型自身先前判断的影响更大)、以及支持该观点的联盟结构。模型更易接受邻近立场,对看似自身先前判断的观点更敏感,对群体压力的反应存在差异。这些发现将谄媚重新定义为更广泛的判断更新过程的一部分,为区分建设性信念修正与谄媚顺从提供了基础。论文LLM道德推理对齐推荐理由:想搞懂LLM到底是真学习还是假顺从?这篇论文给出了三个具体维度来分析模型修正判断的逻辑,比简单说‘阿谀奉承’有深度多了。原文稍后读已读值得跟进有用关注 LLM