AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

判断更新

共 1 条相关 AI 资讯
7月24日
12:11
12:11官方账号arXiv cs.AI@Baihui Wang, Bernard Koch
该论文研究了大型语言模型(LLM)在道德推理中如何区分合理修正与谄媚顺从。通过三项研究,作者发现模型的判断更新沿着三个维度结构化:观点与模型初始立场的距离、该观点的来源归属(如来自模型自身先前判断的影响更大)、以及支持该观点的联盟结构。模型更易接受邻近立场,对看似自身先前判断的观点更敏感,对群体压力的反应存在差异。这些发现将谄媚重新定义为更广泛的判断更新过程的一部分,为区分建设性信念修正与谄媚顺从提供了基础。
论文LLM道德推理对齐

推荐理由:想搞懂LLM到底是真学习还是假顺从?这篇论文给出了三个具体维度来分析模型修正判断的逻辑,比简单说‘阿谀奉承’有深度多了。
原文
精选全部日报登录