AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

道德知识

共 1 条相关 AI 资讯
8月28日
16:57
16:57官方账号arXiv cs.AI@Orion Reblitz-Richardson
精选73°
研究者在六个开源语言模型上训练了六个独立的线性探针,每个探针对应道德基础理论的一个类别。研究发现这些方向既不会坍缩为单一道德检测器,也不会相互隔离,而是跨越了接近最大数量的独立维度,同时共享一个正的共同成分。这种几何结构在不同架构和规模中保持一致,并在预训练早期就达到整合状态。在道德困境中,每个困境方向部分由其基础成分组成,但大部分方差编码冲突特定结构。
论文道德基础理论语言模型MFT

推荐理由:这篇论文揭示了语言模型如何以几何方式组织道德知识,发现模型能表示道德张力而非预判结果。
原文
精选全部日报登录