AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

心智理论

共 3 条相关 AI 资讯
8月11日
10:25
10:25官方账号arXiv cs.AI@Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen
Avalon-ToM-Bench 将心智理论拆分为 2×2 分类法,涵盖认知与动机推理、推断与行动。对 28 个大语言模型的测试显示,模型对游戏规则理解良好,但心智理论能力明显偏弱。线性探测从隐藏状态恢复心智判断的准确率达 77-82%,高于模型自身思维链的 62-70%。专门的推理训练平均带来 +11.0 分提升,而测试时思维链仅 +1.1 分。
论文Avalon-ToM-Bench心智理论大语言模型

推荐理由:想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。
原文
6月16日
11:37
11:37官方账号arXiv cs.AI@Nikolos Gurney
该论文构建了一个结构因果模型(DAG),将心智理论视为由情境与主体条件激活的机制,而非始终开启的能力。模型包含四个外生变量(如冲突强度、信息可及性)和五个内生中介变量,通过可处理性路径、推理深度路径和使能原因路径三种机制决定心智理论的参与状态。主要输出变量是认知准确性,该框架为AI系统提供了资源理性的心智化决策流程。论文还通过仿真验证和人类-智能体团队实验评估了模型的有效性,并讨论了冲突优化心智化引发的伦理问题。
论文心智理论因果模型冲突场景

推荐理由:这篇论文给AI装了个'读心开关'——只在冲突场景下按需启动心智推理,既省算力又提升准确性,值得做AI安全和多智能体的人看看。
原文
5月19日
11:33
11:33官方账号arXiv cs.AI@Yajing Zhou, Xiangyu Kong
精选
该论文揭示了多模态大语言模型(MLLM)在空间推理中存在的“笛卡尔幻觉”——依赖文本概率分布而缺乏真正的3D拓扑理解。作者设计了一个新颖的视听任务:让智能体A推断智能体B对A相对位置的估计,以测试MLLM的二阶心智理论能力。为解决此问题,他们提出了“锚定具身空间分解思维链”,引导模型先建立B的局部坐标系,再根据A是否在B视野内动态加权视觉和听觉模态。实验表明,当前MLLM在零样本下准确率仅42%,而该感知受限推理链显著优于纯自我中心或他中心基线。这项工作暴露了MLLM空间推理的当前极限,并为具身AI中的认知模态感知推理建立了基础范式。
论文多模态大模型空间推理心智理论

推荐理由:这篇论文戳破了MLLM空间推理的泡沫——它们并不真正理解3D世界。做具身AI、多智能体系统或空间推理的开发者,看完会重新评估模型能力边界。
原文
精选全部日报登录