论文10:25Avalon-ToM-Bench:用非对称游戏机制评估细粒度心智理论想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。#Avalon-ToM-Bench#心智理论#大语言模型#推理模型aarXiv cs.AI@Yen-Shan Chen 等 5 人原文稍后读已读值得跟进有用关注 Avalon-ToM-Bench
论文11:37面向人工智能冲突场景的心智理论因果模型这篇论文给AI装了个'读心开关'——只在冲突场景下按需启动心智推理,既省算力又提升准确性,值得做AI安全和多智能体的人看看。#心智理论#因果模型#冲突场景#AI安全aarXiv cs.AI@Nikolos Gurney原文稍后读已读值得跟进有用关注 心智理论
论文精选11:33MLLM空间推理的“笛卡尔幻觉”:两阶段多模态心智理论测试这篇论文戳破了MLLM空间推理的泡沫——它们并不真正理解3D世界。做具身AI、多智能体系统或空间推理的开发者,看完会重新评估模型能力边界。#多模态大模型#空间推理#心智理论#具身AIaarXiv cs.AI@Yajing Zhou, Xiangyu Kong原文稍后读已读值得跟进有用关注 多模态大模型