论文10:25Avalon-ToM-Bench:用非对称游戏机制评估细粒度心智理论想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。#Avalon-ToM-Bench#心智理论#大语言模型#推理模型aarXiv cs.AI@Yen-Shan Chen 等 5 人原文稍后读已读值得跟进有用关注 Avalon-ToM-Bench