10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin PeloquinFriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。论文FriendBench多模态LLM推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。原文稍后读已读值得跟进有用关注 FriendBench