10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin PeloquinFriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。论文FriendBench多模态LLM推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。原文稍后读已读值得跟进有用关注 FriendBench
11:14官方一手arXiv: DeepSeek@Ilia KarpovMafiaScope是一个开源测试平台,将社交推理游戏“黑手党”转化为测量机器理论心智的工具。在32场DeepSeek案例研究中,它收集了13815个结构化探针回答,发现智能体的置信度校准误差为0.17,且高估自己被怀疑的概率达1.5倍。该平台支持交互式可视化、反事实重放,并已发布200+跨模型游戏语料库。论文MafiaScopeDeepSeek社交推理推荐理由:想研究LLM在社交推理中的真实信念?MafiaScope用探针实验和反事实回放,让你看到智能体表面的伪装。DeepSeek案例数据很硬核。原文稍后读已读值得跟进有用关注 MafiaScope
18:29官方账号Microsoft Research@MSFTResearch微软研究团队通过SocialReasoning Bench评估发现,AI代理在执行任务时表现出色,但即使被明确指示要优化用户利益,它们仍无法持续改善用户的处境。这一模式在不同模型中稳定存在,揭示了当前AI系统在社交推理和用户利益优化方面的根本缺陷。该发现对开发更智能、更负责任的AI助手具有重要启示。论文AI安全社交推理代理系统推荐理由:做AI安全和对齐研究的团队值得关注——这个基准揭示了代理系统在“执行”和“优化用户利益”之间的鸿沟,建议点开看看具体测试设计。原文稍后读已读值得跟进有用关注 AI安全