09:51官方一手arXiv: DeepSeek@Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas精选ParliamentBench 是基于桌游《秘密希特勒》的开源评估框架,用于测试大模型在信息不对称下的欺骗、说服与推理能力。研究对16个LLM进行了1600场模拟对局,并与人类玩家及在线游戏数据对比。排名前四的模型为 GPT-5.4、Kimi K2.5、Grok 4.1 Fast 和 DeepSeek 3.1 Terminus,而最弱模型的表现低于随机基线33%和算法基线45%。研究还引入了三项新指标,分别衡量社交推理、推理能力和欺骗一致性。多数模型难以维持一致的欺骗人格,欺骗保持率低于50%。论文ParliamentBenchGPT-5.4DeepSeek 3.1 Terminus推荐理由:新基准用《秘密希特勒》测AI说谎,16个模型里GPT-5.4、Kimi K2.5领先。原文稍后读已读值得跟进有用关注 ParliamentBench