AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DeepSeek 3.1 Terminus

共 1 条相关 AI 资讯
7月31日
09:51
09:51官方一手arXiv: DeepSeek@Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas
精选
ParliamentBench 是基于桌游《秘密希特勒》的开源评估框架,用于测试大模型在信息不对称下的欺骗、说服与推理能力。研究对16个LLM进行了1600场模拟对局,并与人类玩家及在线游戏数据对比。排名前四的模型为 GPT-5.4、Kimi K2.5、Grok 4.1 Fast 和 DeepSeek 3.1 Terminus,而最弱模型的表现低于随机基线33%和算法基线45%。研究还引入了三项新指标,分别衡量社交推理、推理能力和欺骗一致性。多数模型难以维持一致的欺骗人格,欺骗保持率低于50%。
论文ParliamentBenchGPT-5.4DeepSeek 3.1 Terminus

推荐理由:新基准用《秘密希特勒》测AI说谎,16个模型里GPT-5.4、Kimi K2.5领先。
原文
精选全部日报登录