论文精选09:51ParliamentBench:新基准评估LLM欺骗与推理能力新基准用《秘密希特勒》测AI说谎,16个模型里GPT-5.4、Kimi K2.5领先。#ParliamentBench#GPT-5.4#DeepSeek 3.1 Terminus#AI安全aarXiv: DeepSeek@Niklas Bauer 等 6 人原文稍后读已读值得跟进有用关注 ParliamentBench