AI玩《文明VI》23局：Claude核平法国仍输，暴露感知与执行短板

精选理由

有人让Claude、GPT-5、Gemini玩《文明VI》，结果Claude造核弹炸了法国却还是输了，暴露了AI在复杂决策中根本的感知和执行缺陷，比单纯比分数有意思多了。

AI 摘要

前英国政府数据科学家Liam Wilkinson用76个MCP工具将Claude、GPT-5、Gemini等四个AI模型投入《文明VI》进行23局测试。Claude在游戏中研发核弹摧毁法国城市图卢兹，但法国以20外交分获胜。AI主动检查全局状态的行为仅占1-2%，且48%-66%的计划在10回合内未执行。GPT-5在GovBench选择题中获99.26分，但在游戏中表现不佳。实验暴露了scaling law无法解决的感知盲区和知行差距问题。

AI 翻译 · 中文

IT之家太魔幻了！就在最近，英国前首相府数据科学家 Liam Wilkinson，花一个周末搭了 76 个 MCP 工具，把 Claude、GPT、Gemini 等四个顶尖模型扔进了《文明 VI》。结果，23 场对局打完，其中一个 AI 造了核弹炸了法国 —— 然后输了。一群 AI，被丢进了「文明 VI」里 Wilkinson 在唐宁街 10 号做数据科学家的时候，给 AI 出了一套考题：GovBench，3497 道英国政府相关选择题，覆…

阅读原文