17:19官方一手arXiv: DeepSeek@Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang精选73°研究人员通过两个经济游戏和认知计算模型,测试了DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash共2099个LLM代理的心智化能力。结果显示,不同模型提供商和大小的LLM表现出明显不同的心智化行为和计算特征。GPT-5代理能够灵活调整其递归推理深度,表现优于251名人类参与者。论文GPT-5DeepSeekGemini 2.0推荐理由:这篇论文用经济游戏测试了四大模型家族的心智化能力,发现GPT-5能灵活调整推理深度,表现超过人类。原文稍后读已读值得跟进有用关注 GPT-5