8月28日
17:19
17:19官方一手arXiv: DeepSeek@Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang
精选73°
研究人员通过两个经济游戏和认知计算模型,测试了DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash共2099个LLM代理的心智化能力。结果显示,不同模型提供商和大小的LLM表现出明显不同的心智化行为和计算特征。GPT-5代理能够灵活调整其递归推理深度,表现优于251名人类参与者。
推荐理由:这篇论文用经济游戏测试了四大模型家族的心智化能力,发现GPT-5能灵活调整推理深度,表现超过人类。