主要来源rohanpaul_ai
查看原文事件专题 ·多源确认
长期AI决策能力研究:模型表现远低于人类
研究测试了八款领先模型,包括GPT-5.6 Sol和Claude Opus 4.8。最佳配置Qwen3.7-Max搭配Hermes仅达到人类平均表现的27.3%。在需要一年期互联决策和延迟反馈的任务中,AI系统表现远低于人类。
当前结论
最新研究揭示,即使是顶尖AI模型在长期复杂任务中也仅达人类四分之一表现。
3 个信源83° AI 热度最后更新 2026/10/2 02:16:07
证据链
3 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。