事件专题 ·多源确认

长期AI决策能力研究:模型表现远低于人类

研究测试了八款领先模型,包括GPT-5.6 Sol和Claude Opus 4.8。最佳配置Qwen3.7-Max搭配Hermes仅达到人类平均表现的27.3%。在需要一年期互联决策和延迟反馈的任务中,AI系统表现远低于人类。

当前结论

最新研究揭示,即使是顶尖AI模型在长期复杂任务中也仅达人类四分之一表现。

3 个信源83° AI 热度最后更新 2026/10/2 02:16:07

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。