主要来源IT之家
查看原文事件专题 · 多源确认
普林斯顿CEO-Bench测试:AI模拟CEO经营500天,Claude Fable 5居首
普林斯顿大学发布CEO-Bench基准测试,模拟创业公司500天经营,初始资金100万美元。多数模型在500天内破产,Claude Fable 5期末现金达4715万美元,是唯一多次运行均高于初始余额的模型。Claude Opus 4.8和GPT-5.5分别以2777万美元和2129万美元位列其后。Grok 4.20表现最差,平均仅维持28天。基于规则的基准模型期末现金为1580万美元。
当前结论
普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。
11 个信源64° AI 热度最后更新 2026/6/30 06:06:53
证据链
相关来源 1elvis
查看原文相关来源 2Anthropic
查看原文相关来源 3Jerry Liu
查看原文相关来源 4OpenRouter
查看原文相关来源 5GitHub
查看原文相关来源 6marktechpost
查看原文相关来源 7Notion
查看原文相关来源 8Marc Andreessen
查看原文相关来源 9歸藏(guizang.ai)
查看原文相关来源 10@koltregaskes
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。