主要来源Clement Delangue
查看原文事件专题 · 多源确认
AA-Briefcase基准测试:Claude Fable 5领先但任务成本$31,DeepSeek V4 Flash仅$0.04
AA-Briefcase基准测试评估模型在长期知识工作项目中的表现,任务成本差异达800倍。Claude Fable 5以1587 Elo领先,但平均任务成本31美元;Claude Opus 4.8得分1356,成本10.40美元。DeepSeek V4 Flash仅需约0.04美元,性价比最高。GLM-5.2得分1266,成本2.40美元,得分仅低Claude Opus 4.8不到90 Elo,成本不到其25%。
当前结论
新基准AA-Briefcase测长期项目,Claude Fable 5最强但贵,DeepSeek V4 Flash极便宜,GLM-5.2性价比超赞。
11 个信源66° AI 热度最后更新 2026/6/19 00:35:19
证据链
相关来源 1IT之家
查看原文相关来源 2lmarena.ai
查看原文相关来源 3Pandaily
查看原文相关来源 4shao__meng
查看原文相关来源 5@atomic_chat_hq
查看原文相关来源 6@koltregaskes
查看原文相关来源 7Epoch AI
查看原文相关来源 8Together AI
查看原文相关来源 9Aadit Sheth
查看原文相关来源 10Andrew Ng
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。