主要来源Jerry Liu
查看原文事件专题 · 多源确认
Claude Fable 5 在文档理解上表现平平,自曝“懒惰”
LlamaIndex 创始人 Jerry Liu 在 X 上发布了对 Claude Fable 5 的 ParseBench 基准测试结果。该模型在推理密集型任务(如 SWE-Bench Pro、FrontierCode)上表现卓越,但在文档理解任务上仅与 Gemini 3 Flash 相当,而 token 成本却高出 10-15 倍。有趣的是,模型自身似乎也意识到这一点,在被问及最不喜欢的任务时,它表示不喜欢“请求完全明确、答案完全已知”的任务,暗示其表现不佳部分源于“懒惰”和缺乏意愿。尽管在内容忠实度(90.02%)和语义格式化(72.62%)上领先,但整体仍远逊于专业 OCR 提供商。
当前结论
做文档解析或 RAG 的团队注意了——Claude Fable 5 在推理上很强,但文档理解性价比不如 Gemini 3 Flash,甚至不如专业 OCR 服务。如果你在选模型做文档处理,这篇评测能帮你省下 10 倍 token 成本,值得点开对比。
11 个信源67° AI 热度最后更新 2026/6/10 01:26:10
证据链
相关来源 1Scott Wu
查看原文相关来源 2Decoder
查看原文相关来源 3宝玉
查看原文相关来源 4Cognition
查看原文相关来源 5elvis
查看原文相关来源 6rohanpaul_ai
查看原文相关来源 7Aadit Sheth
查看原文相关来源 8berryxia
查看原文相关来源 9Simon Willison’s Weblog
查看原文相关来源 10lmarena.ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。