Anthropic发布Fable 5.1和Mythos 5.1,科研能力翻倍,缓存成本降75%,企业数据留存问题解决。
Anthropic今天发布Claude Fable 5.1和Mythos 5.1,两个模型性能显著提升。Fable 5.1在Terminal-Bench-Science 0.1测试中得分52.6%,较Fable 5的24.7%翻倍。缓存读取价格降低75%,企业客户数据留存争议得到解决。Mythos 5.1在蛋白质设计上结合亲和力比行业最佳提交高10倍。
Anthropic 今天发布了 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 系列上一代产品 Fable 5 发布还不到三个月。 Fable 5.1 和 My...
Anthropic 今天发布了 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 系列上一代产品 Fable 5 发布还不到三个月。 Fable 5.1 和 Mythos 5.1 是同一个模型,区别在于安全限制的松紧程度。Fable 5.1 面向所有人开放,Mythos 5.1 则只对经过审核的网络安全和生命科学研究人员开放,安全护栏更宽松。这和 Fable 5 与 Mythos 5 的关系一样。 对大多数用户来说,这次发布有三件事值得关注:性能提升、价格下降,以及困扰企业客户两个多月的数据留存争议终于有了解法。 【1】性能:在科学研究基准上翻倍 Fable 5.1 在多个基准测试中的表现都明显优于 Fable 5。几个关键数字:在 Terminal-Bench-Science 0.1 这个衡量 AI 自主科研能力的测试上,Fable 5.1 得分 52.6%,Fable 5 只有 24.7%,直接翻了一倍多。在 Terminal-Bench 4.0 的编程任务上,Fable 5.1 拿到 55.8%(Mythos 5.1 版本达到 60.9%),超过了 Opus 5 的 52.3%。在衡量自动化业务流程能力的 AutomationBench 上,Fable 5.1 从 Fable 5 的 17.1% 跳到了 31.4%。 这些不只是跑分好看。Anthropic 提到的一个实际案例是:投资公司 Millennium 用 Fable 5.1 找到了内部系统一个罕见崩溃的根因,这个问题困扰了他们的工程师好几年,其他模型也没能解决。量化交易公司 Jane Street 也给出了背书,称 Fable 5.1 在长任务中保持可读性方面明显好于前代。 Fable 5.1 支持从 low 到 max 五个 effort level 档位,低档位下的表现已经和 Fable 5 高档位相当,但成本低得多。换句话说,你不一定需要开到最大马力才能拿到好结果。 【2】降价:缓存读取便宜了 75% Fable 5.1 的输入和输出单价不变,仍然是每百万 Token 输入 10 美元、输出 50 美元。但缓存读取(Cache Read)的价格从每百万 Token 1 美元降到了 0.25 美元,降幅 75%。 这听起来像是小事,但做过 AI 应用开发的人知道,在实际使用中,尤其是需要反复引用大段上下文的 Agent 场景下,缓存读取占了总成本的大头。Anthropic 用八月份的真实使用数据算了笔账:一般工作负载下总成本降低约 25%,高度 Agent 化的工作负载(比如 Claude Code 跑长任务)降幅可达 45%。 这个定价调整的背景是:Fable 5 的单价本身就是 Opus 4.8 的两倍,而支付平台 Ramp 的数据显示,Fable 5 发布两个多月后,只占企业客户 AI 工具总支出的约 11%,反倒是更便宜的 Opus 5 在企业端花费上超过了它。降低缓存读取价格,等于把 Agent 场景的实际账单拉下来,让 Fable 系列对成本敏感的企业用户更有吸引力。 【3】数据留存:企业客户最关心的问题 Fable 5 发布时最大的争议是 Anthropic 强制要求所有 Mythos 级模型的使用数据保留 30 天。对于之前享受零数据留存(ZDR)协议的企业客户来说,这等于一夜之间把隐私保障降了一级,尤其是金融、医疗、政府等对数据合规要求严格的行业。 OpenAI 两周前刚利用这一点发起攻势,宣布了自己的 Private Safety Processing 方案,承诺即使用最强模型也能保持零数据留存。 Anthropic 的回应是 Enterprise Frontier Safeguards(EFS)。EFS 的核心思路是:数据存储在客户自己控制的云基础设施上,而非 Anthropic 的系统中;任何人工审核默认也由客户自己完成。Anthropic 说他们和 100 多家客户合作开发了这套方案,涵盖金融、医疗、制造、法律等行业。 EFS 今年秋天开始分阶段上线,在此之前,符合条件的客户可以用零数据留存的方式使用 Fable 5.1。 Bloomberg 此前报道过 Anthropic 正在开发这样一套系统,今天算是正式落地。对企业用户来说,这解决了一个实际的采购障碍。 【4】科研能力展示:金星地图和蛋白质设计 这次发布还有科研能力的演示。 Fable 5.1 用 NASA 麦哲伦任务 30 多年前拍摄的雷达图像,训练了一个神经网络,为金星三分之一的表面生成了新的高分辨率地形图。原来的地形数据精度只有 10 到 20 公里,新地图能看到 2 到 3 公里的细节,高度精度也比以前高了最多 25%。Anthropic 已经把这份地图以 Creative Commons 协议公开发布,说希望对 NASA 即将执行的 VERITAS 任务和 ESA 的 EnVision 任务有用。 在生物学方向,Mythos 5.1 展示了药物发现的早期能力。给模型配上开源的蛋白质设计和折叠工具后,它设计出的高亲和力结合物在三个靶点上的结合亲和力比 Adaptyv Bio 蛋白质设计竞赛的最佳提交高出 10 倍,成功率接近 50%,而行业一般水平是 10% 到 15%。 另一个演示是计算生物学:Mythos 5.1 通过编写自定义 GPU 核心和缓存中间结果,把七个开源深度学习模型的推理速度提升了 1.4 到 2.5 倍。做一次全基因组分析的 GPU 成本因此降低了 30% 到 60%。Anthropic 说这类优化通常需要一个性能工程团队花几周时间,学术实验室根本做不起,Mythos 5.1 用公开源代码几天就搞定了。 这些演示当然带有 Anthropic 的叙事目的,但蛋白质设计的结果经过了外部实验验证,金星地图也是公开可下载的,不是空口说说。 【5】其他变化 安全护栏方面,Fable 5.1 的误报率有所降低。网络安全相关的误触发减少了 60%,用 Claude Code 的开发者应该能感受到被安全限制打断的次数变少了。Fable 5.1 现在允许发现软件漏洞(但不能生成漏洞利用代码),这对做防御性安全工作的人是个好消息。 Anthropic 还加入了反蒸馏机制。从今天起新注册的 API 账号不能再在多轮对话中手动编辑 Claude 的先前上下文同时保留思考链记录。这是针对大规模模型蒸馏(Distillation,即用一个强模型的输出来训练另一个模型)的防御措施,堵住了一个已知的公开蒸馏技巧。 另外,由于 Anthropic 在今年七月签署了欧盟 AI 法案的透明度实践准则,Fable 5.1 作为 8 月 2 日之后发布的模型,输出文本中内置了不可见的水印。这个水印对使用体验没有影响,检测 API 目前只对欧盟法律要求的组织(监管机构、媒体、事实核查机构等)开放。 Fable 5.1 今天起在所有平台可用,API 标识符为 claude-fable-5-1,AWS、Google Cloud、Azure 也同步上线。Mythos 5.1 目前仅限美国组织申请,Anthropic 说正在和美国政府协调扩大访问范围。 Claude @claudeai We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowledge work. Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 6 👀 1329 📊 1 ⚡