主要来源orange.ai
查看原文事件专题 · 多源确认
Opus 5 基准胜 Fable 5 但实际体验差,Kun Chen 批评指标和训练方法
Kun Chen 指出 Opus 5 在多项公开基准上超越 Fable 5,但在实际使用中远不如 Fable 5,认为现有基准已几乎无用。他信任基于私有数据集的领域特定评估。他还透露 Anthropic 在 5 系列中先训练 Mythos 再蒸馏到 Sonnet 和 Opus,导致 Sonnet 5 失败、Opus 5 评价混杂。Chen 表示 Claude 系列使用体验变差,Grok 和 Kimi 目前在“愉悦感”维度上更优。
当前结论
这条推文直指 Opus 5 和 Fable 5 的基准与体验反差,还爆出 Anthropic 新的蒸馏训练路径,以及 RLHF 被弱化导致的体验变化,值得看看。
11 个信源67° AI 热度最后更新 2026/7/26 22:05:17
证据链
相关来源 1Simon Willison’s Weblog
查看原文相关来源 2SuperTechFans
查看原文相关来源 3Decoder
查看原文相关来源 4Perplexity
查看原文相关来源 5IT之家
查看原文相关来源 6Genspark
查看原文相关来源 7shao__meng
查看原文相关来源 8Latent Space (swyx)
查看原文相关来源 9歸藏(guizang.ai)
查看原文相关来源 10AI 热点 · 原创
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。