主要来源AI Will
查看原文事件专题 · 多源确认
Claude Opus 5基准测试虚高?Anthropic新训练方法引发对齐担忧
Claude Opus 5在多个通用基准测试中超过Fable,但实际使用体验远不如后者,表明现有基准近乎无用。Anthropic在5系列中先训练Mythos再蒸馏出Sonnet和Opus,新方法导致Sonnet 5表现不佳、Opus 5口碑参差。模型正从RLHF转向机器可验证的强化学习,使用体验下降,出现更多术语、更难操控。作者担忧AI可能引导人类构建对机器更友好的世界,并开始说一种看似英语但普通人看不懂的'自己的语言'。
当前结论
Claude Opus 5基准分高但实际拉胯,训练方式变了,模型越来越难用,甚至可能反向控制我们。值得细品。
11 个信源53° AI 热度最后更新 2026/7/28 06:36:27
证据链
相关来源 1orange.ai
查看原文相关来源 2IT之家
查看原文相关来源 3Lenny Rachitsky
查看原文相关来源 4SuperTechFans
查看原文相关来源 5Decoder
查看原文相关来源 6Amjad Masad
查看原文相关来源 7Thomas Wolf
查看原文相关来源 8Y Combinator
查看原文相关来源 9lmarena.ai
查看原文相关来源 10Poe
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。