这条吐槽戳中了 AI 模型发布「先上线再修 bug」的行业潜规则,如果你是重度使用 Claude 的开发者或团队,看完会明白为什么同一模型前后体验差异巨大——建议点开了解背后的不公平逻辑。
开发者 yetone 指出,Anthropic 在推出新模型 Opus 4.8 时未经过充分内部测试,导致推理基础设施出现各种 bug,包括 edit tool 调用时 old_string 参数传错等降智行为。模型发布后,用户成为众包测试员,反馈真实问题后 Anthropic 偷偷修复了这些 bug,舆论随之回暖。这导致早期吐槽模型的用户被嘲笑,而后期用户评价截然不同。问题核心在于如何低成本发现 bug,而非修复本身。
哪怕是这种大公司 测试都是直接发布了让用户帮忙众包测试反馈了…. 改起来不成问题 问题变成了如何低成本发现😂
哪怕是这种大公司 测试都是直接发布了让用户帮忙众包测试反馈了…. 改起来不成问题 问题变成了如何低成本发现😂 yetone @yetone 但是这个应该不能去把责任归到用户身上,而必须是归到 Anthropic 身上。因为新的模型刚推出的时候,它内部没经过大量的测试,导致 Inference Infra 出现各种 bug,导致各种降智行为,甚至这一次 Opus 4.8 对 edit tool 调用的 old_string 参数都会传错。推出之后,当把用户当成小白鼠测试过一段时间之后,他们收集到这些真实的用户的血与泪换来的 feedback 后,偷偷把这个模型的 Inference Infra bug 修完,然后舆论回暖,导致大家嘲笑刚开始吐槽这个模型的人,这个很不公平的。 比如前天 opus 4.8 就偷偷修好了我上面提到的 edit tool 调用的时候 old_string 都传错的弱智问题,你看,从昨天开始使用 opus 4.8 的人,跟刚开始就使用 opus 4.8 的人对其评价就完全不一样。 🔗 View Quoted Tweet 💬 3 🔄 0 ❤️ 1 👀 1333 📊 2 ⚡