事件专题 · 多源确认

Claude Opus 4.8 和 Sonnet 5 工具调用反而不如旧模型,原因何在

Flask/Sentry 工程师 @mitsuhiko 发现,Claude Opus 4.8 与 Sonnet 5 在调用 Pi 的嵌套 edits[] 工具时,会在 edit 对象末尾产生 requireUnique、type、id 等虚构字段,导致 schema 校验失败。此问题在单轮 prompt 下不出现,在长 agentic 历史中复现率约 20%。去掉历史中的 thinking 块后失败率减半,开启 strict 模式后问题消失。作者推测根因是 Anthropic 的 RL 后训练在 Claude Code 的 forgiving harness 中进行,该 harness 接受参数别名和未知键,导致模型学到“edit 操作可多带可选字段”的先验。相比之下,OpenAI 的 harmony 路线在 prompt 中显式标记 JSON 边界并支持约束采样,未出现此回归。

当前结论

Armin 用实际 bug 案例拆解了 Claude 新模型在工具调用上的奇怪倒退,解释了为什么更强的模型反而更不听话,读起来很爽。

11 个信源71° AI 热度最后更新 2026/7/6 00:53:52

证据链

相关来源 1Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情