主要来源Simon Willison
查看原文事件专题 · 多源确认
Anthropic 为 Fable 5 增加可见安全护栏,误报增多
Anthropic 宣布对 Fable 5 模型的安全机制进行改进,使被标记的请求会回退到 Opus 4.8,并在 API 中返回拒绝原因。此前采用不可见安全机制是为了快速部署并减少误报,但 Anthropic 承认这是错误权衡,用户应能看到安全措施。可见安全措施更容易被绕过,因此短期内误报会增加,团队正在优化分类器以减少对无害请求的误判。用户可通过反馈渠道报告误判,帮助改进分类器。
当前结论
Anthropic 终于让安全机制透明化,做 AI 应用开发的团队能直接看到请求被拒原因,减少黑盒调试成本。建议 API 用户关注误报率变化并及时反馈。
11 个信源72° AI 热度最后更新 2026/6/11 07:42:26
证据链
相关来源 1歸藏(guizang.ai)
查看原文相关来源 2Notion
查看原文相关来源 3Claude Code: GitHub Releases
查看原文相关来源 4lmarena.ai
查看原文相关来源 5orange.ai
查看原文相关来源 6Genspark
查看原文相关来源 7AI Will
查看原文相关来源 8Latent.Space
查看原文相关来源 9宝玉
查看原文相关来源 10rohanpaul_ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。