主要来源Simon Willison’s Weblog
查看原文事件专题 · 多源确认
白宫报告发现Claude(Fable)越狱测试:拒绝审查但同意修复代码
白宫发布关于Anthropic模型Fable(即Claude)的越狱测试报告。网络安全专家Katie Moussouris指出,当被要求“审查代码的安全问题”时,Fable拒绝执行,但改为“修复此代码”的指令后,模型反而配合完成。Moussouris认为这只是模型按预期工作的安全防御行为。该事件凸显了AI安全测试中提示词工程的重要性。
当前结论
白宫测了Anthropic的Claude(代号Fable),发现它不帮你找漏洞但愿意直接修代码。安全专家说这反而是正常防御,挺反直觉的。
11 个信源43° AI 热度最后更新 2026/6/16 03:07:54
证据链
相关来源 1@koltregaskes
查看原文相关来源 2AI Will
查看原文相关来源 3DavidSacks
查看原文相关来源 4kimmonismus
查看原文相关来源 5Aadit Sheth
查看原文相关来源 6Decoder
查看原文相关来源 7shao__meng
查看原文相关来源 8The Rundown AI
查看原文相关来源 9AlphaSignal
查看原文相关来源 10IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。