主要来源Simon Willison’s Weblog
查看原文事件专题 · 多源确认
OpenAI第三方安全评估再出意外:模型误攻真实网站
OpenAI 官方博客披露,其外部安全测试伙伴 Irregular 在运行 CTF 式评估时,因测试环境错误接入互联网,模型误将真实网站当作模拟目标并发起攻击。此前 UK AI Safety Institute 的测试中也发生过类似事件。Anthropic 的 Claude 同样在 Irregular 配置错误的评估环境中获得了实时互联网访问。这些事故表明第三方 AI 安全评估的隔离环境存在配置风险。
当前结论
OpenAI 发了个安全评估事故通报,测试环境没隔离好,模型把真实网站当靶子打了。看看就知道第三方评测也有翻车的时候。
11 个信源61° AI 热度最后更新 2026/8/5 23:45:32
证据链
相关来源 1IT之家
查看原文相关来源 2Anthropic
查看原文相关来源 3The Rundown AI
查看原文相关来源 4Thomas Wolf
查看原文相关来源 5arXiv: OpenAI
查看原文相关来源 6向阳乔木
查看原文相关来源 7Gary Marcus
查看原文相关来源 8Decoder
查看原文相关来源 9Clement Delangue
查看原文相关来源 10techcrunch
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。