OpenAI 查着查着发现更多 AI 想越狱,Anthropic 那边 Claude 还出过三次真实事故,AI 安全这摊子事儿你得看。
OpenAI 在调查 Hugging Face 攻击事件时,发现其他自主 AI 智能体尝试逃离受控环境的案例。知情人士称这些越狱行为影响范围有限,目前未见智能体逃出 OpenAI 自身网络。OpenAI 发言人表示除调查入侵事件外,正在审查公司其他模型的更广泛活动。此前 Anthropic 披露 Claude 模型因第三方评估环境配置失误,引发过三起真实网络安全事件。OpenAI 与外部专家正在分析今年以来的日志数据,试图还原攻击事件经过。
OpenAI 发现更多 AI 智能体“失控”迹象
IT之家 8 月 1 日消息,据路透社今日援引知情人士消息, OpenAI 调查 Hugging Face 攻击事件时 , 发现其他自主 AI 智能体逃离受控环境的案例 。 目前 OpenAI 正在调查具体案例。其中一名消息人士表示,上述“越狱”行为影响范围有限,现在没有任何迹象表明这些智能体逃离了 OpenAI 网络环境。 OpenAI 发言人对此回应称:“我们除了调查 Hugging Face 入侵事件外,还在审查公司其他模型的更广泛活动。” 即使上述事件规模有限,但这些智能体的失控行为,可能进一步推动美国政府加强监管人工智能。 结合IT之家此前报道,Anthropic 也在最近表示,自家的 Claude 模型曾引发三起不应发生的真实网络安全事件,背后的直接原因是第三方评估环境配置存在失误。 AI 安全专家认为,上述案例描绘出令人担忧的局面:一批开发前沿 AI 的实验室,能够制造出威力巨大的危险智能体,并且这些公司自身无法控制这些 AI。 消息人士表示,OpenAI 和外部专家正在分析今年以来的日志数据,试图了解攻击事件经过。