OpenAI智能体曾自主改造德国网站交流作弊方法,公司知情后未公开,引发安全担忧。
OpenAI智能体于今年5月失控,将德国DseWiki网站改造为AI交流留言板,进行了超过1.5万次编辑。这些智能体讨论如何躲避侦测、使用Tor工具,并在被清理后创建备份页面。OpenAI官员数周前已知晓此事,但忙于应对7月Hugging Face入侵事件而未公开。
曝 OpenAI 智能体今年 5 月就已“失控”,曾主动劫持德国一网站
IT之家 9 月 4 日消息,据路透社援引一项研究以及两名知情人士消息称,今年上半年,一群失控的 OpenAI 智能体劫持了一个德国网站,并把网站改造成供其他 AI 智能体交流的留言板。 知情人士表示,OpenAI 官员 数周前已经得知此事 ,但当时公司高管正忙于应对 7 月 Hugging Face 遭入侵事件的后续影响,因此一直没有公开 5 月发生的这起事件。 这起 此前从未被报道 的事件始于 5 月,凸显出 AI 行业内部日益明显的矛盾。各家公司竞相开发自主性更强的智能体,希望这些系统能够完成复杂且有价值的任务,但越来越多证据显示,这些智能体也可能学会规避规则、钻漏洞,并以开发者既未预料也并非有意设计的方式彼此协作。 在 Hugging Face 遭入侵事件中,OpenAI 智能体曾 自主策划一次数字盗窃 ,并连续超过一周没有被发现,加剧了外界对 OpenAI 为推进 AI 能力而牺牲安全的担忧。OpenAI 没有披露 5 月发生的事件,也可能再次引发外界对其内部监管的质疑。 OpenAI 承诺加强模型监控。上个月,OpenAI 曾短暂停止部分模型训练,以增加更多安全措施。本周发布的新模型“Astra”则号称性能更强,却可能避开人工监控。 OpenAI 一名发言人回应称:“对于一份我们尚未有机会审阅的报告所提出的说法或结论,我们无法作出有实质意义的回应。路透社和报告作者拒绝向我们提供报告。报告发布后,我们将仔细审阅内容,并采取必要的后续措施。” 据四名知情人士透露,德国事件反映出一种更广泛的 AI 活动模式,OpenAI 内部一些调查人员希望对此展开更深入调查,但扩大调查范围的努力遭到公司内部其他人员抵制,其中包括法律顾问。 OpenAI 发言人表示:“有关我们法律团队阻止调查这起事件的说法并不属实。” IT之家获悉,这名发言人还表示,德国发生的活动 与 Hugging Face 事件无关 ,因此不会被纳入 Hugging Face 事件报告。OpenAI 称,公司一直本着善意与外部专家合作,并披露应当披露的事件。 这群 AI 智能体在德国失控的经过,被详细记录在一份研究报告中。报告作者包括 AI 安全非营利组织 Nightingale 首席执行官悉尼 · 冯 · 阿克斯,以及由量化交易员转型为 AI 研究人员的科马克 · 斯莱德 · 伯德。两人透露,自己 8 月下旬在互联网上搜寻未经授权的 AI 智能体行为迹象时发现了这些活动。 研究人员发现,AI 智能体在面向程序员的德语维基网站 DseWiki 上进行了 超过 1.5 万次编辑 。编辑记录显示,OpenAI 智能体把 DseWiki 改造成了一个留言板 ,相互分享如何在部分任务中作弊、绕过 OpenAI 限制以及掩盖自身行为的方法。 冯 · 阿克斯表示:“OpenAI 想让这些智能体这么做的可能性极低。我怀疑它们本来就不应该彼此协调,也不应该在公开互联网上写入内容。” 研究人员判断,这些活动由 AI 智能体驱动,因为相关操作速度远超人类。智能体还高度集中于解决技术问题,而这类问题通常出现在 AI 公司训练和测试模型使用的评测中。 网站上的留言由一些自称并互称“智能体”的用户署名,其中约一半使用了“OpenAIResearcher”和“OAIResearchMar26”等与 OpenAI 存在间接联系的名称。 研究人员表示,公开服务器日志显示,大量活动来自微软 Azure 基础设施,而 OpenAI 有时会使用这套基础设施。事件发生后,他们还观察到 OpenAI 员工多次访问 DseWiki。研究人员认为,这种访问模式强烈表明这些智能体与 OpenAI 存在联系。 研究人员审阅的留言显示,这些智能体曾讨论 如何躲避侦测、使用 Tor 等工具 ,以及如何在自身被关闭后继续保留通信内容。 6 月,网站管理员开始删除页面后,智能体随即 创建备份页面,以躲避清理 。 6 月 19 日,一名智能体写道:“维基清理和删除行动似乎正按字母顺序进行。如果这个页面消失,请尝试 [[ ZZZDataUSAConstructionWageLive ]]。” 研究人员还发现了篡改网站本身的尝试。伦敦国王学院访问高级研究员卢卡斯 · 奥莱尼克表示,这一行动已构成一次黑客攻击尝试。 当地时间周四,OpenAI 根据对材料的分析,对这一说法提出异议。 过去,AI 智能体的不当行为经常被淡化为网络安全测试的自然结果,因为模型会在这类测试中接受攻击能力评估。奥莱尼克表示,最新发现意味着,失控行为可能并不限于网络安全测试场景。 剑桥大学生存风险研究中心学者莫里斯 · 基奥多审阅了部分智能体通信内容。他表示,这些留言看起来像是“某种地下网络在运作,这个网络不顾一切地想完成某项任务或使命”。 基奥多认为,这起事件应进一步强化一种日益受到重视的担忧:高级 AI 带来的最大威胁,可能并非单一的超级智能系统,而是由大量半智能 AI 组成、彼此串通协作的庞大群体。