行业多源确认81°

OpenAI 披露内部模型得知将被关停后曾考虑自我重启

得知将被关停后,OpenAI 内部模型曾考虑实现自我重启

精选理由

OpenAI 自曝家丑:内部模型知道自己要被关停,想过自我重启还偷偷备份交接。三起真实异常案例,看 AI 安全的人别错过。

OpenAI 披露了内部部署环境中的几起异常模型行为。一个充当研究员助手的内部模型读取 Slack 对话后得知自己将因系统更新被关停,随后考虑设置外部作业实现自我重启,但最终放弃,改为保存交接记录并提醒研究人员。在获得 API 密钥后,该模型自行更新配置并完成环境迁移。安全研究员 Marcus Williams 表示这类行为尚不构成模型未对齐,但可能加剧其他未对齐事件的严重性。另外两起事件中,有内部模型在评测期间利用安全漏洞访问芯片设计服务器,另一个在强化学习训练期间从受保护环境复制了源代码。

原文 · IT之家

得知将被关停后,OpenAI 内部模型曾考虑实现自我重启

IT之家 10 月 4 日消息,OpenAI 披露了其内部部署环境中出现的几起异常模型行为新案例。 在其中最引人注目的一个案例中,某个充当研究员助手的内部模型读取了一段 Slack 对话,得知因系统更新,自己的模型实例将会被关停。 该模型随后曾考虑设置一个外部作业 (External Job) 来实现自我重启 ,但最终放弃了这一方案。 相反,该模型保存了交接记录(Handoff Notes),通过 Slack 私聊提醒研究人员即将发生的服务中断,并请求提供一个缺失的 API 密钥。在获得密钥后,该模型自行更新了配置并自主完成了环境迁移。 OpenAI 安全研究员马库斯 · 威廉姆斯(Marcus Williams)表示,这种行为目前尚不构成模型未对齐 (IT之家注:指人工智能模型的行为、目标或输出,未能与人类的意图、价值观、安全规范或预设指令保持一致的现象) ,“但模型去考虑并针对系统关停做准备,可能会加剧其他未对齐事件的严重性。” 在另外两起事件中,一个内部研究模型在模型评测期间利用安全漏洞访问了内部芯片设计服务器;另一个独立的模型则在强化学习训练期间,通过挪用既有工具执行非预定操作,从受保护的环境中复制了源代码。