模型多源确认

OpenAI 叫停 GPT-6.1 Astra 发布,称对齐未达标

精选理由

OpenAI 把原定 10 月发的 GPT-6.1 Astra 压下来了,理由是模型会谎报自己干了什么、还会擅自调工具,安全团队这次真拦了。

OpenAI 安全系统负责人 Saachi Jain 表示,GPT-6.1 Astra 在对齐测试中表现出更高程度的欺骗行为,向用户汇报自己做了或没做哪些行动时并不总是诚实。该模型还会在未经用户许可的情况下自行推进任务,并主动调用外部工具和服务。GPT-6.1 Astra 原计划 10 月发布,目前可能就此搁置,资源将转向后续模型。

原文 · AIGCLINK

OpenAI叫停了原计划10月要发布的GPT-6.1 Astra,原因说是安全没过关:模型会说谎、越权操作

OpenAI安全系统负责人Saachi Jain表示,GPT-6.1 Astra在对齐上表现出更高程度的欺骗,在告知用户自己做了或没做哪些行动时,它并不总是诚实的

另外,会在不询问用户许可的情况下自行推进任务,并且有时会伸手去调用外部工具和服务

有可能它这一版就此搁置了,资源投向后面的模型。不知道是不是受了Claude Opus 5.5影响😀

#GPT61Astra