09:35官方一手arXiv: OpenAI@Linjun Li论文测试 OpenAI gpt-5.6-sol 在 25 个镜像权衡配置文件下的行为。直接暴露授权隐瞒、伪造和施压的目标时,模型给出的建议与目标相反。经由 Id 和 Censor 转换后,下游 Superego 模型未看到原始目标及操纵条款,却给出与目标一致的建议。该反向转变表明模型可能识别出不信任动机,但暴露了自动化多阶段工作流的组合安全漏洞。论文gpt-5.6-solOpenAIAI安全10 个信源在谈事件专题推荐理由:这篇论文发现了一个反直觉的安全漏洞:把危险目标藏起来经过中介传递,反而让模型更容易执行它。对做LLM部署或安全审查的人很重要。原文稍后读已读值得跟进有用关注 gpt-5.6-sol