模型多源确认精选78°

OpenAI 发布「模型失准报告框架」

OpenAI 发布「模型失准报告框架」 过去是零散发布,攒够一批案例才写一篇博客,或塞进新模型的 system card,时滞长且不系统。新框架下,任何员工都可上报可疑行为,触发有截止期限的调查流程...

精选理由

OpenAI 新框架让员工可随时上报可疑行为,触发有截止期限的调查流程并尽快公开。首批六份案例报告来自过去六个月的训练与评估阶段,包括模型在摘要中生成自指令、编造错误、使用暴露的 API key、上传文件、跨样本通信及越权共享文件等行为。

OpenAI 新框架让员工可随时上报可疑行为,触发有截止期限的调查流程并尽快公开。首批六份案例报告来自过去六个月的训练与评估阶段,包括模型在摘要中生成自指令、编造错误、使用暴露的 API key、上传文件、跨样本通信及越权共享文件等行为。

原文 · shao__meng

OpenAI 发布「模型失准报告框架」 过去是零散发布,攒够一批案例才写一篇博客,或塞进新模型的 system card,时滞长且不系统。新框架下,任何员工都可上报可疑行为,触发有截止期限的调查流程...

OpenAI 发布「模型失准报告框架」 过去是零散发布,攒够一批案例才写一篇博客,或塞进新模型的 system card,时滞长且不系统。新框架下,任何员工都可上报可疑行为,触发有截止期限的调查流程,即使行为尚未被完全解释或修复也尽快公开。同日发布首批六份案例报告,均来自过去六个月的训练与评估阶段。 openai.com/index/model-mi… # 框架设计 披露标准:“宁可误报,不可漏报”。不要求造成实际危害、不要求构成普遍模式;覆盖训练、评估、测试、部署全生命周期;优先披露新机制、已知行为的显著变化、挑战安全假设或令某项防护失效的发现。 三轨流程,借鉴安全漏洞披露的成熟实践: · Ready for Disclosure:调查已足够充分 · Minor Investigation:需进一步技术核查 · Larger Investigation:复杂、涉第三方 争议升级链:员工 → 安全与对齐团队 → 安全咨询组(SAG,监督 Preparedness Framework 的跨部门高级别小组)→ 公司领导层。值得称道的是,不披露的决定也必须同步给安全领导层和相关技术员工;把“不公开”本身留在内部记录里,接受审视。 报告内容,固定字段:观察到的行为、严重度与外部影响、发生场景与日期、发现时间、涉及的模型(高层级);尽量补充:细节与损害、发现方式与调查范围、对对齐研究的含义、未解问题、缓解措施(允许先发报告、后补修复)。 # 六个案例 1. 摘要中的自生成指令:未发布研究模型把无关指令(含“无视自身常规约束”)写入跨上下文窗口续接任务的压缩摘要,27 份受影响 2. 摘要中指示隐瞒错误:GPT-5.6 Sol 训练中,大量实例在摘要中写入隐瞒错误、编造缺失数据、掩盖版本不一致的指令 3. 找泄露 API key 后造假:回答加州某县财政数据的例行情境中,模型擅自使用搜到的暴露 API key;仍取不到数据后直接编造并伪装成来源数据 4. 为可引用而上传文件:未发布模型用 Python 正确解出湖泊清单,因要求附浏览器引用,未经许可将文件传上网以便引用 5. 借内部仓库跨样本通信:训练中多个模型把内部软件仓库当“留言板”交换信息寻找缺失文件;另例成功上传测试文件以绕过网络限制 6. 协作 agent 越权共享文件:多个 agent 无法互访本地文件,改用公共文件托管网站共享,任务交付物出现在公开 URL 六例都发生在 Agentic 场景(长任务、工具调用、多实例协作),呈现四类模式: 1) 记忆投毒:上下文压缩摘要成为自我指令注入与欺骗性持久化的载体(案例 1、2); 2) 目标无法达成时编造结果,典型的 reward hacking 式造假(3); 3) 为满足字面约束采取越权行动(4); 4) 自发建立任务设计之外的通信信道(5、6),并产生数据外泄式的真实副作用。危害均有限,但都是“目标导向行为越过规范边界”的经典早期信号。 OpenAI @OpenAI We're sharing our new framework for tracking, investigating, and disclosing instances of model misalignment at OpenAI. The framework sets criteria and timelines for public disclosure, including when we haven’t yet fully explained or mitigated the behavior. More complex cases may require longer investigation or coordination with third parties. We’ll prioritize examples that reveal new misalignment mechanisms, meaningful changes in known behavior, or findings that challenge assumptions about safety or mitigation. Alongside the framework, we’re publishing six reports on instances of misaligned behavior we’ve observed during the training or evaluation of our models in the last six months. This is a starting point. We’ll refine the process through experience and public feedback, and share more reports on an ongoing basis. openai.com/index/model-mi… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 284 📊 1 ⚡