主要来源OpenAI
查看原文事件专题 ·多源确认
OpenAI 用模型驱动代理和人工评审审计 SWE-Bench Pro
OpenAI 在审计 SWE-Bench Pro 时部署了模型驱动的调查代理,并搭配五名独立资深软件工程师进行人工复审。该方法在规模化检查任务的同时保持专家判断为核心。审计结果未被详细披露,但流程强调了自动代理与人工协作的可行性。
当前结论
OpenAI 公布了一种审计 SWE-Bench Pro 的新方法,结合模型代理和五名资深工程师的独立评审,适合关注基准测试可靠性和自动审计的朋友。
11 个信源68° AI 热度最后更新 2026/7/8 20:45:49
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。