事件专题 · 多源确认

OpenAI 用模型驱动代理和人工评审审计 SWE-Bench Pro

OpenAI 在审计 SWE-Bench Pro 时部署了模型驱动的调查代理,并搭配五名独立资深软件工程师进行人工复审。该方法在规模化检查任务的同时保持专家判断为核心。审计结果未被详细披露,但流程强调了自动代理与人工协作的可行性。

当前结论

OpenAI 公布了一种审计 SWE-Bench Pro 的新方法,结合模型代理和五名资深工程师的独立评审,适合关注基准测试可靠性和自动审计的朋友。

11 个信源68° AI 热度最后更新 2026/7/8 20:45:49

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情