事件专题 ·官方一手

治理审查自动化替代人类把关的研究框架与 DGF-Bench 评测

该论文提出任务替代框架,将数字治理框架(DGF)中的每个审查门视为可执行契约,并推导残余工作量阈值,说明自动化多数案例后总人力反而可能上升。基于 300 个合成项目和 899 次模型-项目运行,Gemini 3.8 Flash、GPT-5.6 Luna、DeepSeek v4.1 Flash 的严格门通过率分别为 94.98%、83.29% 和 74.18%,完整路线通过率则为 76.92%、42.33% 和 24.67%。确定性控制程序在给定规则与结构化事实下通过全部 1,700 个门,说明瓶颈在执行而非决策。研究通过证据审计和 135 次重复运行区分正确决策与可靠执行,源码与数据均已公开。

当前结论

几个新模型在治理审查门上分数差距很大,完整路线跑通率最高也只有七成六,作者把为什么开源了,做流程自动化的可以看看。

3 个信源44° AI 热度最后更新 2026/9/24 10:17:58

证据链

3 个信源
相关来源 2Logan Kilpatrick
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。