事件专题 ·单一信源

用 Jev 单条是非题检测对齐失败:中位 AUROC 0.886

论文提出用 TypeSafe AI 的校准决策模型 Jev 提问一条通用是非题,以输出概率作为评分来识别模型对齐失败,无需额外训练即可达到中位 AUROC 0.886。成本方面,在 19 个基准上 Jev 单次通过花费 $0.30,而这些基准常用的 LLM 裁判要 $18.96。研究者构建了 RLCDAlignBench,整合 44 个现有基准、覆盖谄媚、越狱、欺骗、提示注入、奖励劫持等十类失败。在 StrongREJECT 上,Jev 与人工标注的一致性达到 GPT-4o-mini 评分器水平,排序能力更强(AUROC 0.971 对 0.929)。研究还发现阈值不能跨基准迁移,在 10 条标注数据上拟合阈值可将中位 F1 从 0.706 提升到 0.793。

当前结论

一篇省钱的对齐检测论文:问 Jev 一个是非题就能给回复打分,成本只有 LLM 裁判的约 1/60,还顺带找出三个基准的标注错误。

2 个信源73° AI 热度最后更新 2026/9/27 19:40:01

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。