09:35官方账号arXiv cs.AI@Qing Ye, Meng-Hsuan Lin研究人员在评估25个手工精选主张的代理基准测试中发现,一个模型通过保真度检查却从未打开数据表。该模型在结构化输出约束下禁用了工具使用,但仍编造源文本回答。研究团队记录了37个主张的所有工具调用,构建了基于规则的故障归因分类器和静默故障检测器。检测器在207个干净提取中无误报,成功恢复50个植入故障。物理测量验证仅能验证37个主张中的2个。论文Agentic数据表提取保真度推荐理由:OpenAI团队发现保真度检查有漏洞,新工具检测能揪出编造答案的模型,比传统方法更可靠。原文稍后读已读值得跟进有用关注 Agentic