09:56官方一手arXiv: Anthropic@Musa Shams精选LayerRAG-Bench覆盖8个企业领域、240个任务和9种故障场景,在来自OpenAI、Anthropic和Gemini的9个模型上生成38,880条任务级记录。schema规范化将schema漂移成功率从0.000提升到0.913,但无法修复过期证据、缺失工具输出、权限拒绝和错误会话上下文。仅基于groundedness的评估在过期证据和错误会话下产生大量假阳性。该基准支持按层评估原则:可靠性干预应只对其目标层生效,而非视为通用修复。论文LayerRAG-BenchRAG智能体10 个信源在谈事件专题推荐理由:论文推出了LayerRAG-Bench,用8个领域240个任务测智能体RAG的可靠性陷阱。它告诉你schema规范化只解决一类问题,别指望一个补丁包治百病。原文稍后读已读值得跟进有用关注 LayerRAG-Bench