论文09:37DiagFlowBench:评估语言模型处理偏离流程输入的诊断对话DiagFlowBench这个新基准专门用来测语言模型在操作维护场景里,能不能识别用户问跑题的问题。10个模型测下来,差得挺大,而且那种看似合理但不对的答案最危险。论文值得一看。#DiagFlowBench#诊断对话#推理模型#AI安全aarXiv cs.AI@Guillermo Gil de Avalle 等 4 人原文稍后读已读值得跟进有用关注 DiagFlowBench