11:12官方账号arXiv cs.AI@Mengzhu Xu, Jifan Gao, Xia Jiang, Yaoxin Wu, Xi Long研究提出医疗思维链扰动审计方法,对14个LLM在四个医疗问答基准上的测试显示,72.9%的编辑不影响答案,链式腐败不影响准确性,去除CoT提示不降低准确性。临床医生重新标注197个扰动问题,98.5%保持原答案。框架和CDR提供评估医疗思维链是否忠实或仅是文档的标准。论文医疗推理思维链审计LLM评估推荐理由:这篇论文提出了一个评估医疗思维链是否忠实的新方法,对于关注医疗AI的读者来说,这是一个重要的研究进展。原文稍后读已读值得跟进有用关注 医疗推理