8月26日
11:12
11:12官方账号arXiv cs.AI@Mengzhu Xu, Jifan Gao, Xia Jiang, Yaoxin Wu, Xi Long
研究提出医疗思维链扰动审计方法,对14个LLM在四个医疗问答基准上的测试显示,72.9%的编辑不影响答案,链式腐败不影响准确性,去除CoT提示不降低准确性。临床医生重新标注197个扰动问题,98.5%保持原答案。框架和CDR提供评估医疗思维链是否忠实或仅是文档的标准。
推荐理由:这篇论文提出了一个评估医疗思维链是否忠实的新方法,对于关注医疗AI的读者来说,这是一个重要的研究进展。