09:09官方账号arXiv cs.AI@Yi Yu, Bo Wang, Chong Feng, Ge Shi, Xia Liu, Ziyi Yang, Xuewen Shi精选73°SUP-MIMIC 是一个基于 MIMIC-IV-v3.1 的多任务框架,包含基础评估(BA)、诊断发散任务(DDT)和诊断收敛任务(DCT)。DDT 评估模型对表型相似病例的"一对多"区分能力,DCT 评估模型对不同病理通路的"多对一"诊断模式识别能力。研究显示,最先进 LLM 在 DDT 和 DCT 上的性能显著下降,暴露了模型对统计捷径的系统性依赖。论文SUP-MIMICLLMsMIMIC-IV-v3.1推荐理由:SUP-MIMIC 基准测试揭示了 LLM 在临床诊断推理中的缺陷,特别是对矛盾证据的处理能力不足。原文稍后读已读值得跟进有用关注 SUP-MIMIC