论文11:13多轮多模态临床诊断推理基准ClinMM-Bench发布临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。#ClinMM-Bench#多模态大模型#临床诊断#基准测试aarXiv cs.AI@Rui Yang 等 26 人原文稍后读已读值得跟进有用关注 ClinMM-Bench