7月22日
12:27
12:27官方账号arXiv cs.AI@Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin
PathAgentBench评估视觉语言模型在整张病理切片上的四种能力:跨模态匹配、区域定位、多尺度推理。基准包含1822张TCGA整张切片和17135条诊断路径。在20个模型中,开源模型在多尺度推理上达到93%准确率,但诊断区域定位的IoU低于0.09。自主探索时高倍放大下命中率仅0.020,表明从WSI获取证据仍具挑战。
推荐理由:想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。