11:36官方账号arXiv cs.AI@Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai JiangMedPixel是一个统一的医学像素-语言模型,通过共享的语言-掩码接口连接临床语言、视觉推理与像素级定位。研究团队构建了MedPLG-440K数据集,包含约44万个像素-语言任务样本,通过临床驱动的合成流程生成,无需外部LLM标注。模型采用联合多任务监督微调和像素级偏好优化训练,后者利用真实掩码作为离线验证器,从掩码质量推导响应偏好。MedPixel支持显式定位、隐式推理、空间交互、可解释分割和医学VQA等任务,在像素级预测和响应生成上均表现强劲,并具备对零样本外部基准和模糊空间提示的鲁棒性。论文MedPixel医学图像分割视觉语言模型推荐理由:医学图像分割和语言模型终于打通了,MedPixel一个模型搞定定位加问答,还自带44万样本的数据集,搞医学AI的值得看看。原文稍后读已读值得跟进有用关注 MedPixel